Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Порівняння AIC моделі та її перетвореної на журнал версії
Суть мого питання полягає в наступному: Нехай - багатоваріантна нормальна випадкова величина із середнім та матрицею коваріації . Нехай , тобто . Як я порівняю AIC моделі, придатної до спостережуваних реалізацій порівняно з моделлю, придатною до спостережуваних реалізацій ?Y∈RnY∈RnY \in \mathbb{R}^nμμ\muΣΣ\SigmaZ:=log(Y)Z:=log⁡(Y)Z := \log(Y)Zi=log(Yi),i∈{1,…,n}Zi=log⁡(Yi),i∈{1,…,n}Z_i = \log(Y_i), i \in \{1,\ldots,n\}YYYZZZ Моє початкове …

1
Різниця між багатовимірним стандартним нормальним розподілом та гауссова копула
Мені цікаво, в чому різниця між багатоваріантним стандартним нормальним розподілом і гауссова копула, оскільки коли я дивлюсь на функцію щільності, вони здаються мені однаковими. Моє питання полягає в тому, чому вводиться копула Гаусса або яка користь приносить копула Гаусса або яка її перевага в тому випадку, коли копула Гаусса - …

1
Як зрозуміти ефект RBF SVM
Як я можу зрозуміти, що робить ядро ​​RBF у SVM? Я маю на увазі, що я розумію математику, але чи є спосіб зрозуміти, коли це ядро ​​стане корисним? Чи будуть результати від kNN пов'язані зі SVM / RBF, оскільки RBF містить векторні відстані? Чи є спосіб отримати відчуття ядра полінома? …
17 svm  kernel-trick 

2
Як я можу обчислити дисперсію оцінювача OLS
Я знаю, що β0^=y¯−β1^x¯β0^=y¯−β1^x¯\hat{\beta_0}=\bar{y}-\hat{\beta_1}\bar{x} і ось як я дістався під час обчислення дисперсії: Var(β0^)=Var(y¯−β1^x¯)=Var((−x¯)β1^+y¯)=Var((−x¯)β1^)+Var(y¯)=(−x¯)2Var(β1^)+0=(x¯)2Var(β1^)+0=σ2(x¯)2∑i=1n(xi−x¯)2Var(β0^)=Var(y¯−β1^x¯)=Var((−x¯)β1^+y¯)=Var((−x¯)β1^)+Var(y¯)=(−x¯)2Var(β1^)+0=(x¯)2Var(β1^)+0=σ2(x¯)2∑i=1n(xi−x¯)2\begin{align*} Var(\hat{\beta_0}) &= Var(\bar{y} - \hat{\beta_1}\bar{x}) \\ &= Var((-\bar{x})\hat{\beta_1}+\bar{y}) \\ &= Var((-\bar{x})\hat{\beta_1})+Var(\bar{y}) \\ &= (-\bar{x})^2 Var(\hat{\beta_1}) + 0 \\ &= (\bar{x})^2 Var(\hat{\beta_1}) + 0 \\ &= \frac{\sigma^2 (\bar{x})^2}{\displaystyle\sum\limits_{i=1}^n (x_i - \bar{x})^2} \end{align*} але це так далеко, як …

1
Коли Naive Bayes працює краще, ніж SVM?
У невеликій проблемі класифікації тексту, яку я розглядав, Naive Bayes демонстрував виставу, схожу на SVM або більше, і я дуже розгубився. Мені було цікаво, які фактори визначають тріумф одного алгоритму над іншим. Чи бувають ситуації, коли немає сенсу використовувати Naive Bayes над SVM? Чи може хтось пролити на це світло?

4
Хороші ресурси (онлайн або книга) про математичні основи статистики
Перш ніж я поставити своє запитання, дозвольте трохи ознайомитись із тим, що я знаю про статистику, щоб ви краще розуміли типи ресурсів, які я шукаю. Я аспірант з психології, і як такий я майже кожен день використовую статистику. На сьогоднішній день я знайомий з досить широким спектром методів, здебільшого, оскільки …

4
За яких умов збігаються байєсівські та частолістські оцінки точок?
З плоским попереднім оцінкою збігаються оцінки ML (частість - максимальна ймовірність) та MAP (байєсівський - максимум a posteriori). Однак у більш загальному плані я говорю про оцінки точок, отримані як оптимізатори певної функції втрат. Тобто (Bayesian) х (x^(.)=argminE(L(X−x^(y))|y) (Bayesian) x^(.)=argminE(L(X−x^(y))|y) (Bayesian) \hat x(\,. ) = \text{argmin} \; \mathbb{E} \left( L(X-\hat …

4
Що означає "ступінь свободи" в нейронних мережах?
У книзі Бішопа «Класифікація візерунків та машинне навчання» він описує техніку регуляризації в контексті нейронних мереж. Однак я не розумію абзац, що описує, що під час тренувального процесу кількість ступенів свободи збільшується разом зі складністю моделі. Відповідна цитата: Альтернативою регуляризації як способу контролю ефективної складності мережі є процедура раннього припинення. …

4
Як виконати ANCOVA в R
Я хочу провести ANCOVA аналіз даних щодо щільності рослинних епіфітів. Спочатку я хотів би знати, чи є різниця в щільності рослин між двома схилами, одним N і одним S, але у мене є інші дані, такі як висота, відкритість навісу та висота рослини-господаря. Я знаю, що моїм коваріатом повинні були …
17 r  ancova 

1
Зважена варіація, ще один раз
Неупереджена зважена дисперсія вже була розглянута тут і в інших місцях, але все ще здається, що це дивовижна сум'яття. Здається, існує консенсус щодо формули, представленої у першому посиланні, а також у статті Вікіпедії . Це також виглядає як формула, яку використовують R, Mathematica та GSL (але не MATLAB). Однак стаття …

3
Що було б наочним малюнком для лінійних змішаних моделей?
Скажіть, що ви перебуваєте в бібліотеці вашого відділу статистики, і ви натрапили на книгу із наступним малюнком на головній сторінці. Ви, мабуть, подумаєте, що це книга про речі з лінійною регресією. Якою була б картина, яка змусила б задуматися про лінійні змішані моделі?

1
Я хочу побудувати індекс злочинності та індекс політичної нестабільності на основі новин
У мене є цей побічний проект, де я переглядаю веб-сайти місцевих новин у своїй країні і хочу створити індекс злочинності та індекс політичної нестабільності. Я вже висвітлював інформаційно-пошукову частину проекту. Мій план: Непідконтрольне вилучення теми. Виявлення дублікатів поблизу. Контрольована класифікація та рівень інцидентів (злочинність / політичний - високий / середній …

3
Використання нейронної мережі для торгівлі на біржі
Я пірнув у поле нейронних мереж і захопився ними. Нарешті я розробив прикладну систему для тестування торговельних систем на біржах, і тепер я збираюся реалізувати свою першу нейронну мережу в ній. Дуже простий і примітивний, не призначений для реальної торгівлі, а лише для початківців. Я хочу лише знати, чи хороший …

1
pdf добутку двох незалежних випадкових величин, нормальної та чі-квадратної
що таке pdf добутку двох незалежних випадкових величин X і Y, якщо X і Y незалежні? X нормально розподілений, а Y розподілений у квадраті. Z = XY якщо XXX має нормальний розподіл X∼N(μx,σ2x)X∼N(μx,σx2)X\sim N(\mu_x,\sigma_x^2) fX(x)=1σx2π−−√e−12(x−μxσx)2fX(x)=1σx2πe−12(x−μxσx)2f_X(x)={1\over\sigma_x\sqrt{2\pi}}e^{-{1\over2}({x-\mu_x\over\sigma_x})^2} іYYYмає розподіл Chi-квадрата зkkkступенем свободи Y∼χ2kY∼χk2Y\sim \chi_k^2 fY(y)=y(k/2)−1e−y/22k/2Γ(k2)u(y)fY(y)=y(k/2)−1e−y/22k/2Γ(k2)u(y)f_Y(y)={y^{(k/2)-1}e^{-y/2}\over{2^{k/2}\Gamma({k\over2})}}u(y) whreu(y)u(y)u(y)- функція одиничного кроку. Тепер, що таке …

2
Чи є посібник зі стилів для статистичних графіків, призначених для презентацій?
Я шукаю поради / ресурси / рекомендації щодо найкращого форматування графіків для презентацій. З досвіду я знаю, що графік, виготовлений для друкованої публікації, не дуже «масштабує», коли відображається на ньому променем. Текст часто занадто малий, рядки недостатньо товсті тощо. Практично завжди погана ідея взяти файл .eps / .pdf і засунути …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.