Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
R прогнозування часових рядів за допомогою нейронної мережі, auto.arima та ets
Я чула трохи про використання нейронних мереж для прогнозування часових рядів. Як я можу порівняти, який метод прогнозування моїх часових рядів (щоденні дані роздрібної торгівлі) кращий: auto.arima (x), ets (x) або nnetar (x). Я можу порівняти auto.arima з ets за AIC або BIC. Але як я можу порівняти їх з …

1
Оцінка ефективності регресійної моделі за допомогою навчальних і тестових наборів?
Я часто чую про оцінку ефективності класифікаційної моделі, проводячи тестовий набір і треную модель на навчальному наборі. Потім створимо 2 вектори, один для передбачуваних значень і один для справжніх значень. Очевидно, що порівняння дозволяє судити про ефективність моделі за її прогнозованою силою, використовуючи такі речі, як F-Score, Kappa Statistic, Precision …

1
Підходи Байєсіана та Фішера до лінійного дискримінантного аналізу
Я знаю 2 підходи до виконання LDA, байєсівський підхід і підхід Фішера . Припустимо, ми маємо дані , де - -вимірний предиктор, а - залежна змінна класів.(x,y)(x,y)(x,y)xxxpppyyyKKK За байєсівським підходом ми обчислюємо задній , і сказано в книгах, припустимо, є Гауссом, тепер у нас є дискримінантна функція для го класу …

1
Як ви повідомляєте про тест Манна – Вітні?
Я займаюся дисертацією, і я проводжу ряд тестів. Після використання тесту Крускала – Уолліса я зазвичай повідомляю результат так: Існує значна різниця між засобами ...(χ2(2)=7.448,p=.024)(χ(2)2=7.448,p=.024)(\chi^2_{(2)}=7.448, p=.024) Але зараз я провів тест Манна – Уїтні, і я не впевнений, які цінності подати. SPSS дає мені значення Mann – Whitney , Wilcoxon …

4
Як t-тест може бути статистично значущим, якщо середня різниця майже дорівнює 0?
Я намагаюся порівняти дані двох груп населення, щоб визначити, чи різниця між методами лікування є статистично значущою. Здається, набори даних зазвичай розподіляються з дуже невеликою різницею між двома наборами. Середня різниця - 0,00017. Я провів парний t-тест, очікуючи, що я не зможу відкинути нульову гіпотезу про різницю між засобами, однак, …

2
Навіщо використовувати Bonferroni над Holm-Bonferroni?
Я можу зрозуміти, чому ви можете не використовувати більш потужний метод, такий як метод Гохберга, для корекції Бонферроні, оскільки вони можуть мати додаткові припущення, такі як незалежність гіпотез у цьому випадку, але я не розумію, чому ви б коли-небудь використовувати корекцію Бонферроні для послідовно відхиляючої модифікації Холма, оскільки остання є …

1
Чому ( цензурується)
У наборі проблем я довів цю "лему", результат якої для мене не інтуїтивно зрозумілий. - це звичайний нормальний розподіл в цензурованій моделі.ZZZ Формально і . Тоді Отже, існує певний зв'язок між формулою очікування над усіченою областю та щільністю в точці усікання . Хтось може пояснити інтуїцію за цим?Z∗∼Norm(0,σ2)Z∗∼Norm(0,σ2)Z^* \sim Norm(0, …

1
Пристосований розподіл до просторових даних
Перехресно розміщуючи моє запитання від mathoverflow, щоб знайти конкретну допомогу щодо статистики. Я вивчаю фізичний процес, генеруючи дані, які чітко проектуються у два виміри з негативними значеннями. Кожен процес має (проектовану) доріжку з - точок - див. Зображення нижче.xxxyyy Зразки доріжок синього кольору, клопіткий тип доріжки був намальований зеленим кольором, …

2
Яка хороша аналогія для ілюстрації сильних сторін ієрархічних байесівських моделей?
Я відносно новачок байєсівської статистики і останнім часом використовую JAGS для побудови ієрархічних байєсівських моделей на різних наборах даних. Хоча я дуже задоволений результатами (порівняно зі стандартними GLM-моделями), мені потрібно пояснити нестатистам, у чому різниця від стандартних статистичних моделей. Особливо, я хотів би проілюструвати, чому і коли HBM працюють краще, …

3
Поняття "доведено статистично"
Коли новини розповідають про речі, які «підтверджені статистично», чи правильно вони використовують чітко визначену концепцію статистики, неправильно її використовують, або просто використовують оксиморон? Я думаю, що "статистичний доказ" насправді не є чимось виконаним для доказу гіпотези, ні математичним доказом, а більше "статистичним тестом".
10 inference  proof 

2
Що стосується t-випробування однієї вибірки, що відбувається, якщо в оцінці дисперсії середнє значення вибірки замінено на
Припустимо однопробний t-тест, де нульова гіпотеза . Тоді статистика t = ¯ x - μ 0μ=μ0μ=μ0\mu=\mu_0 використанням стандартного відхилення вибіркиs. Оцінюючиs, можна порівняти спостереження із середньою вибіркою¯x:t = x¯¯¯- мк0с / н√t=x¯−μ0s/nt=\frac{\overline{x}-\mu_0}{s/\sqrt{n}}сssсssх¯¯¯x¯\overline{x} .s = 1n - 1∑нi = 1( хi- х¯¯¯)2---------------√s=1n−1∑i=1n(xi−x¯)2s=\sqrt{\frac{1}{n-1}\sum_{i=1}^n (x_i-\overline{x})^2} Однак, якщо вважати, що заданий є істинним, можна …


1
У чому полягає принципова відмінність цих двох регресійних моделей?
Припустимо, у мене є біваріантні відповіді зі значною кореляцією. Я намагаюся порівняти два способи моделювання цих результатів. Один із способів полягає в моделюванні різниці між двома результатами: Іншим способом є використання або моделювання їх: (yi2−yi1=β0+X′β)(yi2−yi1=β0+X′β)(y_{i2}-y_{i1}=\beta_0+X'\beta)glsgee(yij=β0+time+X′β)(yij=β0+time+X′β)(y_{ij}=\beta_0+\text{time}+X'\beta) Ось foo приклад: #create foo data frame require(mvtnorm) require(reshape) set.seed(123456) sigma <- matrix(c(4,2,2,3), ncol=2) y …

1
Порівняння CPH, моделі прискореного часу відмови або нейронних мереж для аналізу виживання
Я новачок в аналізі виживання, і нещодавно я дізнався, що існують різні способи зробити це з огляду на певну мету. Мене цікавить реальна реалізація та доцільність цих методів. Мені було представлено традиційні моделі коксо-пропорційного ризику , моделі прискореного відмови та нейронні мережі (багатошаровий перцептрон) як методи для виживання пацієнта з …

2
Чи є причина залишити рішення про аналіз дослідницьких факторів нерозгляненим?
Чи є якісь причини, щоб не повертати рішення дослідницького аналізу факторів? Легко знайти дискусії, порівнюючи ортогональні рішення з косими рішеннями, і я думаю, що я цілком розумію все це. Крім того, з того, що мені вдалося знайти в підручниках, автори зазвичай йдуть правильно від пояснення методів оцінки факторного аналізу до …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.