Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Перевірка залишків на нормальність в узагальнених лінійних моделях
У цій роботі використовуються узагальнені лінійні моделі (як біноміальні, так і негативні розподіли біноміальних помилок) для аналізу даних. Але потім у розділі статистичного аналізу методів є таке твердження: ... і по-друге, моделюючи дані про наявність за допомогою моделей логістичної регресії та дані про час збирання за допомогою узагальненої лінійної моделі …

1
Якщо розподіл тестової статистики є бімодальним, чи значення p означає щось?
Р-значення визначається ймовірністю отримання тестової статистики принаймні такою ж крайньою, як і те, що спостерігається, якщо вважати, що нульова гіпотеза є істинною. Іншими словами, П( X≥ t | Н0)П(Х≥т|Н0)P( X \ge t | H_0 ) Але що робити, якщо тестова статистика має бімодальний розподіл? чи значення p означає щось у …

3
Чи краще вибирати дистрибуції на основі теорії, підходи чи чогось іншого?
Це межує з філософським питанням, але мене цікавить, як інші з більшим досвідом думають про вибір розподілу. У деяких випадках здається очевидним, що теорія може працювати найкраще (довжина хвоста мишей, ймовірно, нормально розподілена). У багатьох випадках, мабуть, немає теорії для опису набору даних, тож ви просто використовуєте щось, що відповідає …

1
Клопер-Пірсон для не математиків
Мені було цікаво, чи може хтось пояснити мені інтуїцію поза межами CI Clopper-Pearson за пропорціями. Наскільки мені відомо, кожна CI включає в неї дисперсію. Однак для пропорцій, навіть якщо моя частка дорівнює 0 або 1 (0% або 100%), CI Clopper-Pearson можна розрахувати. Я спробував розглянути формули, і я розумію, що …


2
Ідентифікація марних питань із анкети
Я розробляю анкету. Для підвищення його надійності та обґрунтованості я хочу використовувати статистичні методи. Я хочу усунути питання, відповіді яких завжди однакові. Це означає, що майже всі учасники дали однакові відповіді на ці питання. Тепер мої запитання: Який технічний термін для таких марних питань, відповіді яких завжди однакові, незалежно від …

4
Оцінка щільності ядра, що включає невизначеності
Під час візуалізації одновимірних даних звичайно використовувати техніку оцінки щільності ядра для врахування неправильно вибраних ширини відрізка. Коли мій одномірний набір даних має невизначеність вимірювань, чи існує стандартний спосіб включення цієї інформації? Наприклад (і вибачте мене, якщо моє розуміння не є наївним) KDE поєднує профіль Гаусса з дельта-функціями спостережень. Це …

1
Проблема в пошуку хорошої моделі, підходить для підрахунку даних зі змішаними ефектами - ZINB чи щось інше?
У мене дуже мало набору даних про величину одиночних бджіл, які у мене виникають проблеми з аналізом. Це дані підрахунку, і майже всі підрахунки знаходяться в одній обробці з більшістю нулів в іншій обробці. Також є пара дуже високих значень (по одному на два з шести ділянок), тому розподіл підрахунків …

4
Чи можете ви порівняти різні методи кластеризації на наборі даних без основної істини шляхом перехресної перевірки?
На даний момент я намагаюся проаналізувати набір даних текстових документів, які не мають основної істини. Мені сказали, що ви можете використовувати k-кратну перехресну перевірку для порівняння різних методів кластеризації. Однак у прикладах, які я бачив у минулому, використовується основна правда. Чи можна використовувати засоби k-fold на цьому наборі даних для …

1
Інверсія ягід
У мене є велика сукупна ринкова інформація про продажі вина в США, і я хотів би оцінити попит на певні вина високої якості. Ці частки ринку в основному були отримані з випадкової корисної моделі форми Ui j t= X'j tβ- α рj t+ ξj t+ ϵij t≡ δjt+ ϵj tUijт=Хjт'β-αpjт+ξjт+ϵijт≡δjт+ϵjтU_{ijt} …

1
Обчисліть ймовірність журналу "вручну" для узагальненої нелінійної регресії найменших квадратів (nlme)
Я намагаюся обчислити ймовірність журналу для узагальненої нелінійної регресії найменших квадратів для функції оптимізована функціонують у пакеті R , використовуючи дисперсійну коваріаційну матрицю, породжену відстанями на філогенетичному дереві, припускаючи броунівський рух ( від пакета). Наступний відтворюваний код R підходить для моделі gnls з використанням даних x, y та випадкового дерева …

2
Статистика піци для мас
Короткий запис на веб-сайті NY Times містить факти та цифри споживання піци в Сполучених Штатах. У мене випадковий інтерес до того, як статистику використовують (або зловживають) для надання інформації загальній аудиторії, і на основі поданих статистичних даних виникло кілька питань: Якщо сьогодні один із 8 американців їсть піцу, чи це …

4
Припущення щодо регресійного залишкового розподілу
Чому необхідно розміщувати припущення про розподіл на помилках, тобто yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , приϵi∼N(0,σ2)ϵi∼N(0,σ2)\epsilon_{i} \sim \mathcal{N}(0,\sigma^{2}) . Чому б не написати yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} зуi∼ N( Xβ^, σ2)yi∼N(Xβ^,σ2)y_i \sim \mathcal{N}(X\hat{\beta},\sigma^{2}) , де в будь-якому випадку ϵi= уi- у^ϵi=yi−y^\epsilon_i = y_i - \hat{y} . Я бачив, як …

1
Моделювання, коли залежна змінна має "межування"
Вибачте заздалегідь, якщо будь-яка термінологія, яку я використовую, є невірною. Я вітаю будь-які виправлення. Якщо те, що я характеризую як "відсікання", має інше ім'я, дайте мені знати, і я можу оновити питання. Мене цікавить ситуація така: у вас є незалежні змінні і одна залежна змінна . Я залишу це розпливчастим, …

3
Як перетворити лептокуртичний розподіл у нормальність?
Припустимо, у мене лептокуртична змінна, яку я хотів би перетворити на нормальність. Які перетворення можуть виконати це завдання? Я добре усвідомлюю, що перетворення даних може бути не завжди бажаним, але, мабуть, як академічне прагнення, я хочу "забити" дані в нормальність. Крім того, як ви можете зрозуміти з сюжету, всі значення …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.