Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Найкращий спосіб поставити дві гістограми в одному масштабі?
Скажімо, у мене є два розподіли, які я хочу детально порівняти, тобто таким чином, щоб форма, масштаб і зсув були легко видимими. Один з хороших способів зробити це - побудувати гістограму для кожного розподілу, помістити їх у ту саму шкалу X і скласти одну під іншу. Як це робити, як …

6
Швидкі способи R отримати перший ряд кадру даних, згрупований за ідентифікатором [закритий]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 2 роки тому . Іноді мені потрібно отримати лише перший рядок набору даних, згрупований за ідентифікатором, як при пошуку віку та статі, коли на кожного людини …
14 r  dataset  aggregation  plyr 

2
Методи злиття / зменшення категорій у порядкових або номінальних даних?
Я намагаюся знайти спосіб зменшення кількості категорій у номінальних чи порядкових даних. Наприклад, скажімо, що я хочу побудувати регресійну модель на наборі даних, яка має ряд номінальних та порядкових факторів. Хоча у мене немає проблем з цим кроком, я часто стикаюся з ситуаціями, коли номінальна функція не має спостережень у …

4
Чи можу я змінити розповсюдження пропозицій у MH MCMC з випадковим ходом, не впливаючи на марковіанство?
Випадкова прогулянка Метрополіс-Хасітінгс із симетричною пропозицією q( х | у) = g( | у- х | )q(х|у)=г(|у-х|)q(x|y)= g(|y-x|) має властивість, що ймовірність прийняття П( a c c e p t y ) = хв { 1 , f( у) / ф( x ) }П(аccеpт у)=хв{1,f(у)/f(х)}P(accept\ y) = \min\{1, f(y)/f(x)\} не …

1
Яке очікуване значення модифікованого розподілу Діріхле? (проблема інтеграції)
Зробити випадкову змінну з розподілом Діріхле легко, використовуючи гамма-змінні з тим же параметром масштабу. Якщо: Xi∼Gamma(αi,β)Xi∼Gamma(αi,β) X_i \sim \text{Gamma}(\alpha_i, \beta) Потім: (X1∑jXj,…,Xn∑jXj)∼Dirichlet(α1,…,αn)(X1∑jXj,…,Xn∑jXj)∼Dirichlet(α1,…,αn) \left(\frac{X_1}{\sum_j X_j},\; \ldots\; , \frac{X_n}{\sum_j X_j}\right) \sim \text{Dirichlet}(\alpha_1,\;\ldots\;,\alpha_n) Проблема Що станеться, якщо параметри шкали не рівні? Xi∼Gamma(αi,βi)Xi∼Gamma(αi,βi) X_i \sim \text{Gamma}(\alpha_i, \beta_i) Тоді в якому розподілі ця змінна? (X1∑jXj,…,Xn∑jXj)∼?(X1∑jXj,…,Xn∑jXj)∼? …

3
Навчання ваг на машині Больцмана
Я намагаюся зрозуміти, як працюють машини Boltzmann, але я не зовсім впевнений, як вивчають ваги, і не зміг знайти чіткого опису. Чи правильно таке? (Також вказівки на будь-які хороші пояснення Болцмана також будуть чудовими.) У нас є набір видимих ​​одиниць (наприклад, відповідних чорним / білим пікселям на зображенню) та набір …

2
Обчислення p-значення від довільного розподілу
Я сподіваюся, це не дурне питання. Скажімо, у мене є якийсь довільний безперервний розподіл. У мене також є статистика, і я хотів би скористатися цим довільним розподілом, щоб отримати значення р для цієї статистики. Я усвідомлюю, що в R легко зробити це до тих пір, поки ваш дистрибутив відповідає одному …

4
Ресурси для навчання використовувати (/ створювати) динамічну (/ інтерактивну) статистичну візуалізацію
Мені хотілося б дізнатися трохи більше про інтерактивну візуалізацію даних (масштабування, вказівка, чистка, точкове відображення тощо). Я бажаю будь-якого: Підручник / путівник / книга (?) / Відео про те, як використовувати такі методи для статистичного дослідження. Покажчики на хороші / цікаві інтерактивні пакети даних (в R та поза ним) Тільки …

2
Зрозуміла ступінчаста регресія?
Припустимо, я хочу створити двійковий класифікатор. У мене є кілька тисяч особливостей і лише кілька 10-ти зразків. На основі знань про домен, я маю вагомі підстави вважати, що мітку класу можна точно передбачити, використовуючи лише декілька функцій, але я не маю уявлення, які з них. Я також хочу, щоб правило …

3
Чи правильно аналізувати дані виявлення сигналу без використання метрик, отриманих з теорії виявлення сигналу?
Експеримент з виявлення сигналу, як правило, представляє спостерігачеві (або діагностичній системі) сигнал або несигнал, і спостерігача пропонують повідомити, чи вважають вони, що представлений елемент є сигналом чи несигналом. Такі експерименти дають дані, які заповнюють матрицю 2x2: Теорія виявлення сигналів являє собою такі дані, що представляють сценарій, коли рішення "сигнал / …

3
Видалення факторів із тривимірної таблиці ANOVA
У нещодавньому документі я помістив тристоронні моделі з фіксованими ефектами. Оскільки один із факторів був несуттєвим (p> 0,1), я його усунув і перевстановив модель з двома фіксованими ефектами та взаємодією. Я щойно мав коментарі арбітрів назад, цитую: Цей час не був суттєвим фактором, коли тривимірний ANOVA сам по собі не …

2
Інтерпретація виводу drop1 у R
У R drop1команда виводить щось акуратне. Ці дві команди мають отримати вихід: example(step)#-> swiss drop1(lm1, test="F") Моя виглядає так: > drop1(lm1, test="F") Single term deletions Model: Fertility ~ Agriculture + Examination + Education + Catholic + Infant.Mortality Df Sum of Sq RSS AIC F value Pr(F) <none> 2105.0 190.69 Agriculture …

5
Реверсивний код стрибка MCMC (Matlab або R)
Хтось знає якийсь добре написаний код (у Matlab або R) для оборотного стрибка MCMC? Переважно простий демонстраційний додаток для компліментарних робіт на цю тему, що було б корисно для розуміння процесу.
14 r  matlab  references  mcmc 

6
Чим відрізняється ефективність та ефективність у визначенні переваги терапії «А» за умови «В»?
Контекст цього питання знаходиться в межах здоров'я, тобто розглядає одну або кілька методів терапії при лікуванні стану. Схоже, навіть шановані дослідники плутають терміни ефективність та ефективність , використовуючи терміни взаємозамінно. Як можна думати про ефективність та ефективність таким чином, що може допомогти зняти плутанину? Який тип проектів дослідження був би …

4
Чи існують асимптотики третього порядку?
Більшість асимптотичних результатів статистики доводять, що як оцінювач (такий як MLE) переходить до нормального розподілу на основі тейлорного розширення функції ймовірності другого порядку. Я вважаю, що подібний результат є в байєсівській літературі, "Байєсівській теоремі про граничну границю", яка показує, що задній зближується асимптотично до норми, якn→∞n→∞n \rightarrow \inftyn→∞n→∞n \rightarrow \infty …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.