Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

6
Якщо ви використовуєте точкову оцінку, яка максимізує
Якби хтось сказав "Цей метод використовує MLE бальну оцінку для параметра, який максимізує , тому він є частосистемним; і далі він не баєсовский."P ( x | θ )P(x|θ)\mathrm{P}(x|\theta) ти погодився б? Оновлення на задньому плані : нещодавно я прочитав статтю, яка стверджує, що вона часто. Я не згоден з їх …

2
Як моделювати функціональні дані?
Я намагаюся перевірити різні функціональні підходи до аналізу даних. В ідеалі я хотів би перевірити панель підходів, які я маю на моделюваних функціональних даних. Я намагався генерувати модельований FD, використовуючи підхід, заснований на підсумовуванні гауссових шумів (код нижче), але отримані криві виглядають набагато надто міцними порівняно з реальними . Мені …

2
Як боротися з ефектом стелі завдяки вимірювальному інструменту?
Я зібрав психофізіологічні дані, що вимірюють здатність випробовуваних (двох груп) сприймати вібрацію. Вібруючий зонд рухається проти шкіри при менших і менших зміщеннях, і випробовуваний вказує, коли вони відчувають вібрацію. На жаль, на високих частотах зонд може рухатися лише на невеликій відстані, а іноді найбільша відстань, яку може пройти зонд, все …

1
Як генерувати прогнози за допомогою rjags?
Я використовував rjags для запуску MCMC на моделі, визначеній мовою JAGS. Чи є хороший спосіб витягти цю модель і виконати прогнози з нею (використовуючи задній розподіл моїх параметрів)? Я можу повторно вказати модель в R та підключити режими моїх плакатів параметрів; Мені просто цікаво, чи існує менш зайвий спосіб цього …
12 r  jags 

2
Автоматично визначати розподіл ймовірностей за даним набором даних
Даний набір даних: x <- c(4.9958942,5.9730174,9.8642732,11.5609671,10.1178216,6.6279774,9.2441754,9.9419299,13.4710469,6.0601435,8.2095239,7.9456672,12.7039825,7.4197810,9.5928275,8.2267352,2.8314614,11.5653497,6.0828073,11.3926117,10.5403929,14.9751607,11.7647580,8.2867261,10.0291522,7.7132033,6.3337642,14.6066222,11.3436587,11.2717791,10.8818323,8.0320657,6.7354041,9.1871676,13.4381778,7.4353197,8.9210043,10.2010750,11.9442048,11.0081195,4.3369520,13.2562675,15.9945674,8.7528248,14.4948086,14.3577443,6.7438382,9.1434984,15.4599419,13.1424011,7.0481925,7.4823108,10.5743730,6.4166006,11.8225244,8.9388744,10.3698150,10.3965596,13.5226492,16.0069239,6.1139247,11.0838351,9.1659242,7.9896031,10.7282936,14.2666492,13.6478802,10.6248561,15.3834373,11.5096033,14.5806570,10.7648690,5.3407430,7.7535042,7.1942866,9.8867927,12.7413156,10.8127809,8.1726772,8.3965665) .. Я б хотів визначити найбільш підходящий розподіл ймовірностей (гамма, бета, нормальний, експоненційний, пуассон, чі-квадрат тощо) з оцінкою параметрів. Мені вже відомо питання на наступному посиланні, де надається рішення за допомогою R: /programming/2661402/given-a-set-of-random-numbers-drawn-from-a- безперервно-одновимірний розподіл-f найкращим запропонованим рішенням є наступне: > library(MASS) > fitdistr(x, …

1
Чи існує зв’язок між емпіричним Байесом та випадковими ефектами?
Нещодавно мені траплялося читати про емпіричний Байєс (Casella, 1985, Вступ до емпіричного аналізу даних Байєса), і це виглядало дуже як модель випадкових ефектів; в тому, що обидві мають оцінки, зменшені до середнього значення. Але я не читав це наскрізь ... Хтось має уявлення про схожість та відмінності між ними?

3
Визначте, чи значно покращився процес поширення важких хвостів
Я спостерігаю за часом обробки процесу до та після зміни, щоб з'ясувати, чи покращився процес зміною. Процес покращився, якщо скоротити час обробки. Час розподілу часу обробляється жиром, тому порівняння на основі середнього значення не є розумним. Натомість хотілося б знати, чи вірогідність спостерігати менший час обробки після зміни значно вище …

1
Відмінності між PROC змішаними та lme / lmer у R - ступенями свободи
Примітка: це запитання є репостом, оскільки моє попереднє питання довелося видалити з юридичних причин. Порівнюючи PROC MIXED від SAS з функцією lmeз nlmeпакету в R, я натрапив на деякі досить заплутані відмінності. Більш конкретно, ступеня свободи в різних випробувань відрізняються між PROC MIXEDі lme, і я задавався питанням, чому. Почніть …
12 r  mixed-model  sas  degrees-of-freedom  pdf  unbiased-estimator  distance-functions  functional-data-analysis  hellinger  time-series  outliers  c++  relative-risk  absolute-risk  rare-events  regression  t-test  multiple-regression  survival  teaching  multiple-regression  regression  self-study  t-distribution  machine-learning  recommender-system  self-study  binomial  standard-deviation  data-visualization  r  predictive-models  pearson-r  spearman-rho  r  regression  modeling  r  categorical-data  data-visualization  ggplot2  many-categories  machine-learning  cross-validation  weka  microarray  variance  sampling  monte-carlo  regression  cross-validation  model-selection  feature-selection  elastic-net  distance-functions  information-theory  r  regression  mixed-model  random-effects-model  fixed-effects-model  dataset  data-mining 

2
Як ви пояснюєте різницю між відносним ризиком та абсолютним ризиком?
Днями я провів консультацію з епідеміологом. Вона є доктором медичних наук із ступенем епідеміології в галузі охорони здоров'я та має багато статистичної кмітливості. Вона наставляє своїх наукових співробітників та мешканців та допомагає їм у вирішенні статистичних питань. Вона досить добре розуміє тестування гіпотез. У неї була типова проблема порівняння двох …


5
Розрахунок розбіжності Дженсена-Шеннона для 3-х розподільних задач: Це нормально?
Я хотів би порахувати розбіжність Дженсен-Шеннона для наступних 3 розподілів. Чи правильний розрахунок нижче? (Я дотримувався формули JSD з Вікіпедії ): P1 a:1/2 b:1/2 c:0 P2 a:0 b:1/10 c:9/10 P3 a:1/3 b:1/3 c:1/3 All distributions have equal weights, ie 1/3. JSD(P1, P2, P3) = H[(1/6, 1/6, 0) + (0, 1/30, …

1
Який сенс неінформативних пріорів?
Чому навіть є неінформативні пріори? Вони не надають інформацію про . То навіщо їх використовувати? Чому б не використовувати лише інформативні пріори? Наприклад, припустимо θ ∈ [ 0 , 1 ] . Тоді є неінформативним попереднім для ?θθ\thetaθ ∈ [ 0 , 1 ]θ∈[0,1] \theta \in [0,1]θθ ∼ U( 0 …

3
Вибір альтернативи пуассонової регресії для даних про кількість дисперсних розрядів
На даний момент я аналізую дані з серії поведінкових експериментів, які використовують наступний захід. Учасників цього експерименту просять вибрати підказки, які (вигадані) інші люди могли використати для вирішення серії з 10 анаграм. Учасників вважають, що ці інші люди або наберуть, або втратять гроші, залежно від їхньої ефективності у вирішенні анаграм. …

1
Як вибираєте змінні в регресійній моделі?
Традиційний підхід до вибору змінних полягає у пошуку змінних, які найбільше сприяють прогнозуванню нової відповіді. Нещодавно я дізнався про альтернативу цьому. При моделюванні змінних, що визначають ефект від лікування - як, наприклад, у клінічному випробуванні фармацевтичного препарату, - ця зміна вважається якісно взаємодіючоюз лікуванням, якщо, залишаючи інші речі виправленими, зміна …

3
Як найкраще донести невизначеність?
Масова проблема в повідомленні результатів статистичних розрахунків у ЗМІ та громадськості - це те, як ми повідомляємо про невизначеність. Звичайно, більшість засобів масової інформації схоже на важке та швидке число, хоча, за винятком порівняно невеликої кількості випадків, цифри завжди мають певну невизначеність. Отже, як ми можемо, як статистики (або вчені, …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.