Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Підводні камені, яких слід уникати при перетворенні даних?
Я домігся сильної лінійної залежності між моєю змінною XXX та YYY після подвійного перетворення відповіді. Модель була Y∼XY∼XY\sim X але я перетворив її на YX−−√∼X−−√YX∼X\sqrt{\frac{Y}{X}}\sim \sqrt{X} покращуючиR2R2R^2від .19 до .76. Зрозуміло, що я зробив деякі пристойні операції з цього приводу. Чи може хтось обговорити дефекти цього, наприклад, небезпеки надмірних перетворень …

2
Чи правомірними є висновки розподілу вибірки?
Деякі байєзці нападають на часті виводи, заявляючи, що "не існує унікального розподілу вибірки", оскільки це залежить від намірів дослідника (Kruschke, Aguinis, & Joo, 2012, p. 733). Наприклад, скажімо, дослідник розпочинає збір даних, але його фінансування було несподівано скорочено після 40 учасників. Як би тут було визначено вибіркові розподіли (та наступні …

1
Як досягти суворо позитивних прогнозів?
Я працюю над тимчасовим рядом, значення якого суворо позитивні . Працюючи з різними моделями, включаючи AR, MA, ARMA тощо, я не зміг знайти простий спосіб досягти суто позитивних прогнозів. Я використовую R, щоб робити свої прогнози, і все, що я міг знайти, було прогнозувати.hts {hts}, який має позитивний параметр, описаний …

2
Оцінка ARIMA вручну
Я намагаюся зрозуміти, як оцінюються параметри в моделюванні ARIMA / Box Jenkins (BJ). На жаль, жодна з книг, з якими я стикався, не детально описує процедуру оцінки, таку як процедура оцінки вірогідності. Я знайшов веб-сайт / навчальний матеріал, який був дуже корисним. Далі йде рівняння з джерела, на яке згадувалося …


1
Яка інтуїція за обмінними зразками під нульовою гіпотезою?
Перестановочні тести (також називаються тестом рандомизації, тестом на повторну рандомізацію або точним тестом) дуже корисні і корисні, коли припущення про нормальний розподіл, необхідне, наприклад, t-testне виконується, і при перетворенні значень за ранжуванням непараметричний тест, як-от Mann-Whitney-U-test, призведе до втрати більше інформації. Однак одне і єдине припущення не слід оминути увагою …
15 hypothesis-testing  permutation-test  exchangeability  r  statistical-significance  loess  data-visualization  normal-distribution  pdf  ggplot2  kernel-smoothing  probability  self-study  expected-value  normal-distribution  prior  correlation  time-series  regression  heteroscedasticity  estimation  estimators  fisher-information  data-visualization  repeated-measures  binary-data  panel-data  mathematical-statistics  coefficient-of-variation  normal-distribution  order-statistics  regression  machine-learning  one-class  probability  estimators  forecasting  prediction  validation  finance  measurement-error  variance  mean  spatial  monte-carlo  data-visualization  boxplot  sampling  uniform  chi-squared  goodness-of-fit  probability  mixture  theory  gaussian-mixture  regression  statistical-significance  p-value  bootstrap  regression  multicollinearity  correlation  r  poisson-distribution  survival  regression  categorical-data  ordinal-data  ordered-logit  regression  interaction  time-series  machine-learning  forecasting  cross-validation  binomial  multiple-comparisons  simulation  false-discovery-rate  r  clustering  frequency  wilcoxon-mann-whitney  wilcoxon-signed-rank  r  svm  t-test  missing-data  excel  r  numerical-integration  r  random-variable  lme4-nlme  mixed-model  weighted-regression  power-law  errors-in-variables  machine-learning  classification  entropy  information-theory  mutual-information 

4
Як мені здійснити регресію щодо ненормативних даних, які залишаються ненормальними при трансформації?
У мене є деякі дані (158 випадків), які були отримані з відповіді за шкалою Лікерта на 21 пункт анкети. Мені дуже хочеться / потрібно провести регресійний аналіз, щоб побачити, які елементи в анкеті прогнозують відповідь на загальний предмет (задоволення). Відповіді зазвичай не поширюються (згідно з тестами на KS), і я …

3
Розуміння теорії d-поділу в причинних байєсівських мережах
Я намагаюся зрозуміти логіку d-розділення в причинних байєсівських мережах. Я знаю, як працює алгоритм, але я не точно розумію, чому працює "потік інформації", як зазначено в алгоритмі. Наприклад, на графіку вище, давайте подумаємо, що нам задано лише X, а іншої змінної не спостерігається. Тоді, згідно з правилами d-поділу, потік інформації …

1
Як зрозуміти формулу коефіцієнта кореляції?
Чи може хто-небудь допомогти мені зрозуміти формулу кореляції Пірсона? зразок rrr = середнє з продуктів стандартних оцінок змінних XXX і YYY . Я начебто розумію, чому їм потрібно стандартизувати XXX і YYY , але як зрозуміти продукти обох результатів z? Ця формула також називається "коефіцієнт кореляції продукту-моменту", але яка обгрунтування …

1
Чому квадрат chi використовується при створенні інтервалу довіри для дисперсії?
Це дуже основне питання. Чому ми використовуємо розподіл квадратних чі? У чому сенс цього розподілу? Чому саме цей розподіл використовується для створення довірчого інтервалу для дисперсії? Кожне місце, де я шукаю Google для пояснення, просто представляє це факт, пояснюючи, коли потрібно використовувати чі, але не пояснюючи, чому потрібно використовувати чі, …

1
Інтерпретація змінних графіків трасування LASSO
Я новачок у glmnetпакеті, і досі не знаю, як інтерпретувати результати. Може хто-небудь, будь ласка, допоможе мені прочитати наступний сюжетний сюжет? Графік отримували, виконавши наступне: library(glmnet) return <- matrix(ret.ff.zoo[which(index(ret.ff.zoo)==beta.df$date[2]), ]) data <- matrix(unlist(beta.df[which(beta.df$date==beta.df$date[2]), ][ ,-1]), ncol=num.factors) model <- cv.glmnet(data, return, standardize=TRUE) op <- par(mfrow=c(1, 2)) plot(model$glmnet.fit, "norm", label=TRUE) plot(model$glmnet.fit, "lambda", …

2
Плоскі, кон'юговані та гіперприори. Хто вони?
В даний час я читаю про Байєсові методи в обчислювальній молекулярній еволюції Ян. У розділі 5.2 мова йде про пріори, зокрема про неінформативні / плоскі / розпливчасті / дифузні, сполучені та гіперприори. Це може бути запитання про надмірне спрощення, але чи може хтось просто пояснити різницю між цими видами пріорів …
15 bayesian  prior 

2
Закон сумарної дисперсії як теорема Піфагора
Припустимо, що і мають кінцевий другий момент. У просторі Гільберта випадкові величини з другим кінцевим моментом (із внутрішнім творомXXXYYYT1,T2T1,T2T_1,T_2 визначеним E(T1T2)E(T1T2)E(T_1T_2) , ||T||2=E(T2)||T||2=E(T2)||T||^2=E(T^2) ), ми можемо інтерпретувати E(Y|X)E(Y|X)E(Y|X) як проекція YYY на простір функцій XXX . Відомо також, що Закон сумарної варіації читає Var(Y)=E(Var(Y|X))+Var(E(Y|X))Var(Y)=E(Var(Y|X))+Var(E(Y|X))Var(Y)=E(Var(Y|X)) + Var(E(Y|X)) Чи є спосіб інтерпретувати …

2
Точне значення та порівняння між впливовою точкою, високою точкою важеля та іншими?
З Вікіпедії Впливові спостереження - це ті спостереження, які мають відносно великий вплив на прогнози регресійної моделі. З Вікіпедії Отримані позитивні точки - це спостереження, якщо такі є, зроблені при екстремальних або зовнішніх значеннях незалежних змінних, так що відсутність сусідніх спостережень означає, що відповідна модель регресії буде проходити близько до …

2
Витяг точки даних із ковзної середньої?
Чи можливо витягнути точки даних із ковзних середніх даних? Іншими словами, якщо набір даних має лише прості ковзні середні показники попередніх 30 балів, чи можливо витягнути вихідні точки даних? Якщо так, то як?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.