Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Перехресна перевірка GAM для перевірки помилки прогнозування
Мої запитання стосуються GAM в пакеті mgcv R. Через невеликий розмір вибірки я хочу визначити помилку передбачення за допомогою перехресної валідації "вихід-один-вихід". Це розумно? Чи є пакет або код, як я можу це зробити? errorest()Функція в ipred пакеті не працює. Простий набір тестів: library(mgcv) set.seed(0) dat <- gamSim(1,n=400,dist="normal",scale=2) b<-gam(y~s(x0)+s(x1)+s(x2)+s(x3),data=dat) summary(b) …
10 r  cross-validation  gam  mgcv 

1
Розрахунок інтервалів прогнозування при використанні перехресної перевірки
Чи оцінюються стандартні відхилення за допомогою: sN=1N∑Ni=1(xi−x¯¯¯)2−−−−−−−−−−−−−√.sN=1N∑i=1N(xi−x¯)2. s_N = \sqrt{\frac{1}{N} \sum_{i=1}^N (x_i - \overline{x})^2}. ( http://en.wikipedia.org/wiki/Standard_deviation#Sample_standard_deviation ) для точності прогнозування, відібраної з 10-кратної перехресної перевірки? Мене турбує, що точність прогнозування, обчислена між кожною складовою, залежить від значного перекриття між тренувальними наборами (хоча набори прогнозування не залежать). Будь-які ресурси, які обговорюють …

1
Оптимальна кількість компонентів у гауссовій суміші
Отже, отримання «уявлення» про оптимальну кількість кластерів у k-засобах добре зафіксовано. Я знайшов статтю про це в гауссових сумішах, але не впевнений, що я переконаний у цьому, не дуже добре це розумію. Чи існує ... ніжніший спосіб зробити це?

3
Як знайти подібність між часовими рядами?
У наступному прикладі я маю кадр даних, який складається з часового ряду вимірювань температури води, записаних на 5 глибинах в океані, де кожне значення Tempвідповідає даті в DateTimeі глибині в Depth. set.seed(1) Temp <- rnorm(43800,sd=20) AirT <- rnorm(8760,sd=20) Depth <- c(1:5) DateTime = seq(from=as.POSIXct("2010-01-01 00:00"), to=as.POSIXct("2010-12-31 23:00"), length=8760) Time <- …

3
Можливий діапазон
Припустимо, це три часові ряди, X1X1X_1, X2X2X_2 і YYY Запуск звичайної лінійної регресії на YYY ~ X1X1X_1 (Y=bX1+b0+ϵY=bX1+b0+ϵY = b X_1 + b_0 + \epsilon ), ми отримуємо R2=UR2=UR^2 = U. Звичайна лінійна регресіяYYY ~ X2X2X_2 дістати R2=VR2=VR^2 = V. ПрипустимоU&lt;VU&lt;VU < V Які мінімальні та максимально можливі значення R2R2R^2 …

4
Варіант резисторів паралельно
Припустимо, у вас є набір резисторів R, всі вони розподілені із середнім μ та дисперсією σ. Розглянемо розділ ланцюга з таким компонуванням: (r) || (r + r) || (r + r + r). Еквівалентний опір кожної деталі дорівнює r, 2r та 3r. Дисперсія кожного розділу буде тоді σ2σ2σ^2 , 2σ22σ22σ^2 …

1
Як отримати прогнозування конкретної змінної в WinBUGS?
Я новий користувач WinBUGS і маю одне питання до вашої допомоги. Після запуску наступного коду я отримав параметри beta0через beta4(статистика, щільність), але я не знаю, як отримати прогнозування останнього значення h, яке я встановив NAдля моделювання в коді. Хтось може дати мені підказку? Будь-яка порада буде дуже вдячна. model { …

2
Значення 2,04 стандартних помилок? Значно відрізняються засоби, коли довірчі інтервали широко перетинаються?
Зображення нижче - з цієї статті в « Психологічній науці» . Колега вказав на це дві незвичайні речі: Згідно з підписом, рядки помилок показують "± 2,04 стандартних помилок, довірчий інтервал 95%". Я коли-небудь бачив ± 1,96 SE, що використовується для 95% ІС, і я не можу знайти нічого про те, …

2
Регресія Гауссова процесу для наборів даних з високими розмірами
Просто хотілося дізнатись, чи має хто-небудь досвід застосування регресії процесів Гаусса (GPR) до наборів даних високих розмірів. Я розглядаю деякі з різних розріджених методів GPR (наприклад, рідкісні псевдо входи GPR), щоб побачити, що може працювати для наборів даних високих розмірів, де ідеально підбір функції є частиною процесу вибору параметрів. Будь-які …

1
Чи прийнятно запускати дві лінійні моделі в одному наборі даних?
Для лінійної регресії з декількома групами (природні групи, визначені апріорі), чи допустимо запускати дві різні моделі на одному і тому ж наборі даних, щоб відповісти на наступні два запитання? Чи має кожна група ненульовий нахил і ненульовий перехоплення та які параметри для кожної в межах групової регресії? Чи існує незалежно …

2
Яка модель часового ряду для прогнозування відсотка, обмеженого (0,1)?
Це має підійти --- прогнозування речей, які застрягли між 0 і 1. У своїй серії я підозрюю авторегресійний компонент, а також компонент, що повертає середнє значення, тому я хочу щось, що я можу інтерпретувати як ARIMA ---, але я не хочу, щоб він в майбутньому збивався до 1000% . Ви …

4
Як я можу обчислити Пірсона
Коефіцієнт ймовірності (він же відхилення) статистика та тест на непридатність (або на придатність) є досить простим для отримання логістичної моделі регресії (підходящої за допомогою функції) в Р. Однак це може бути легко кількість підрахунків клітинок закінчується досить низькою, що тест є ненадійним. Один із способів перевірити надійність тесту на коефіцієнт …

1
R лінійна регресія, категоріальна змінна значення «приховане»
Це лише приклад, на який я зустрічався кілька разів, тому у мене немає даних про вибірку. Запуск лінійної регресійної моделі в R: a.lm = lm(Y ~ x1 + x2) x1є суцільною змінною. x2категоричний і має три значення, наприклад "Низький", "Середній" та "Високий". Однак вихід, отриманий R, був би на кшталт: …
10 r  regression  categorical-data  regression-coefficients  categorical-encoding  machine-learning  random-forest  anova  spss  r  self-study  bootstrap  monte-carlo  r  multiple-regression  partitioning  neural-networks  normalization  machine-learning  svm  kernel-trick  self-study  survival  cox-model  repeated-measures  survey  likert  correlation  variance  sampling  meta-analysis  anova  independence  sample  assumptions  bayesian  covariance  r  regression  time-series  mathematical-statistics  graphical-model  machine-learning  linear-model  kernel-trick  linear-algebra  self-study  moments  function  correlation  spss  probability  confidence-interval  sampling  mean  population  r  generalized-linear-model  prediction  offset  data-visualization  clustering  sas  cart  binning  sas  logistic  causality  regression  self-study  standard-error  r  distributions  r  regression  time-series  multiple-regression  python  chi-squared  independence  sample  clustering  data-mining  rapidminer  probability  stochastic-processes  clustering  binary-data  dimensionality-reduction  svd  correspondence-analysis  data-visualization  excel  c#  hypothesis-testing  econometrics  survey  rating  composite  regression  least-squares  mcmc  markov-process  kullback-leibler  convergence  predictive-models  r  regression  anova  confidence-interval  survival  cox-model  hazard  normal-distribution  autoregressive  mixed-model  r  mixed-model  sas  hypothesis-testing  mediation  interaction 

1
На які проблеми слід звертати увагу при поєднанні декількох часових рядів?
Скажімо, у мене є ряд часових рядів, наприклад, кількість температурних записів різних станцій у регіоні. Я хочу отримати єдиний температурний рекорд для всього регіону, з яким я міг би описати аспекти регіонального клімату. Інтуїтивно зрозумілим підходом може бути просто взяти середній показник для всіх станцій на кожному кроці, але мій …

2
Оптимальне співвідношення випадків та випадків у дослідженні контрольного випадку
Яке оптимальне співвідношення випадків / контрольних показників у дослідженні, що стосується випадку, Чому більшість підручників чи монографій припускають, що це більше 1? Чи може бути менше 1 (які недоліки?)? Дякую.

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.