Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Розподіл на підмножини
Мені цікаво, чи є якісь стандартні розподіли на підмножини цілих чисел . Еквівалентно, ми могли б виразити це як розподіл на довжині вектора бінарних результатів, наприклад, якщо то відповідає вектору .{1,2,...,J}{1,2,...,J}\{1, 2, ..., J\}JJJJ=5J=5J = 5{1,3,5}{1,3,5}\{1, 3, 5\}(1,0,1,0,1)(1,0,1,0,1)(1, 0, 1, 0, 1) В ідеалі те, що я шукаю, - це …

1
Часті статистичні посилання для тих, хто добре розбирається в сучасній теорії ймовірностей
Виходячи з суворого досвіду аналізу та сучасної теорії ймовірностей, я вважаю, що баєсівська статистика є простою і зрозумілою, а частолістська статистика неймовірно заплутаною та неінтуїтивною. Здається, що часто відвідувачі ведуть байесівські статистичні дані, за винятком "таємних пріорів", які недостатньо вмотивовані або ретельно визначені. З іншого боку, багато чудових статистиків, які …

3
Інтервали довіри та розмір вибірки?
Я абсолютно нова в статистиці та області довірчих інтервалів. Тож це може бути дуже тривіально або навіть здаватися дурним. Буду вдячний, якщо ви могли б допомогти мені зрозуміти або вказати на якусь літературу / текст / блог, що пояснює це краще. Я бачу на різних новинних сайтах, таких як CNN, …

2
Визначення найбільшого учасника групи
Я мало знаю про статистику, тож ведіть мене. Скажімо, у мене набір 1000 робітників. Я хочу розібратися, хто найважчий працівник, але я можу виміряти лише кількість роботи, яку виконують у групах по 1-100 за години роботи. Якщо припустити, що кожен працівник завжди виконує приблизно однакову кількість роботи, під час великої …

3
Порівнюючи показники захворюваності
Я хочу порівняти показник захворюваності між двома групами (одна без захворювання та одна із захворюванням). Я планував обчислити коефіцієнт частоти захворюваності (IRR), тобто групу захворюваності B / рівень частоти захворюваності, група А, а потім перевірити, чи є цей показник рівним 1, і, нарешті, обчислити 95% інтервали ІС для IRR. Я …

1
Інтервали довіри та прогнозування лінійної регресійної моделі
Гаразд, тому я намагаюся зрозуміти лінійну регресію. У мене є набір даних, і це виглядає все в порядку, але я розгублений. Це моя лінійна резюме моделі: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 0.2068621 0.0247002 8.375 4.13e-09 *** temp 0.0031074 0.0004779 6.502 4.79e-07 *** --- Signif. codes: 0 ‘***’ …
9 r  regression 

2
Проблема з обчисленням, інтерпретацією регістрів і загальними питаннями щодо процедури вибору моделі
Я хочу вибрати моделі, що використовують regsubsets(). У мене є кадр даних під назвою olympiadaten (дані завантажені: http://www.sendspace.com/file/8e27d0 ). Я спочатку додаю цей кадр даних, а потім починаю аналізувати, мій код: attach(olympiadaten) library(leaps) a<-regsubsets(Gesamt ~ CommunistSocialist + CountrySize + GNI + Lifeexp + Schoolyears + ExpMilitary + Mortality + PopPoverty …

1
Розподіл помилок для лінійної та логістичної регресії
При безперервних даних лінійна регресія передбачає, що термін помилки розподіляється N (0, )Y=β1+β2Х2+ уY=β1+β2X2+uY=\beta_1+\beta_2X_2+uσ2σ2\sigma^2 1) Чи вважаємо ми, що Var (Y | x) аналогічно ~ N (0, )?σ2σ2\sigma^2 2) Що таке розподіл помилок при логістичній регресії? Коли дані є у формі 1 запису на випадок, де "Y" дорівнює 1 або …

2
Використання параметра Gamma з підтримуючими векторними машинами
При використанні libsvmпараметр є параметром для функції ядра. Його за замовчуванням встановлено якγγ\gammaγ=1number of features.γ=1number of features.\gamma = \frac{1}{\text{number of features.}} Чи є якісь теоретичні вказівки щодо встановлення цього параметра, крім існуючих методів, наприклад, пошук в сітці?

3
Випадкове завдання: навіщо турбуватися?
Випадкове призначення є цінним, оскільки забезпечує незалежність лікування від потенційних результатів. Ось як це призводить до неупереджених оцінок середнього ефекту від лікування. Але інші схеми призначення можуть також систематично забезпечувати незалежність лікування від потенційних результатів. То чому нам потрібне випадкове призначення? По-іншому, у чому полягає перевага випадкового присвоєння перед не …

1
Контроль частоти помилкового виявлення на етапах
У мене є тривимірна таблиця розмірів 6 × 6 × 816×6×816\times6\times81. Кожна комірка таблиці - це тест на гіпотезу. Нарізання таблиці на третій вимір виробляє818181набори тестів гіпотез, які не залежать між множинами, але залежать від множин. Спочатку я думав, що можу просто контролювати показник помилкового виявлення, використовуючи процедуру Бенджаміні-Гохберга на …

3
Як використовувати R gbm з розподілом = "adaboost"?
Документація стверджує, що R gbm з розподілом = "adaboost" може використовуватися для задачі класифікації 0-1. Розглянемо наступний фрагмент коду: gbm_algorithm <- gbm(y ~ ., data = train_dataset, distribution = "adaboost", n.trees = 5000) gbm_predicted <- predict(gbm_algorithm, test_dataset, n.trees = 5000) Її можна знайти в документації, яка передбачає.gbm Повертає вектор прогнозів. …
9 r  gbm 

2
Чому кількість дисперсії, поясненої моїм 1-м ПК, настільки близька до середнього парного співвідношення?
Який взаємозв'язок між першою основною складовою (частинами) та середньою кореляцією у кореляційній матриці? Наприклад, в емпіричному застосуванні я зауважую, що середнє співвідношення майже таке ж, як відношення дисперсії першого головного компонента (першого власного значення) до загальної дисперсії (сума всіх власних значень). Чи є математичний зв’язок? Нижче наведено графік емпіричних результатів. …

4
Коли використовувати непараметричну регресію?
Я використовую PROC GLM в SAS, щоб підходити до рівняння регресії наступної форми Y=б0+б1Х1+б2Х2+б3Х3+б4тY=b0+b1X1+b2X2+b3X3+b4t Y = b_0 + b_1X_1 + b_2X_2 + b_3X_3 + b_4t Діаграма QQ результуючих червоних осіб вказує на відхилення від нормальності. Будь-яка трансформація не корисна для того, щоб зробити залишки нормальними.YYY На цьому етапі я можу …

1
Як порівняти спостережувані та очікувані події?
Припустимо, у мене є один зразок частоти 4 можливих подій: Event1 - 5 E2 - 1 E3 - 0 E4 - 12 і я маю очікувані ймовірності моїх подій: p1 - 0.2 p2 - 0.1 p3 - 0.1 p4 - 0.6 За допомогою суми спостережуваних частот моїх чотирьох подій (18) …
9 r  statistical-significance  chi-squared  multivariate-analysis  exponential  joint-distribution  statistical-significance  self-study  standard-deviation  probability  normal-distribution  spss  interpretation  assumptions  cox-model  reporting  cox-model  statistical-significance  reliability  method-comparison  classification  boosting  ensemble  adaboost  confidence-interval  cross-validation  prediction  prediction-interval  regression  machine-learning  svm  regularization  regression  sampling  survey  probit  matlab  feature-selection  information-theory  mutual-information  time-series  forecasting  simulation  classification  boosting  ensemble  adaboost  normal-distribution  multivariate-analysis  covariance  gini  clustering  text-mining  distance-functions  information-retrieval  similarities  regression  logistic  stata  group-differences  r  anova  confidence-interval  repeated-measures  r  logistic  lme4-nlme  inference  fiducial  kalman-filter  classification  discriminant-analysis  linear-algebra  computing  statistical-significance  time-series  panel-data  missing-data  uncertainty  probability  multivariate-analysis  r  classification  spss  k-means  discriminant-analysis  poisson-distribution  average  r  random-forest  importance  probability  conditional-probability  distributions  standard-deviation  time-series  machine-learning  online  forecasting  r  pca  dataset  data-visualization  bayes  distributions  mathematical-statistics  degrees-of-freedom 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.