Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Точність машини для підвищення градієнта зменшується зі збільшенням кількості ітерацій
Я експериментую з алгоритмом машини для підвищення градієнта через caretпакет в Р. Використовуючи невеликий набір даних про вступ до коледжу, я застосував такий код: library(caret) ### Load admissions dataset. ### mydata <- read.csv("http://www.ats.ucla.edu/stat/data/binary.csv") ### Create yes/no levels for admission. ### mydata$admit_factor[mydata$admit==0] <- "no" mydata$admit_factor[mydata$admit==1] <- "yes" ### Gradient boosting machine …
15 machine-learning  caret  boosting  gbm  hypothesis-testing  t-test  panel-data  psychometrics  intraclass-correlation  generalized-linear-model  categorical-data  binomial  model  intercept  causality  cross-correlation  distributions  ranks  p-value  z-test  sign-test  time-series  references  terminology  cross-correlation  definition  probability  distributions  beta-distribution  inverse-gamma  missing-data  paired-comparisons  paired-data  clustered-standard-errors  cluster-sample  time-series  arima  logistic  binary-data  odds-ratio  medicine  hypothesis-testing  wilcoxon-mann-whitney  unsupervised-learning  hierarchical-clustering  neural-networks  train  clustering  k-means  regression  ordinal-data  change-scores  machine-learning  experiment-design  roc  precision-recall  auc  stata  multilevel-analysis  regression  fitting  nonlinear  jmp  r  data-visualization  gam  gamm4  r  lme4-nlme  many-categories  regression  causality  instrumental-variables  endogeneity  controlling-for-a-variable 

1
Складання математичного рівняння для багаторівневої моделі змішаних ефектів
Питання CV Я намагаюся дати (a) детальне та стисле математичне зображення моделей змішаних ефектів. Я використовую lme4пакет у Р. Яке правильне математичне подання для моєї моделі? Дані, наукове запитання та код R Мій набір даних складається з видів у різних регіонах. Я перевіряю, чи змінюється розповсюдженість видів у часі, що …

2
Як ABC та MCMC відрізняються у своїх програмах?
Наскільки я розумію, приблизні байєсівські обчислення (ABC) та ланцюг Маркова Монте-Карло (MCMC) мають дуже схожі цілі. Нижче я описую своє розуміння цих методів та те, як я сприймаю відмінності в їх застосуванні до реальних даних про життя. Орієнтовний байєсівський обчислення ABC полягає у вибірці параметра від попереднього, за допомогою чисельного …

1
Які хороші запитання щодо інтерв'ю для кандидатів у розробники статистичних алгоритмів?
Я опитую людей на посаді розробника / дослідника алгоритмів у контексті статистики / машинного навчання / обміну даними. Я шукаю запитання, щоб визначити, зокрема, ознайомлення кандидата та розуміння його плинності з базовою теорією, наприклад, основними властивостями очікування та відмінності, деякими загальними розподілами тощо. Моє сьогоднішнє запитання: "Існує невідома величина яку …

2
Відбір проб з неправильної дистрибуції (використовуючи MCMC та інше)
Моє основне питання: як би ви взяли вибірку з неправильного розподілу? Чи є навіть сенс вибірки з неправильного розподілу? Коментар Сіань тут вирішує питання, але я шукав ще деякі деталі щодо цього. Більш конкретно для MCMC: Розповідаючи про MCMC та читаючи статті, автори наголошують на тому, що вони отримали належні …

2
Помилка Out of Bag робить резюме непотрібним у випадкових лісах?
Я досить новачок у випадкових лісах. У минулому я завжди порівнював точність підгонки проти тесту проти пристосування проти поїзда, щоб виявити будь-який набір. Але я просто прочитав тут таке: "У випадкових лісах немає необхідності в перехресній валідації або в окремому наборі тесту, щоб отримати неупереджену оцінку помилки набору тестів. Оцінюється …

2
Чому задній розподіл у байєсівському виводі часто непереборний?
У мене виникають проблеми з розумінням того, чому байєсівські умовиводи призводять до нерозв'язних проблем. Проблема часто пояснюється так: Я не розумію, чому це інтеграл слід оцінювати в першу чергу: мені здається, що результат інтеграла - це просто константа нормалізації (як задано набір даних D). Чому не можна просто обчислити задній …

2
Прогнози моделі BSTS (в R) повністю провалюються
Прочитавши цю публікацію в блозі про моделі байесівських структурних часових рядів, я хотів розглянути її реалізацію в контексті проблеми, для якої раніше використовував ARIMA. У мене є деякі дані з деякими відомими (але галасливими) сезонними компонентами - це, безумовно, щорічні, щомісячні та щотижневі компоненти, а також деякі наслідки внаслідок особливих …
15 r  time-series  bayesian  mcmc  bsts 

2
Очікувана кількість разів котити штамп, поки кожна сторона не з’явилася 3 рази
Яка очікувана кількість разів, коли потрібно скочувати штамп, поки кожна сторона не з’явиться 3 рази? Це питання задавали в початковій школі Нової Зеландії, і це було вирішено за допомогою моделювання. Яке аналітичне рішення цієї проблеми?

3
Оцінка ймовірності в процесі Бернуллі шляхом вибірки до 10 відмов: це упередженість?
Припустимо, у нас є процес Бернуллі з ймовірністю відмови qqq (який буде малим, скажімо, q≤0.01q≤0.01q \leq 0.01 ), з якого ми робимо вибірку, поки не зіткнемся з 101010 відмов. Таким чином , ми оцінюємо ймовірність відмови , як д : = 10 / N , де N являє собою число …

5
Варіант статистичних змін у двох відбіркових форматах Формули 1
Я щойно прочитав цю статтю BBC про відбірковий формат у Формулі 1. Організатори бажають зробити класифікацію менш передбачуваною, тобто збільшити статистичну різницю в результаті. Промальовуючи декілька несуттєвих деталей, на даний момент водії займають рейтинг у своєму кращому одиночному колі з (за конкретністю) двох спроб. Один керівник F1, Жан Тодт, запропонував, …
15 variance 

1
Чому ця регресія НЕ провалюється через ідеальну мультиколінеарність, хоча одна змінна є лінійною комбінацією інших?
Сьогодні я розігрувався з невеликим набором даних і здійснив просту регресію OLS, яка, як я очікувала, вийде з-за ідеальної мультиколінеарності. Однак цього не сталося. Це означає, що моє розуміння мультиколінеарності неправильне. Моє запитання: де я помиляюся? Я думаю, що можу показати, що одна з моїх змінних є лінійною комбінацією інших. …

2
Коли припинити вдосконалювати модель?
Я вивчаю статистику з багатьох книг протягом останніх 3 років, і завдяки цьому сайту я багато чого навчився. Тим не менш, одне принципове питання для мене все ще залишається без відповіді. На це може бути дуже проста або дуже складна відповідь, але я точно знаю, що це потребує глибокого розуміння …

2
Якщо "Стандартна помилка" та "Інтервали довіри" вимірюють точність вимірювання, то що таке вимірювання точності?
У книзі "Біостатистика для манекенів" на сторінці 40 я читав: Стандартна помилка (скорочено SE) - це один із способів вказати, наскільки точна ваша оцінка або вимірювання чогось. і Інтервали довіри надають інший спосіб вказати точність оцінки або вимірювання чогось. Але там нічого не написано, як вказати точність вимірювання. Питання: Як …

2
Pdf
Припустимо, є iid від з невідомими іX1,X2,...,XnX1,X2,...,XnX_1, X_2,...,X_nN(μ,σ2)N(μ,σ2)N(\mu,\sigma^2)μ∈Rμ∈R\mu \in \mathcal Rσ2>0σ2>0\sigma^2>0 Нехай Z=X1−X¯S,Z=X1−X¯S,Z=\frac{X_1-\bar{X}}{S}, S тут стандартне відхилення. Можна показати, що ZZZ має PDF Lebesgue f(z)=n−−√Γ(n−12)π−−√(n−1)Γ(n−22)[1−nz2(n−1)2]n/2−2I(0,(n−1)/n√)(|Z|)f(z)=nΓ(n−12)π(n−1)Γ(n−22)[1−nz2(n−1)2]n/2−2I(0,(n−1)/n)(|Z|)f(z)=\frac{\sqrt{n} \Gamma\left(\frac{n-1}{2}\right)}{\sqrt{\pi}(n-1)\Gamma\left(\frac{n-2}{2}\right)}\left[1-\frac{nz^2}{(n-1)^2}\right]^{n/2-2}I_{(0,(n-1)/\sqrt{n})}(|Z|) Тоді моє запитання, як отримати цей pdf? Питання звідси в прикладі 3.3.4, щоб знайти UMVUE P(X1≤c)P(X1≤c)P(X_1 \le c) . Я можу зрозуміти логіку та …
15 self-study  umvue 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.