Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Ієрархічні моделі для численних порівнянь - контекст множинного результату
Я щойно читав (пере) читав "Гельман", чому нам (як правило) не потрібно турбуватися про багаторазове порівняння . Зокрема, у розділі "Кілька результатів та інші виклики" згадується використання ієрархічної моделі для ситуацій, коли в одній особі / підрозділі є різні пов'язані заходи в різні періоди / умови. Схоже, він має ряд …

2
Чому важливі дистрибуції?
Це може так само погіршитися, як найдурніші запитання, коли-небудь задані на цьому форумі, але, отримавши надійні та змістовні відповіді на попереднє запитання, я подумав, що знову розтягну свою удачу. Я деякий час був дуже заплутаний щодо важливості статистичних розподілів, особливо, коли вони стосуються прибутку активів і, зокрема, розподілу активів. Моє …

2
Чи можна використовувати завантажувальний інструмент, чому чи ні?
Зараз я працюю над оцінками біомаси за допомогою супутникових знімків. Я швидко визначу передумови свого запитання, а потім поясню статистичне питання, над яким я працюю. Фон Проблема Я намагаюся оцінити біомасу на території Франції. Моя відповідь - об'ємна щільність парового дерева (в ), яка більш-менш пропорційна біомасі (залежно від щільності …
10 bootstrap 

2
Як я можу моделювати пропорцію BUGS / JAGS / STAN?
Я намагаюся побудувати модель, де відповідь є пропорційною (це фактично частка голосів, яку отримує партія в округах). Її розподіл не є нормальним, тому я вирішив моделювати його бета-розподілом. У мене також є кілька прогнозів. Однак я не знаю, як це написати в BUGS / JAGS / STAN (JAGS був би …

1
Пропозиція статистичного тесту
Мені потрібно знайти відповідний статистичний тест (тест на коефіцієнт ймовірності, t-тест тощо) на наступне: Нехай є вибіркою випадкового вектора і припустимо, що ~ . Гіпотези: ; ( X ; Y ) ( Y X ) N [ ( μ 1 μ 2 ) , ( 1{ Xi; Yi}нi = 1{Хi;Yi}i=1н\{X_i;Y_i\}^n_{i=1}(X;Y)(Х;Y)(X;Y)( …

2
Чи можлива наявність змінної, яка виступає як модифікатором ефекту, так і конфундером?
Чи можлива наявність змінної, яка виступає як модифікатором ефекту (вимірювання), так і спонукачем для даної пари асоціацій ризик-результат? Я ще трохи не впевнений у відмінність. Я переглянув графічні позначення, щоб допомогти мені зрозуміти різницю, але відмінності в нотації дивують. Графічне / візуальне пояснення обох та коли вони можуть перетинатися було …

1
Як боротися зі смертю в аналізі виживання без вільних захворювань?
Якщо у мене є дані про виживання без захворювань (визначені як те, чи було діагностовано конкретне захворювання, чи не разом із часом до цієї події чи втратою для подальшого спостереження), а також загальні дані про виживання, як мені боротися зі смертю, що настає без хвороба подія? Це цензура чи я …

3
Аналіз потужності для біноміальних даних, коли нульовою гіпотезою є, що
Я хотів би зробити аналіз потужності для одного зразка з біноміальних даних з , порівняно з , де - частка успіхів у сукупності. Якщо , я міг би використати або нормальне наближення до двочленного, або -test, але при ці обидва не вдається. Я хотів би знати, чи є спосіб зробити …

1
Чому Anova () та drop1 () надали різні відповіді для GLMM?
У мене є GLMM форми: lmer(present? ~ factor1 + factor2 + continuous + factor1*continuous + (1 | factor3), family=binomial) Під час використання drop1(model, test="Chi")я отримую інші результати, ніж якщо я використовую Anova(model, type="III")з автомобільного пакета або summary(model). Ці два останні дають однакові відповіді. Використовуючи купу сфабрикованих даних, я виявив, що …
10 r  anova  glmm  r  mixed-model  bootstrap  sample-size  cross-validation  roc  auc  sampling  stratification  random-allocation  logistic  stata  interpretation  proportion  r  regression  multiple-regression  linear-model  lm  r  cross-validation  cart  rpart  logistic  generalized-linear-model  econometrics  experiment-design  causality  instrumental-variables  random-allocation  predictive-models  data-mining  estimation  contingency-tables  epidemiology  standard-deviation  mean  ancova  psychology  statistical-significance  cross-validation  synthetic-data  poisson-distribution  negative-binomial  bioinformatics  sequence-analysis  distributions  binomial  classification  k-means  distance  unsupervised-learning  euclidean  correlation  chi-squared  spearman-rho  forecasting  excel  exponential-smoothing  binomial  sample-size  r  change-point  wilcoxon-signed-rank  ranks  clustering  matlab  covariance  covariance-matrix  normal-distribution  simulation  random-generation  bivariate  standardization  confounding  z-statistic  forecasting  arima  minitab  poisson-distribution  negative-binomial  poisson-regression  overdispersion  probability  self-study  markov-process  estimation  maximum-likelihood  classification  pca  group-differences  chi-squared  survival  missing-data  contingency-tables  anova  proportion 

1
Гауссовий Подобається розподіл з моментами вищого порядку
Для гауссового розподілу з невідомими середніми та дисперсійними показниками достатньою статистикою у стандартній експоненціальній формі сім'ї є . У мене є розподіл, який має , де N такий, як параметр проектування. Чи існує відповідний відомий розподіл для цього виду достатнього вектора статистики? Мені потрібні зразки з цього розподілу, тому для …

2
Оцінювання кластерних ланцюгів Маркова першого порядку
Я згрупував свій набір даних з кількох тисяч ланцюгів Маркова першого порядку в приблизно 10 кластерів. Чи є якийсь рекомендований спосіб, як я можу оцінити ці кластери та дізнатись, чим діляться елементи в кластерах та чим вони відрізняються від інших кластерів? Тому я можу зробити висловлювання на кшталт "Процеси в …

3
Звідки взявся термін «вивчити модель»
Часто я чув, як шахтарі даних тут використовують цей термін. Як статистик, який працював над проблемами класифікації, я знайомий з терміном "навчити класифікатора", і я припускаю, що "вивчити модель" означає те саме. Я не проти терміна "тренуйте класифікатора". Це, здається, відображає ідею підгонки моделі, оскільки навчальні дані використовуються для отримання …

2
Як я можу генерувати числа відповідно до розподілу Soliton?
Розподіл Солітона - це дискретний розподіл ймовірності на множині з функцією маси ймовірностей{1,…,N}{1,…,N}\{1,\dots, N\} p ( 1 ) = 1N,p ( k ) = 1k ( k - 1 )для k ∈ { 2 , … , N}p(1)=1N,p(k)=1k(k−1)for k∈{2,…,N} p(1)=\frac{1}{N},\qquad p(k)=\frac{1}{k(k-1)}\quad\text{for }k\in\{2,\dots, N\} Я хотів би використовувати його як частину …

1
Фактори Байєса з неправильними пріорами
У мене є питання щодо порівняння моделі за допомогою факторів Байєса. У багатьох випадках статистики зацікавлені в застосуванні байєсівського підходу з невідповідними пріорами (наприклад, деякими приорами Джеффріса та рефератами). Моє запитання: у тих випадках, коли задній розподіл параметрів моделі чітко визначений, чи справедливо порівнювати моделі з використанням факторів Байєса при …

2
Чи мультиколінеарність неявна категоричним змінним?
Я зауважив, що повозився з багатоваріантною регресійною моделлю, був невеликий, але помітний ефект мультиколінеарності, виміряний коефіцієнтами дисперсії, в межах категорії категоріальної змінної (звичайно, виключаючи референтну категорію). Наприклад, скажімо, у нас є набір даних із суцільною змінною y та однією номінальною категоріальною змінною x, яка має k можливих взаємовиключних значень. Ми …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.