Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Оцінка параметра рівномірного розподілу: неправильне попереднє?
У нас є N зразків, XiXiX_i, від рівномірного розподілу [0,θ][0,θ][0,\theta] де θθ\thetaневідомо. Оцінітьθθ\theta з даних. Отже, правило Байєса ... f(θ|Xi)=f(Xi|θ)f(θ)f(Xi)f(θ|Xi)=f(Xi|θ)f(θ)f(Xi)f(\theta | {X_i}) = \frac{f({X_i}|\theta)f(\theta)}{f({X_i})} і ймовірність така: f(Xi|θ)=∏Ni=11θf(Xi|θ)=∏i=1N1θf({X_i}|\theta) = \prod_{i=1}^N \frac{1}{\theta} (редагувати: коли для всіх , а 0 в іншому випадку - дякую блуд)0≤Xi≤θ0≤Xi≤θ0 \le X_i \le \thetaiii але не …

3
Залишки завантаження: Чи я це роблю правильно?
Насамперед: З того, що я зрозумів, залишкові завантажувальні роботи залишаються таким чином: Підходить модель до даних Обчисліть залишки Перекомпонуйте залишки та додайте їх до 1. Підібрати модель до нового набору даних з 3. Повторіть nрази, але завжди додайте залишки, що перекомпоновані, у відповідність з 1. Чи правильно це поки що? …

1
Перестановочний тест порівняння одного зразка із середнім
Коли люди реалізують тести на перестановку для порівняння одного зразка із середнім (наприклад, як це можна зробити з t-тестом перестановки), як обробляється середнє? Я бачив реалізації, які беруть середнє значення та зразок для тесту перестановки, але незрозуміло, що вони насправді роблять під кришкою. Чи існує навіть змістовний спосіб зробити перестановку …

1
SMOTE викидає помилку для багатокласової проблеми дисбалансу
Я намагаюся використовувати SMOTE для виправлення дисбалансу в моїй проблемі класифікації класів. Хоча SMOTE чудово працює на наборі даних райдужної оболонки відповідно до довідкового документа SMOTE, він не працює на подібному наборі даних. Ось як виглядають мої дані Зауважте, у ньому є три класи зі значеннями 1, 2, 3. > …

2
AIC, anova error: Моделі не всі підходили до однакової кількості спостережень, моделі не всі були встановлені на однаковий розмір набору даних
У мене є такі моделі: require(nlme) set.seed(123) n <- 100 k <- 5 cat <- as.factor(rep(1:k, n)) cat_i <- 1:k # intercept per kategorie x <- rep(1:n, each = k) sigma <- 0.2 alpha <- 0.001 y <- cat_i[cat] + alpha * x + rnorm(n*k, 0, sigma) plot(x, y) m1 …
10 r  mixed-model  aic 

4
Як обчислити 2D стандартне відхилення з 0 середнім значенням, обмеженим межами
Моя проблема полягає в наступному: я опускаю відразу 40 кульок з певної точки, кілька метрів над підлогою. Кульки котиться, і приходить до відпочинку. За допомогою комп’ютерного зору я обчислюю центр маси в площині XY. Мене цікавить лише відстань від центру маси до кожного кулі, яка розраховується за допомогою простої геометрії. …

3
Вправа 2.2 Елементи статистичного навчання
Підручник спочатку генерує деякі дані для двох класів за допомогою: що дає: а потім він запитує: Я намагаюся вирішити це, спершу моделюючи цю графічну модель: де ccc це ярлик, год( 1 ≤ h ≤ 10 )год(1≤год≤10)h\,(1\le h \le 10) - індекс вибраного середнього мcгодмгодcm_h^c, і ххx- точка даних. Це дасть …

1
Яка користь від використання перестановочних тестів?
Під час тестування деяких нульових проти альтернативних гіпотез за допомогою тестової статистики , де , застосуємо перестановочний тест із набором перестановок на і у нас є нова статистика U( X)U(Х)U(X)Х= {хi, . . . ,хн}Х={хi,...,хн}X = \{ x_i, ..., x_n\}ГГGХХXТ( X) : =# { π∈ G : U( πХ) ≥ …

2
Чи відповідає це одне значення такому розподілу?
це здається дуже наївним питанням, але мені важко бачити відповідь. У мене є один набір з 30 значень. Незалежно я отримав 31-е значення. Нульова гіпотеза полягає в тому, що значення 31-го є частиною того ж розподілу. Альтернативою є те, що його різне. Я хочу якусь р-величину чи міру ймовірності. Деякі …

1
Упередження оцінок максимальної ймовірності для логістичної регресії
Я хотів би зрозуміти пару фактів щодо максимальної оцінки ймовірності (MLE) для логістичних регресій. Чи правда, що загалом MLE для логістичної регресії є упередженим? Я б сказав «так». Я знаю, наприклад, що розмір вибірки пов'язаний з асимптотичним зміщенням MLE. Чи знаєте ви якісь елементарні приклади цього явища? Якщо MLE упереджений, …

1
Пеніалізовані методи категоричних даних: поєднання рівнів у факторі
Пеналізовані моделі можна використовувати для оцінки моделей, де кількість параметрів дорівнює або навіть перевищує розмір вибірки. Така ситуація може виникнути в лінійних журнальних моделях великих розріджених таблиць категоричних даних або даних про кількість. У цих налаштуваннях часто також бажано або корисно згортання таблиць шляхом комбінування рівнів фактора, коли ці рівні …

1
Яку регресійну модель завантаження слід вибрати?
Я маю бінарну логістичну регресійну модель з DV (хвороба: так / ні) та 5 предикторів (демографічні показники [вік, стать, куріння тютюну (так / ні)]], медичний індекс (порядковий) та одне випадкове лікування [так / ні " ]). Я також моделював усі умови двосторонньої взаємодії. Основні змінні зосереджені і немає ознак мультиколінеарності …

3
Вимірювання деяких пацієнтів не один раз
Я провожу клінічне дослідження, де визначаю антропометричний показник пацієнтів. Я знаю, як впоратися з ситуацією, коли в мене є один показник на пацієнта: я роблю модель, де маю випадкову вибіркуX1,…,XnX1,…,XnX_1,\dots,X_n від деякої щільності fθfθf_\theta, і я роблю звичайні речі: пишу ймовірність вибірки, оцінювати параметри, визначати набори достовірності та перевіряти гіпотезу, …
10 inference 

1
Очікувана кількість дублікатів (потрійних копій тощо) при малюванні із заміною
У мене є така проблема: У мене є 100 унікальних елементів (n), і я вибираю 43 (м) з них один за одним (із заміною). Мені потрібно вирішити очікувану кількість унікеїв (вибраних лише один раз, k = 1), парних (вибрано рівно два рази k = 2), триплетів (рівно k = 3), …

4
Модель історії дискретних подій дискретного часу (виживання) в R
Я намагаюся вписати в R дискретний час модель, але не знаю, як це зробити. Я читав, що ви можете організувати залежну змінну в різні рядки, по одній для кожного часу спостереження, і використовувати glmфункцію за допомогою посилання logit або cloglog. У цьому сенсі, у мене є три колонки: ID, Event(1 …
10 r  survival  pca  sas  matlab  neural-networks  r  logistic  spatial  spatial-interaction-model  r  time-series  econometrics  var  statistical-significance  t-test  cross-validation  sample-size  r  regression  optimization  least-squares  constrained-regression  nonparametric  ordinal-data  wilcoxon-signed-rank  references  neural-networks  jags  bugs  hierarchical-bayesian  gaussian-mixture  r  regression  svm  predictive-models  libsvm  scikit-learn  probability  self-study  stata  sample-size  spss  wilcoxon-mann-whitney  survey  ordinal-data  likert  group-differences  r  regression  anova  mathematical-statistics  normal-distribution  random-generation  truncation  repeated-measures  variance  variability  distributions  random-generation  uniform  regression  r  generalized-linear-model  goodness-of-fit  data-visualization  r  time-series  arima  autoregressive  confidence-interval  r  time-series  arima  autocorrelation  seasonality  hypothesis-testing  bayesian  frequentist  uninformative-prior  correlation  matlab  cross-correlation 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.