Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Яке розподіл закругленого середнього середніх випадкових величин Пуассона?
Якщо у мене є випадкові величини , які Пуассон розподілено з параметрами , який розподіл (тобто цілий поверх середнього)?X1,X2,…,XnX1,X2,…,XnX_1,X_2,\ldots,X_nλ1,λ2,…,λnλ1,λ2,…,λn\lambda_1, \lambda_2,\ldots, \lambda_nY=⌊∑ni=1Xin⌋Y=⌊∑i=1nXin⌋Y=\left\lfloor\frac{\sum_{i=1}^n X_i}{n}\right\rfloor Сума Пуассона - це також Пуассон, але я недостатньо впевнений у статистиці, щоб визначити, чи це те саме для вищезазначеного випадку.

2
Складання інтервалів довіри для прогнозованих ймовірностей з логістичної регресії
Гаразд, я маю логістичну регресію і використовував predict()функцію для розробки кривої ймовірності на основі моїх оцінок. ## LOGIT MODEL: library(car) mod1 = glm(factor(won) ~ as.numeric(bid), data=mydat, family=binomial(link="logit")) ## PROBABILITY CURVE: all.x <- expand.grid(won=unique(won), bid=unique(bid)) y.hat.new <- predict(mod1, newdata=all.x, type="response") plot(bid<-000:1000,predict(mod1,newdata=data.frame(bid<-c(000:1000)),type="response"), lwd=5, col="blue", type="l") Це чудово, але мені цікаво будувати довірчі …

2
Парний t-тест як особливий випадок лінійного моделювання зі змішаним ефектом
Ми знаємо, що парний t- test - це лише особливий випадок односторонньої (або всередині суб'єкта) ANOVA, а також лінійної моделі зі змішаним ефектом, яку можна продемонструвати за допомогою lme () функції пакету nlme в R як показано нижче. #response data from 10 subjects under two conditions x1<-rnorm(10) x2<-1+rnorm(10) # Now …

1
Яке використання лінії, виробленої qqline () в R?
Функція qqnorm()R виробляє нормальний QQ-графік і qqline()додає лінію, яка проходить через перший і третій чверті. Яке походження цієї лінії? Чи корисно перевірити нормальність? Це не класична лінія (діагональ можливо після лінійного масштабування).у= ху=хy=x Ось приклад. Спочатку я порівняти емпіричну функцію розподілу з теоретичної функцією розподілу : Тепер я побудувати QQ-ділянку …

3
Чи можна алгоритм MIC для виявлення нелінійних кореляцій пояснити інтуїтивно?
Зовсім недавно я прочитав дві статті. Перший - про історію кореляції, а другий - про новий метод під назвою Максимальний інформаційний коефіцієнт (MIC). Мені потрібна ваша допомога щодо розуміння методу MIC для оцінки нелінійних кореляцій між змінними. Більше того, Інструкції щодо використання в R можна знайти на веб-сайті автора (у …

3
Коли слід використовувати множину регресії з фіктивним кодуванням проти ANCOVA?
Нещодавно я проаналізував експеримент, який маніпулював 2 категоричними змінними та однією безперервною змінною за допомогою ANCOVA. Однак рецензент припустив, що множинна регресія з категоріальною змінною, кодованою як манекенні змінні, є більш підходящим тестом для експериментів як з категоричною, так і безперервною змінними. Коли доцільно використовувати ANCOVA проти багаторазової регресії з …

2
Порядок змінних в ANOVA має значення, чи не так?
Чи правильно я розумію, що порядок, у якому змінні вказані в багатофакторному ANOVA, має значення, але порядок не має значення при виконанні множинної лінійної регресії? Тож припускаючи такий результат, як вимірювана втрата крові y та дві категоричні змінні метод аденоїдектомії a , метод тонзилектомії b . Модель y~a+bвідрізняється від моделі …

2
Побудова лінійної моделі для співвідношення проти відсотків?
Припустимо, я хочу побудувати модель, щоб передбачити якесь співвідношення чи відсоток. Наприклад, скажімо, я хочу передбачити кількість хлопців проти дівчат, які будуть відвідувати вечірку, і особливості вечірки, яку я можу використовувати в моделі, такі речі, як кількість реклами для вечірки, розмір місця проведення, чи є буде будь-який алкоголь на вечірці …


1
У дослідженнях асоціації, пов’язаних з геномом, які основні компоненти?
У дослідженнях асоціації, пов’язаних з геномом (GWAS): Які основні компоненти? Для чого вони використовуються? Як вони обчислюються? Чи можна проводити дослідження асоціації, пов’язане з геном, без використання PCA?
20 pca  genetics  gwas 

4
Аналіз виживання: безперервний проти дискретного часу
Мене розгублено щодо того, як вирішити, чи слід розглядати час як неперервний чи дискретний аналіз аналізу виживання. Зокрема, я хочу використовувати аналіз виживання для виявлення змінних на рівні дітей та домогосподарств, які мають найбільшу невідповідність у своєму впливі на виживання хлопчиків та дівчат (до 5 років). У мене є набір …
20 survival  ties 

3
Моменти розподілу - будь-яке використання для часткових чи вищих моментів?
Для опису певних властивостей зазвичай використовують другий, третій та четвертий моменти розподілу. Чи описують часткові моменти або моменти вище четвертого будь-які корисні властивості розподілу?

7
Які існують альтернативи коробці?
Я працюю над створенням веб-сайту, який відображає дані перепису для вибраних користувачем полігонів і хотів би графічно показати розподіл різних параметрів (один графік на параметр). Дані зазвичай мають такі властивості: Розмір вибірки, як правило, великий (скажімо, близько 10 000 точок даних) Діапазон значень, як правило, великий (наприклад, мінімальна кількість населення …

6
Завжди повідомляти про грубі (білі) стандартні помилки?
Ангріст і Пішке запропонували сказати, що про надійні (тобто стійкі до гетеросклестичності або неоднакові відмінності) стандартні помилки повідомляються як звичайно, а не для перевірки на них. Два питання: Що впливає на стандартні помилки при цьому, коли є гомоскедастичність? Хтось насправді це робить у своїй роботі?

9
Скільки лагів слід використати при тесті Люнг-Бокса часового ряду?
Після того, як модель ARMA підходить до часового ряду, звичайно перевіряти залишки за допомогою тесту на портманто Ljung-Box (серед інших тестів). Тест Ljung-Box повертає значення ap. Він має параметр, h , яка є кількістю лагів, які підлягають тестуванню. У деяких текстах рекомендується використовувати h = 20; інші рекомендують використовувати h …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.