Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
REML або ML для порівняння двох моделей змішаних ефектів з різними фіксованими ефектами, але з однаковим випадковим ефектом?
Фон: Примітка: Мій набір даних та r-код містяться під текстом Я хочу використовувати AIC для порівняння двох моделей змішаних ефектів, згенерованих за допомогою пакету lme4 у Р. Кожна модель має один фіксований ефект та один випадковий ефект. Фіксований ефект відрізняється між моделями, але випадковий ефект залишається однаковим між моделями. Я …

5
Чи має
Здається, я переплутав себе, намагаючись зрозуміти, чи значення квадрата також має p -значення.rrrppp Як я розумію, у лінійній кореляції з набором точок даних може мати значення в межах від - 1 до 1, і це значення, яке б воно не було, може мати p -значення, яке показує, чи r суттєво …

5
Варіативність у результатах cv.glmnet
Я використовую cv.glmnetдля пошуку прогнозів. Я використовую наступну настройку: lassoResults<-cv.glmnet(x=countDiffs,y=responseDiffs,alpha=1,nfolds=cvfold) bestlambda<-lassoResults$lambda.min results<-predict(lassoResults,s=bestlambda,type="coefficients") choicePred<-rownames(results)[which(results !=0)] Щоб переконатися, що результати відтворюються я set.seed(1). Результати дуже різняться. Я запустив такий самий код 100, щоб побачити, наскільки результативні. У 98/100 запусках завжди був обраний один конкретний предиктор (іноді просто самостійно); були вибрані інші предиктори …

5
У чому причина трансформації журналу використовується при розподілених праворуч розподілах?
Я колись це чув Перетворення журналу є найпопулярнішим для прямокосових розподілів у лінійній регресії чи квантильній регресії Хотілося б знати, чи є якась причина, що лежить в основі цього твердження? Чому перетворення журналу придатне для прямокутного розподілу? Як щодо розповсюдження лівої косою?

4
Чи є синонімами "випадкова вибірка" та "iid випадкова змінна"?
Мені важко зрозуміти значення "випадкової вибірки", а також "iid випадкової змінної". Я намагався з’ясувати значення з кількох джерел, але просто все більше і більше плутався. Я публікую тут те, що я спробував і дізнався: Імовірність та статистика Degroot говорить: Випадкові вибірки / iid / Розмір вибірки: Розгляньте заданий розподіл ймовірностей …

3
Імпутація до або після розбиття на поїзд та випробування?
У мене є набір даних з N ~ 5000 і близько 1/2 відсутня принаймні одна важлива змінна. Основним аналітичним методом будуть пропорційні небезпеки Кокса. Я планую використовувати багаторазову імпутацію. Я також буду розбиватися на поїзд і тестовий набір. Чи слід розділяти дані, а потім імпультувати окремо, або імпутувати, а потім …

1
Різниця між первинною, подвійною та регресією хребта Кернел
Яка різниця між Primal , подвійною та регресією керневого хребта? Люди використовують усіх трьох, і через різні позначення, якими користуються всі в різних джерелах, мені важко дотримуватися. То чи може хтось простими словами сказати мені, в чому різниця між цими трьома? Крім того, які можуть бути деякі переваги чи недоліки …

4
Як найкраще візуалізувати відмінності у багатьох пропорціях у трьох групах?
Я намагаюсь візуально порівняти, як три різні публікації новин висвітлюють різні теми (визначені за темою моделі LDA). У мене є два пов'язані з цим методи, але я отримав багато відгуків від колег, що це не дуже інтуїтивно. Я сподіваюся, що хтось там має кращу ідею для візуалізації цього. У першому …

2
Обчисліть коефіцієнти в логістичній регресії з R
При множинній лінійній регресії можна виявити коефіцієнт за такою формулою. b=(X′X)−1(X′)Yb=(X′X)−1(X′)Yb = (X'X)^{-1}(X')Y beta = solve(t(X) %*% X) %*% (t(X) %*% Y) ; beta Наприклад: > y <- c(9.3, 4.8, 8.9, 6.5, 4.2, 6.2, 7.4, 6, 7.6, 6.1) > x0 <- c(1,1,1,1,1,1,1,1,1,1) > x1 <- c(100,50,100,100,50,80,75,65,90,90) > x2 <- c(4,3,4,2,2,2,3,4,3,2) …

1
MCMC на обмеженому просторі параметрів?
Я намагаюся застосувати MCMC до задачі, але мої пріори (в моєму випадку вони )) обмежені в області? Чи можу я використовувати звичайний MCMC і ігнорувати зразки, які потрапляють за межі зони обмеження (що в моєму випадку є [0,1] ^ 2), тобто повторно використовувати перехідну функцію, коли новий перехід випадає з …

2
Які чотири осі на біплоті PCA?
Коли ви будуєте біплот для аналізу PCA, у вас є основні компоненти компонентів PC1 на осі x, а PC2 - на осі y. Але які дві інші осі праворуч і вгорі екрана?
18 r  pca  biplot 

3
Що означає "нормалізація" та як переконатися, що зразок чи розподіл нормалізуються?
У мене є запитання, в якому він просить перевірити, чи нормалізується Уніфікований розподіл ( Uniform(a,b)Uniform(a,b){\rm Uniform}(a,b) ). Для одного, що означає нормалізація будь-якого розподілу? І два, як ми можемо перевірити, нормалізується чи ні розподіл? Я розумію, обчислюючи ми отримуємо нормалізовані дані , але тут він просить перевірити , нормалізується чи …

2
Виявлення аномалії за допомогою манекенів (та інших дискретних / категоричних особливостей)
тл; д-р Який рекомендований спосіб поводження з discreteданими при виявленні аномалії? Який рекомендований спосіб поводження з categoricalданими при виявленні аномалії? Ця відповідь пропонує використовувати дискретні дані для простого фільтрування результатів. Можливо, замініть значення категорії на шанс спостереження? Вступ Це моя перша публікація тут, тому, будь ласка, якщо щось не здається …

2
використання ваг у svyglm vs glm
Мені хотілося б знати, чим відрізняється обробка ваг між svyglmіglm Я використовую twangпакет в R, щоб створити показники схильності, які потім використовуються як ваги, наступним чином (цей код походить з twangдокументації): library(twang) library(survey) set.seed(1) data(lalonde) ps.lalonde <- ps(treat ~ age + educ + black + hispan + nodegree + married …
18 r  survey 

1
Основні питання щодо дискретного аналізу виживання в часі
Я намагаюся провести дискретний аналіз виживання часу за допомогою логістичної регресійної моделі, і я не впевнений, що повністю розумію цей процес. Я б дуже вдячний за допомогу з кількома основними питаннями. Ось налаштування: Я дивлюся на членство в групі протягом п'ятирічного періоду. Кожен член має щомісячний облік членства за кожен …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.