Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Лінійна проти нелінійна регресія
У мене є набір значень і які теоретично пов'язані експоненціально:уxxxyyy y=axby=axby = ax^b Одним із способів отримання коефіцієнтів є застосування природних логарифмів в обидві сторони та встановлення лінійної моделі: > fit <- lm(log(y)~log(x)) > a <- exp(fit$coefficients[1]) > b <- fit$coefficients[2] Інший спосіб отримати це - використання нелінійної регресії з …

1
Створюючи регресійну модель, використовуючи окремі набори моделювання / валідації, чи доцільно "рециркулювати" дані валідації?
Припустимо, у мене розділився 80/20 між спостереженнями моделювання / валідації. Я встановив модель до набору даних моделювання, і мені подобається помилка, яку я бачу в наборі даних перевірки. Перш ніж я розгорнути свою модель для оцінки майбутніх спостережень, чи доцільно поєднати перевірку з даними моделювання, щоб отримати оновлені оцінки параметрів …

3
Вибір статистичного тесту на основі результату іншого (наприклад, нормальності)
Тож я чув, як це говорило, що не годиться вибирати один статистичний тест на основі результату іншого. Мені це здається дивним. Наприклад, люди часто вирішують використовувати непараметричний тест, коли якийсь інший тест говорить про те, що залишки зазвичай не розподіляються. Цей підхід здається досить широко прийнятим, але, схоже, не погоджується …

1
Структурні рівняння: як вказати ефекти взаємодії в пакеті R lavaan
Я використовую пакет R lavaan для оцінки моделі структурного рівняння. Скажімо, модель складається з 1 ендогенної маніфестної змінної з 1 латентною та 2 маніфестною пояснювальною змінними: group = {0,1} attitude1 = latent,scale age = respondent's age Потім потрібна модель лавану (не працює): model <- ' attitude1 =~ att1 + att2 …
13 r  interaction  sem  lavaan 

4
Відповідність показника схильності до даних панелі
У мене є набір поздовжніх даних про осіб, деякі з них піддавалися лікуванню, а інші - не. Усі особи є у вибірці від народження до 18 років, і лікування відбувається в деякому віці між цим діапазоном. Вік лікування може відрізнятися в різних випадках. Використовуючи відповідність показників схильності, я хотів би …

1
Стандартизована залежна змінна всередині групи в панельних моделях даних?
Чи має сенс стандартизація залежної змінної в ідентифікаційній групі? У наступному робочому документі (уповільнення вирубки лісів в юридичній Амазонії; ціни чи політика? Pdf ) використовується стандартизована залежна змінна для аналізу впливу змін загальної політики в Бразилії на вирубування лісів. Стандартизація проводиться так: Yн е шя т= Yя т- Yi¯¯¯¯¯с д( …

2
Коли увійти / випробувати свої змінні під час використання випадкових лісових моделей?
Я роблю регресію, використовуючи випадкові ліси для прогнозування цін на основі декількох ознак. Код пишеться на Python за допомогою Scikit-learn. Як ви вирішите, чи слід трансформувати свої змінні, використовуючи exp/ logперед тим, як використовувати їх, щоб відповідати регресійній моделі? Чи потрібно це використовувати підхід Ансамблю, такий як випадковий ліс?

3
Як обчислити основні компоненти, обернені варімакс в R?
Я провів PCA на 25 змінних і вибрав топ-7 ПК за допомогою prcomp. prc <- prcomp(pollutions, center=T, scale=T, retx=T) Тоді я здійснив обертання varimax на цих компонентах. varimax7 <- varimax(prc$rotation[,1:7]) А тепер я хочу, щоб varimax обертав дані, обернені PCA (оскільки це не частина об'єкта varimax - лише матриця завантаження …
13 r  pca  factor-rotation 

4
Інтерполяція даних про грип, яка зберігає середню тиждень
Редагувати Я знайшов документ, що описує саме ту процедуру, яка мені потрібна. Єдина відмінність полягає в тому, що папір інтерполює середньомісячні дані на щоденні, зберігаючи щомісячні засоби. У мене є проблеми реалізувати підхід у R. Будь-які підказки цінуються. Оригінал Для кожного тижня я маю такі дані підрахунку (одне значення на …

1
Прогнозування на моделях зі змішаним ефектом: що робити з випадковими ефектами?
Розглянемо цей гіпотетичний набір даних: set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) ми можемо використовувати lmeдля моделювання відповіді за допомогою моделі випадкових ефектів: require(nlme) model <- …

1
Велика асимптотика зразка / теорія - Чому варто піклуватися?
Я сподіваюсь, що це питання не буде позначене "як занадто загальне" і сподіваюся, що розпочнеться дискусія, яка користь усім. У статистиці ми витрачаємо багато часу, вивчаючи великі вибіркові теорії. Ми глибоко зацікавлені в оцінці асимптотичних властивостей наших оцінювачів, включаючи, чи є вони асимптотично неупередженими, асимптотично ефективними, їх асимптотичним розподілом тощо. …

1
Чи придатні стандартні помилки та інтервали довіри при регресіях, де припущення гомоскедастичності порушено?
Якщо в стандартних регресіях OLS два припущення порушені (нормальний розподіл помилок, гомоскедастичність), чи є завантаження стандартних помилок та довірчих інтервалів підходящою альтернативою для досягнення значущих результатів щодо значущості коефіцієнтів регресору? Чи все ще "працюють" тести на значущість із завантаженими стандартними помилками та довірчими інтервалами з гетероскедастичністю? Якщо так, то які …


3
Великі дані кластера в R та чи є вибірка релевантною?
Я новачок у науці даних і маю проблему з пошуку кластерів у наборі даних із 200 000 рядків та 50 стовпців у Р. Оскільки дані мають як числові, так і номінальні змінні, такі методи, як K-засоби, які використовують евклідову міру відстані, не здаються відповідним вибором. Тому я звертаюся до PAM, …

3
Що означають нормальні залишки і що це говорить про мої дані?
Досить основне питання: Що означає нормальний розподіл залишків від лінійної регресії? З точки зору, як це відображається на моїх оригінальних даних регресії? Я повністю спотикався, дякую хлопці

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.