Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Розуміння парадоксу Сімпсона: приклад Ендрю Гелмана з регресуванням доходу від сексу та зросту
Ендрю Гелман в одному зі своїх останніх публікацій у блозі говорить: Я не думаю, що для парадоксу Сімпсона необхідні контрфакти або потенційні результати. Я говорю це тому, що можна встановити парадокс Сімпсона зі змінними, якими неможливо маніпулювати, або для яких маніпуляції не мають безпосереднього інтересу. Парадокс Сімпсона є частиною більш …

2
Кластеризація двійкової матриці
У мене є напівмаленька матриця двійкових ознак розміром 250k x 100. Кожен рядок - це користувач, а стовпці - це двійкові "теги" деякої поведінки користувача, наприклад "like_cats". user 1 2 3 4 5 ... ------------------------- A 1 0 1 0 1 B 0 1 0 1 0 C 1 0 …

3
Чи W статистичний вихід по wilcox.test () в R такий самий, як U статистичний?
Я нещодавно читав про тест Манна-Вітні U. Виявляється, що для проведення цього тесту на R фактично потрібно запустити тест Вілкоксона! Моє запитання: чи W статистика W wilcox.testв R тотожна U статистиці?

2
Вибір оптимальної альфа-еластичної логістичної регресії
Я здійснюю еластичну чисту логістичну регресію на наборі даних охорони здоров’я, використовуючи glmnetпакет в R, вибираючи значення лямбда по сітці від 0 до 1. Мій скорочений код нижче:αα\alpha alphalist <- seq(0,1,by=0.1) elasticnet <- lapply(alphalist, function(a){ cv.glmnet(x, y, alpha=a, family="binomial", lambda.min.ratio=.001) }) for (i in 1:11) {print(min(elasticnet[[i]]$cvm))} яка виводить середню перехресну …

2
Тест Уолда на регресію (OLS та GLM): t-z-розподіл
Я розумію , що тест Вальда для коефіцієнтів регресії заснований на наступному властивості , який містить асимптотично (наприклад Вассермана (2006): All статистики , сторінки 153, 214-215): деβпозначає розрахунковий коефіцієнт регресії,^з(β)позначає стандартну помилку коефіцієнта регресії іβ0є значенням процентного (β-зазвичай0 перевірити, чи коефіцієнт значно відрізняється від 0). Отже,тестрозміруαWald такий: відхилитиH0,коли| W| >zα/(β^−β0)seˆ(β^)∼N(0,1)(β^−β0)se^(β^)∼N(0,1) …

3
Чому Ларс і Глмнет дають різні рішення для проблеми Лассо?
Я хочу краще зрозуміти пакети R Larsі Glmnet, які використовуються для вирішення задачі Лассо: (проpзмінні таNзразків, див.www.stanford.edu/~hastie/Papers/glmnet.pdfна сторінці 3)м я н( β0β) ∈ Rр + 1[ 12 Н∑i = 1N( уi- β0- хТiβ)2+ λ | | β| |л1]мiн(β0β)∈Rp+1[12N∑i=1N(уi-β0-хiТβ)2+λ||β||л1]min_{(\beta_0 \beta) \in R^{p+1}} \left[\frac{1}{2N}\sum_{i=1}^{N}(y_i-\beta_0-x_i^T\beta)^2 + \lambda||\beta ||_{l_{1}} \right]pppNNN Тому я застосував їх …

8
Виконайте K-засоби (або його близькі споріднення), кластеризуючи лише матрицю відстані, а не дані по характеристиках
Я хочу виконати кластеризацію K-засобів на об'єктах, які у мене є, але об'єкти не описуються як точки в просторі, тобто за objects x featuresнабором даних. Однак я в змозі обчислити відстань між будь-якими двома об’єктами (воно засноване на функції подібності). Отже, я розпоряджаюсь матрицею відстані objects x objects. Я раніше …

4
Як би ви створили систему машинного навчання грі Angry Birds?
Погравши занадто багато Angry Birds, я почав дотримуватися власних стратегій. Виявляється, я розробив дуже специфічний підхід до отримання 3 зірок на кожному рівні. Це змусило мене замислитися над проблемами розвитку системи машинного навчання, яка б змогла грати Angry Birds. Взаємодія з грою та запуск птахів є тривіальною. Але одне питання, …

1
Внутрішньокласова кореляція (ICC) для взаємодії?
Припустимо, я маю деяку оцінку для кожного предмета на кожному сайті. Дві змінні, предмет і сайт, представляють інтерес з точки зору обчислення значень внутрішньокласової кореляції (ICC). Як правило, я би використовував функцію lmerз пакету R lme4і запускався lmer(measurement ~ 1 + (1 | subject) + (1 | site), mydata) Значення …

3
AIC або p-значення: який вибрати для вибору моделі?
Я абсолютно нова у цій справі, але не знаю, яку модель вибрати. Я зробив поетапну регресію вперед, вибравши кожну змінну на основі найнижчого AIC. Я придумав 3 моделі, в яких я не впевнений, яка «найкраща». Model 1: Var1 (p=0.03) AIC=14.978 Model 2: Var1 (p=0.09) + Var2 (p=0.199) AIC = 12.543 …

2
Чи можливо накопичити набір статистичних даних, що описують велику кількість зразків, щоб потім я міг виготовити коробку?
Я повинен негайно уточнити, що я практикуючий розробник програмного забезпечення, а не статистик, і що клас моєї статистики в коледжі був дуже давно ... З огляду на це, я хотів би знати, чи існує метод накопичення набору описових статистичних даних, який потім може бути використаний для отримання коробки, що не …

5
Оцінка значущості відмінностей у розподілах
У мене є дві групи даних. Кожна з різним розподілом декількох змінних. Я намагаюся визначити, чи відрізняються розподіли цих двох груп статистично значущим чином. У мене є дані як в необробленому вигляді, так і поширюються, щоб легше було поводитися з дискретними категоріями з підрахунком частоти в кожній. Які тести / …

1
Чи є різниця між
Коефіцієнт кореляції зазвичай записується з великої літери але іноді - ні. Цікаво, чи дійсно є різниця між r 2 і R 2 ? Чи може r означати щось інше, ніж коефіцієнт кореляції?RRRr2r2r^2R2R2R^2rrr

3
Чому нам потрібен фіктивний код категоричних змінних
Я не впевнений, навіщо нам маніпулювати категоричні змінні коду. Наприклад, якщо у мене є категоріальна змінна з чотирма можливими значеннями 0,1,2,3, я можу замінити її двома вимірами. Якби змінна мала значення 0, вона мала б 0,0 у двох вимірах, якби вона мала 3, вона мала б 1,1 у двох вимірах …

5
Припущення лінійних моделей і що робити, якщо залишки нормально не розподілені
Я трохи розгублений, що таке припущення про лінійну регресію. Поки я перевірив, чи: всі пояснювальні змінні лінійно співвідносяться зі змінною відповіді. (Так було) серед пояснювальних змінних була якась колінеарність. (мало колінеарності). відстані Кука від точок даних моєї моделі нижче 1 (це так, усі відстані нижче 0,4, тому немає балів впливу). …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.