Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як я можу використовувати значення для перевірки припущення про лінійність у аналізі множинної регресії?
Наведені нижче графіки - це залишкові діаграми розсіювання регресійного тесту, для яких припущення про «нормальність», «гомоскедастичність» та «незалежність» вже точно виконані! Для тестування припущення "лінійності" , хоча, переглядаючи графіки, можна здогадатися, що співвідношення криволінійне, але питання полягає в тому, як можна використати значення для "R2 лінійного" для перевірки припущення про …

6
Ресурси для вивчення способів реалізації ансамблевих методів
Я теоретично розумію (начебто), як вони працюватимуть, але не впевнений, як реально використовувати метод ансамблю (наприклад, голосування, зважені суміші тощо). Які хороші ресурси для впровадження ансамблевих методів? Чи є якісь ресурси щодо впровадження в Python? Редагувати: Щоб прояснити деякі результати на основі обговорення в коментарях, я не шукаю алгоритмів ансамблі, …

4
Шукаю справжню ілюстрацію цитати Фішера про DoE
Моя команда і я хотіли б виступити з нестатистами компанії про корисність проектування експериментів. Ці нестатисти - це також наші клієнти, і вони зазвичай не консультуються з нами перед тим, як збирати їх дані. Чи знаєте ви кілька реальних прикладів, які добре ілюстрували б відому цитату Фішера "Подзвонити до статистики …

1
Допоможіть мені зрозуміти
Я намагаюся запустити байєсівський логіт на даних тут . Я використовую bayesglm()в armпакеті в Р. Кодування досить просто: df = read.csv("http://dl.dropbox.com/u/1791181/bayesglm.csv", header=T) library(arm) model = bayesglm(PASS ~ SEX + HIGH, family=binomial(link="logit"), data=df) summary(model) дає такий вихід: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.10381 0.10240 1.014 0.311 SEXMale 0.02408 …
13 r  bayesian  p-value 

2
Чому проблему захаращення не можна вирішити для великих розмірів вибірки?
Припустимо, у нас є набір точок . Кожна точка формується за допомогою розподілу Для отримання posterior для пишемо Згідно зі статтею Мінка на Очікування поширення нам необхідно 2 ^ N обчислення , щоб отримати задній р (х | \ mathbf {у}) і, таким чином, проблема стає нерозв'язною для великих розмірів …

2
Як отримати результати постсоціального тесту Tukey HSD у таблиці, що показує згруповані пари?
Я хотів би провести пост-хок-тест TukeyHSD після моєї двосторонньої Anova з R, отримавши таблицю, що містить відсортовані пари, згруповані за суттєвою різницею. (Вибачте за формулювання, я все ще нова в статистиці.) Я хотів би мати щось подібне: Отже, згруповані з зірками чи літерами. Будь-яка ідея? Я перевірив функцію HSD.test()з agricolaeпакету, …

1
Прогнози з використанням glmnet в R
Я намагаюся моделювати деякі дані за допомогою glmnetпакету в Р. Скажімо, у мене є такі дані training_x <- data.frame(variable1 = c(1, 2, 3, 2, 3), variable2 = c(1, 2, 3, 4, 5)) y <- c(1, 2, 3, 4, 5) (Це спрощення; мої дані набагато складніші.) Тоді я використовував наступний код …
13 r  glmnet 

1
Смішні відповіді на іспит зі статистики [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 7 років тому . Виправлення іспитів - це, мабуть, найбільш нудне завдання вчителя. Але нам може бути цікаво збирати смішні відповіді на іспити зі статистики. Один …
13 teaching  humor 

4
Ініціалізація центрів K-засобів за допомогою випадкових підпроборів набору даних?
Якщо у мене є певний набір даних, наскільки розумним буде ініціалізація центрів кластерів за допомогою випадкових вибірок цього набору даних? Наприклад, припустимо, я хочу 5 clusters. Я вважаю 5 random samples, size=20%оригінальний набір даних. Чи можу я потім взяти середнє значення кожного з цих 5 випадкових вибірок і використовувати ці …


1
Використання узагальненого методу моментів (GMM) для обчислення параметру логістичної регресії
Я хочу обчислити коефіцієнти до регресії, що дуже схожа на логістичну регресію (Насправді логістична регресія з іншим коефіцієнтом: колиAможна було б задати). Я думав використовувати ГММ для обчислення коефіцієнтів, але я не впевнений, які умови моменту я повинен використовувати.А1 + е- ( б)0+ b1х1+ b2х2+ … ),A1+e−(b0+b1x1+b2x2+…), \frac{A}{1 + e^{- …


3
Які хороші, вільно доступні журнали для відстеження останніх розробок машинного навчання?
Не соромтеся замінювати "журнали" будь-яким іншим корисним порталом знань. Мені цікаво стежити за новими розробками в машинному навчанні з метою практичного застосування. Я не є академіком, який прагне опублікувати власну роботу (принаймні, не в цій галузі), але хочу знати про можливі нові алгоритми чи хитрощі, які були б корисні на …

2
Лінійна регресія, коли ви знаєте лише , а не безпосередньо
Нехай .Xβ=YXβ=YX\beta =Y Ми не знаємо точно, тільки його кореляції з кожним предиктором, .YYYXtYXtYX^\mathrm{t}Y Звичайним рішенням найменших квадратів (OLS) є і проблеми не виникає.β=(XtX)−1XtYβ=(XtX)−1XtY\beta=(X^\mathrm{t} X)^{-1} X^\mathrm{t}Y Але припустимо, що близький до сингулярності (мультиколінеарність), і вам потрібно оцінити оптимальний параметр хребта. Всі методи , здається, потрібні точні значення .XtXXtXX^\mathrm{t}XYYY Чи існує …

6
Випадковий ліс: як поводитися з новими рівнями факторів у тестовому наборі?
Я намагаюся робити прогнози, використовуючи випадкову лісову модель у Р. Однак я отримую помилки, оскільки деякі фактори мають різні значення в тестовому наборі, ніж у навчальному наборі. Наприклад, коефіцієнт Cat_2має значення 34, 68, 76тощо у тестовому наборі, які не відображаються у навчальному наборі. На жаль, я не маю контролю над …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.