Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Коефіцієнт кореляції внутрішньокласового рівня в змішаній моделі зі випадковими нахилами
У мене є такі моделі m_plotзабезпечені lme4::lmerзі схрещеними випадковими ефектами для учасників ( lfdn) і елементів ( content): Random effects: Groups Name Variance Std.Dev. Corr lfdn (Intercept) 172.173 13.121 role1 62.351 7.896 0.03 inference1 24.640 4.964 0.08 -0.30 inference2 52.366 7.236 -0.05 0.17 -0.83 inference3 21.295 4.615 -0.03 0.22 0.86 …

1
Чи можна статистично показати, що автомобілі використовуються як зброя вбивства?
Нещодавно я почув історію, в якій хтось сказав, що якщо вони хочуть когось вбити (і піти з ним), вони зроблять це зі своєю машиною. Вони наводили різні статистичні дані про кількість смертей, пов’язаних із авто (включаючи автомобіль на пішоходах) разом із додатковою статистикою щодо кількості водіїв, фактично засуджених до будь-якого …

2
Як вибрати розміри навчальних, перехресних перевірок та тестових наборів для малих даних про розмір вибірки?
Припустимо, у мене невеликий розмір вибірки, наприклад N = 100, і два класи. Як я повинен вибрати розміри навчальних, перехресних перевірок та тестових наборів для машинного навчання? Я б інтуїтивно вибирав Розмір тренувального набору - 50 Перехресне встановлення набору розміром 25 та Розмір тесту - 25. Але, мабуть, це має …

3
2-гауссова модель суміші з MCMC та PyMC
Проблема Я хочу відповідати модельним параметрам простої сукупності 2-гауссівської суміші. Враховуючи всю суєту навколо байєсівських методів, я хочу зрозуміти, чи є для цієї проблеми байєсівський висновок кращим інструментом для традиційних методів підгонки. Поки MCMC в цьому іграшковому прикладі дуже погано працює, але, можливо, я просто щось не помітив. Тож давайте …


1
Стандартне відхилення середньозваженого середнього значення
Я написав просту функцію в Python для обчислення експоненціально зваженого середнього: def test(): x = [1,2,3,4,5] alpha = 0.98 s_old = x[0] for i in range(1, len(x)): s = alpha * x[i] + (1- alpha) * s_old s_old = s return s Однак як я можу розрахувати відповідну SD?

2
Як статистична статистика Пірсона Chi наближає до розподілу квадрата Chi
Отже, якщо Статистика квадратиків Пірсона наведена для таблиці , то її форма така:1×N1×N1 \times N ∑i=1n(Oi−Ei)2Ei∑i=1n(Oi−Ei)2Ei\sum_{i=1}^n\frac{(O_i - E_i)^2}{E_i} Тоді це наближає , розподіл Chi-квадрата з градусами свободи, оскільки розмір вибірки збільшується. n - 1 Nχ2n−1χn−12\chi_{n-1}^2n−1n−1n-1NNN Я не розумію, як працює це асимптотичне наближення. Я відчуваю, що в знаменниках слід замінити …

2
Як змінити поріг класифікації у R randomForests?
Вся література з моделювання розподілу видів передбачає, що при прогнозуванні присутності / відсутності виду за допомогою моделі, яка видає ймовірності (наприклад, RandomForests), важливим є вибір порогової ймовірності, за якою фактично класифікувати вид як наявність чи відсутність, і слід не завжди покладаються на дефолт 0,5. Мені потрібна допомога з цим! Ось …

2
Узагальнений тест коефіцієнта ймовірності журналу для моделей, які не вкладені
Я розумію, що якщо у мене дві моделі A і B і A вкладено в B, то, зважаючи на деякі дані, я можу підігнати параметри A і B за допомогою MLE і застосувати узагальнений тест коефіцієнта ймовірності журналу. Зокрема, розподіл тесту повинно бути з ступенями свободи , де є різниця …

1
Чому для пакетування використовуються зразки завантажувального пристрою?
Баггінг - це процес створення N учнів на N різних зразках завантажувальної програми, а потім взяття середнього значення їх прогнозів. Моє запитання: Чому б не використовувати будь-який інший тип відбору проб? Навіщо використовувати зразки завантажувальної програми?
10 bagging 

4
Динамічний викривлення часу для нерегулярних часових рядів
Останнім часом я багато читав про динамічне викривлення часу (DTW). Я дуже здивований, що взагалі немає літератури про застосування ДТВ до нерегулярних часових рядів, або, принаймні, я не міг її знайти. Чи може хто-небудь дати мені посилання на щось, що стосується цього питання, чи, можливо, навіть його реалізацію?

2
Втручання з різницею
При проведенні аналізу втручання з даними часових рядів (він же, перерваний часовий ряд), як обговорюється тут, наприклад, одна з вимог, що я маю - це оцінити загальний приріст (або втрату) внаслідок втручання - тобто кількість одержаних або втрачених одиниць (змінна Y ). Не зовсім розуміючи, як оцінити функцію втручання, використовуючи …

2
Caret varImp для моделі randomForest
У мене виникають проблеми з розумінням того, як varImpфункція працює для моделі randomForest з caretпакетом. У наведеному нижче прикладі функція var3 набуває нульового значення, використовуючи функцію caret varImp, але основна випадкова кінцева модельForest має ненульове значення для функції var3. Чому це так? require(randomForest) require(caret) rf <- train(x, y, method = …
10 r  caret  random-forest 

1
Чи валідація витримки є кращим наближенням "отримання нових даних", ніж резюме в k-кратному стані?
Я переосмислював відповідь, яку я дав на питання пару тижнів тому Перехресне підтвердження витримки виробляє єдиний тестовий набір, який можна повторно використовувати для демонстрації. Ми всі, мабуть, погоджуємось, що це багато в чому негативна особливість, оскільки один витриманий набір може виявитися нерепрезентативним через випадковість. Більше того, ви можете закінчити перевищення …

3
Чи можна в R (або взагалі) змусити коефіцієнти регресії бути певною ознакою?
Я працюю з деякими реальними даними, і регресійні моделі дають певні протиінтуїтивні результати. Зазвичай я довіряю статистиці, але насправді деякі з цих речей не можуть бути правдивими. Основна проблема, яку я бачу, полягає в тому, що збільшення однієї змінної викликає посилення реакції, коли насправді вони мають негативно співвідноситись. Чи є …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.