Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Що таке регіон найвищої щільності (HDR)?
У статистичному висновку згадується проблема 9.6b, "Регіон найвищої щільності (HDR)". Однак визначення цього терміна в книзі я не знайшов. Один подібний термін - найвища задня щільність (ВПР). Але це не вписується в цей контекст, оскільки 9.6b нічого не згадує про попереднє. І в запропонованому рішенні сказано лише, що "очевидно, що …

4
Як визначити, чи мій розподіл даних симетричний?
Я знаю, що якщо медіана і середня величина приблизно рівні, то це означає, що існує симетричне розподіл, але в цьому конкретному випадку я не впевнений. Середня та медіана досить близькі (лише 0,487 м / різниця в жовчі), що призведе до того, що я можу сказати, що існує симетричний розподіл, але …

2
Чому доказ Вілкса 1938 р. Не працює для неправильно визначених моделей?
У відомому документі 1938 р. (" Великий вибірковий розподіл коефіцієнта ймовірності для тестування складених гіпотез ", "Анали математичної статистики", 9: 60-62) Семюел Вілкс отримав асимптотичний розподіл у (коефіцієнт вірогідності журналу) для вкладених гіпотез, при припущенні, що більша гіпотеза правильно вказана. Обмежуючим розподілом є (chi-квадрат) з ступенями свободи, де - кількість …

2
Яка функція втрат жорсткої маржі SVM?
Люди кажуть, що SVM з м'якою маржею використовує функцію втрати шарніра: . Однак фактична цільова функція, яку SVM з м'яким запасом намагається мінімізувати, - \ frac {1} {2} \ | w \ | ^ 2 + C \ sum_i \ max (0,1-y_i (w ^ \ intercal x_i + b) ) …

2
Визначення часу автокореляції (для ефективного розміру вибірки)
У літературі я знайшов два визначення щодо часу автокореляції слабо нерухомого часового ряду: τa=1+2∑k=1∞ρkversusτb=1+2∑k=1∞|ρk|τa=1+2∑k=1∞ρkversusτb=1+2∑k=1∞|ρk| \tau_a = 1+2\sum_{k=1}^\infty \rho_k \quad \text{versus} \quad \tau_b = 1+2\sum_{k=1}^\infty \left|\rho_k\right| де - автокореляція в відстані . ρk=Cov[Xt,Xt+h]Var[Xt]ρk=Cov[Xt,Xt+h]Var[Xt]\rho_k = \frac{\text{Cov}[X_t,X_{t+h}]}{\text{Var}[X_t]}kkk Одним із застосувань часу автокореляції є пошук "ефективного розміру вибірки": якщо у вас є спостережень за …

3
Статистичне тлумачення максимального ентропійного розподілу
Я використав принцип максимальної ентропії для обгрунтування використання декількох розподілів у різних налаштуваннях; однак мені ще не вдається сформулювати статистичну, на відміну від інформаційно-теоретичної інтерпретації максимальної ентропії. Іншими словами, що означає максимізація ентропії щодо статистичних властивостей розподілу? Хтось наткнувся чи, можливо, виявив собі статистичну інтерпретацію макс. ентропійні розподіли, які не …

2
Що означає «довірений» (у контексті статистики)?
Коли я Google для "fisher" "fiducial" ... Я впевнено отримую чимало хітів, але всі ті, за якими я дотримувався, абсолютно поза моїм розумінням. У всіх цих хітів, схоже, є одне спільне: всі вони написані для пофарбованих у шерсть статистиків, людей, ретельно поглиблених теорією, практикою, історією та знаннями статистики. (Отже, жоден …

4
Чому дослідники використовують 10-кратну перехресну перевірку замість тестування на наборі перевірки?
Я прочитав багато наукових праць про класифікацію настроїв та пов'язані з ними теми. Більшість із них використовують 10-кратну перехресну перевірку для підготовки та тестування класифікаторів. Це означає, що не проводиться окреме тестування / перевірка. Чому так? Які переваги / недоліки такого підходу, особливо для тих, хто проводить дослідження?

6
Точність тесту вища, ніж тренування. Як інтерпретувати?
У мене є набір даних, що містить щонайменше 150 прикладів (розділених на навчальні та тестові), з багатьма можливостями (вище 1000). Мені потрібно порівняти класифікатори та методи вибору функцій, які добре працюють на даних. Отже, я використовую три методи класифікації (J48, NB, SVM) та 2 методи вибору функції (CFS, WrapperSubset) з …

1
Колмогоров-Смирнов з дискретними даними: Яке правильне використання dgof :: ks.test у R?
Питання для початківців: Я хочу перевірити, чи походять два дискретні набори даних з одного розподілу. Мені було запропоновано тест Колмогорова-Смірнова. Коновер ( Практична непараметрична статистика , 3d), схоже, говорить про те, що для цього можна використати тест Колмогорова-Смірнова, але його поведінка є «консервативною» з дискретними розподілами, і я не впевнений, …

3
Інтерпретація номерів AIC та BIC
Я шукаю приклади, як інтерпретувати оцінки AIC (інформаційний критерій Akaike) та BIC (байєсівський інформаційний критерій). Чи можна негативну різницю між BIC інтерпретувати як задні шанси однієї моделі над іншою? Як я можу це поставити словами? Наприклад, BIC = -2 може означати, що шанси на кращу модель порівняно з іншою моделлю …

2
Випадкові ліси для багатоваріантної регресії
У мене проблема з виходів із вхідними функціями та виходами. Виходи мають складну нелінійну кореляційну структуру.dxdxd_xdydyd_y Я хотів би використати випадкові ліси, щоб зробити регресію. Наскільки я можу сказати, випадкові ліси для регресії працюють лише з одним виходом, тому мені доведеться тренувати випадкові ліси - по одному на кожен вихід. …

4
Імпутація пропущених значень для PCA
Я використовував цю prcomp()функцію для виконання PCA (аналіз основних компонентів) в Р. Однак у цій функції є помилка, така що na.actionпараметр не працює. Я попросив допомоги щодо stackoverflow ; двоє користувачів там запропонували два різні способи поводження з NAцінностями. Однак проблема обох рішень полягає в тому, що коли є NAзначення, …

1
Встановлення вузлів у натуральних кубічних сплайнах у R
У мене є дані з багатьма співвіднесеними функціями, і я хочу розпочати, зменшуючи функції з плавною базовою функцією, перш ніж запускати LDA. Я намагаюся використовувати в splinesупаковці з nsфункцією природні кубічні сплайни . Як мені займатися призначенням вузлів? Ось основний код R: library(splines) lda.pred <- lda(y ~ ns(x, knots=5)) Але …
23 r  splines 

4
Бібліотеки C ++ для статистичних обчислень
У мене є особливий алгоритм MCMC, який я хотів би перенести на C / C ++. Значна частина дорогих обчислень вже є на C через Cython, але я хочу, щоб весь зразок був написаний компільованою мовою, щоб я міг просто писати обгортки для Python / R / Matlab / що …
23 mcmc  software  c++  computing 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.