Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

9
Програмне забезпечення для візуалізації для кластеризації
Заблокований . Це запитання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Я хочу кластеризувати ~ 22000 балів. Багато алгоритмів кластеризації працюють краще з початковими здогадами більш високої якості. Які існують інструменти, які можуть дати мені хороше уявлення …

12
Статистичні конференції?
Які найбільш важливі щорічні конференції зі статистики? Правила: Одна конференція за відповідь Додайте посилання на конференцію

4
Продовження: У змішаному діапазоні між графіком ANOVA, який оцінюється середньоквадратичними або фактичними SE
Наразі я закінчую статтю і наткнувся на це питання з вчорашнього дня, яке змусило мене поставити те ж саме питання. Чи краще надати моєму графіку фактичну стандартну помилку в даних або оцінку, отриману з моєї ANOVA? Оскільки питання від вчорашнього дня було досить невизначеним, а моє досить специфічним, я вважав, …

4
Які графічні прийоми використовуються при моделюванні структурних рівнянь?
Мені цікаво, чи існують графічні прийоми, зокрема, або більш застосовні для моделювання структурних рівнянь. Я думаю, що це може бути віднесено до категорій дослідницьких інструментів коваріаційного аналізу або графічної діагностики для оцінки моделі SEM. (Я тут не дуже думаю про діаграми шляху / графіків.)

4
Питання щодо розбіжності KL?
Я порівнюю два розподіли з дивергенцією KL, що повертає мені нестандартне число, яке, відповідно до того, що я читав про цей захід, є кількістю інформації, необхідної для перетворення однієї гіпотези в іншу. У мене є два питання: a) Чи існує спосіб кількісної оцінки розбіжності KL, щоб вона мала більш змістовну …


3
Що означає Фішер під цією цитатою?
Я продовжую бачити всю цю відому цитату скрізь, але не розумію акцентованої частини кожного разу. Людина, яка тимчасово «відкидає» гіпотезу, як звична практика, коли значення є на рівні 1% або вище, неодмінно помилиться у не більше 1% таких рішень. Тому що, коли гіпотеза правильна, він помилиться лише у 1% цих …

1
Яка «суворість» Дебори Майо?
Чи може хто-небудь дати детальне (і чітке) пояснення того, що означає її "суворість" (хіба це не лише функція влади, що оцінюється за різних розбіжностей, сприйнята як нульова гіпотеза?) І як вона вписується в літературну статистичну перевірку загалом?

3
Чи дійсно результати тестів відповідають нормальному розподілу?
Я намагався дізнатися, які дистрибутиви використовувати в GLM, і я трохи заплутався, коли використовувати звичайний розподіл. В одній частині мого підручника написано, що нормальний розподіл може бути корисним для моделювання балів на іспитах. У наступній частині він запитує, який розподіл було б доречним для моделювання претензії на страхування автомобіля. Цього …

5
Модель змішаних ефектів: порівняйте компонент випадкової дисперсії за рівнями змінної групи
Припустимо, у мене є учасників, кожен з яких дає відповідь 20 разів, 10 в одній умові та 10 в іншій. Я підходить до лінійної моделі змішаних ефектів, порівнюючи в кожній умові. Ось відтворюваний приклад, що моделює цю ситуацію за допомогою пакета у :Y YNNNYYYYYYlme4R library(lme4) fml <- "~ condition + …

1
Чому в якості оцінки використовувати нормований показник Джині замість AUC?
Конкуренція Kaggle Безпечний прогноз водія Porto Seguro використовує нормований показник Джині в якості метрики оцінювання, і це мене зацікавило причин такого вибору. Які переваги використання нормалізованої оцінки джині замість найбільш звичайних показників, таких як AUC, для оцінки?

3
Налаштування гіпер параметрів: Випадковий пошук та оптимізація Байєса
Отже, ми знаємо, що випадковий пошук працює краще, ніж пошук в сітці, але останнім підходом є байєсівська оптимізація (з використанням гауссових процесів). Я шукав порівняння між ними, і нічого не знайшов. Я знаю, що в cs231n Стенфорда вони згадують лише випадковий пошук, але можливо, що вони хотіли зробити все просто. …

1
Caret glmnet vs cv.glmnet
Здається, існує велика плутанина в порівнянні використання glmnetв рамках caretпошуку оптимальної лямбда та використання cv.glmnetтого ж завдання. Поставлено багато питань, наприклад: Класифікаційна модель train.glmnet vs. cv.glmnet? Який правильний спосіб використання glmnet з каретою? Перехресне підтвердження `glmnet` за допомогою` caret` але відповіді не надано, що може бути пов'язано з відтворюваністю питання. …

1
Інтуїтивно зрозуміле пояснення, чому працює процедура БНД Бенджаміні-Хохберга?
Чи є простий спосіб пояснити, чому процедура Бенджаміні та Хохберга (1995) насправді контролює показник помилкового виявлення (FDR)? Ця процедура є настільки елегантною та компактною, але доказ того, чому вона працює під незалежністю (міститься в додатку до їх документа 1995 року ), не дуже доступний.

1
Різниця між моделлю перехоплення або без неї в логістичній регресії
Мені подобається розуміти різницю між моделлю перехоплення або без неї в логістичній регресії Чи є різниця між ними, за винятком того, що коефіцієнти перехоплення відносять до журналу (коефіцієнта шансів) відносно базової групи і без перехоплення вони розглядають журнал (шанси)? з того, що я бачив, коефіцієнти однакові в обох випадках, але …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.