Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Чи існує чіткий набір умов, за яких шляхи ласо, гряди чи еластичного сіткового розчину є монотонними?
Питання про те, що зробити висновок із цього сюжету ласо (glmnet), демонструє шляхи рішення для оцінювача ласо, які не є монотонними. Тобто, деякі коефіцієнти ростуть в абсолютній вартості, перш ніж вони скорочуються. Я застосовував ці моделі до декількох різних типів наборів даних і ніколи не бачив такої поведінки "в дикій …

1
Інтерпретація даткового тесту Хартіганса
Я хотів би знайти спосіб кількісної оцінки інтенсивності бімодальності деяких розподілів, отриманих емпіричним шляхом. З того, що я прочитав, все ще є дебати щодо способу кількісної оцінки бімодальності. Я вирішив використовувати тест Hartigans, який здається єдиним, доступним на R (оригінальний папір: http://www.stat.washington.edu/wxs/Stat593-s03/Literature/hartigan85a.pdf ). Тест занурення Хартігана визначається як: "Тест занурення …
18 r  distributions 

1
Доказ формули LOOCV
Зі вступу до статистичного навчання Джеймса та ін., Оцінка одноразової перехресної валідації (LOOCV) визначається де .CV(n)=1n∑i=1nMSEiCV(n)=1n∑i=1nMSEi\text{CV}_{(n)} = \dfrac{1}{n}\sum\limits_{i=1}^{n}\text{MSE}_iMSEi=(yi−y^i)2MSEi=(yi−y^i)2\text{MSE}_i = (y_i-\hat{y}_i)^2 Без доказу рівняння (5.2) зазначає, що для найменших квадратів або поліноміальної регресії (чи стосується це регресія лише на одній змінній мені невідомо), де " є й встроенна значення з початкових …

2
Згладжування - коли ним користуватися, а коли не робити?
У блозі Вільяма Бріггса є досить старий пост, який розглядає підводні камені згладжування даних і перенесення цих згладжених даних до аналізу. Ключовим аргументом є: Якщо в момент божевілля ви робите згладжені дані часових рядів і використовуєте їх як вхід для інших аналізів, ви різко збільшуєте ймовірність обдурити себе! Це відбувається …

5
Навіщо використовувати теорію крайніх значень?
Я надходжу з цивільного будівництва, в якому ми використовуємо Теорію екстремальних значень , як розподіл GEV, щоб передбачити значення певних подій, як-от Найбільша швидкість вітру , тобто значення, на яке 98,5% швидкості вітру буде нижчою. Моє запитання полягає в тому, навіщо використовувати такий екстремальний розподіл вартості ? Чи не було …

3
Чому статистика розривів для k-засобів пропонує один кластер, навіть якщо їх очевидно два?
Я використовую K-засоби для кластеризації своїх даних і шукав спосіб запропонувати "оптимальний" номер кластера. Статистика прогалин, здається, є загальним способом пошуку хорошої кількості кластерів. Чомусь він повертає 1 як оптимальне число кластера, але коли я дивлюся на дані, то очевидно, що є 2 кластери: Ось як я називаю розрив у …

1
Розміщення стрілок на біплоті PCA
Я хочу реалізувати біплот для аналізу основних компонентів (PCA) в JavaScript. Моє запитання полягає в тому, як я можу визначити координати стрілок з виводу сингулярного розкладання вектора (SVD) матриці даних?U,V,DU,V,DU,V,D Ось приклад біплота виробництва R: biplot(prcomp(iris[,1:4])) Я спробував розглянути це у статті Вікіпедії про біплот, але це не дуже корисно. …
18 pca  svd  biplot 

2
P-значення в тесті з двома хвостами з асиметричним нульовим розподілом
Моя ситуація така: я хочу, через дослідження Монте-Карло, порівняти -значення двох різних тестів для статистичної значущості оцінюваного параметра (нульовим є "немає ефекту - параметр дорівнює нулю", а мається на увазі альтернатива " параметр не дорівнює нулю "). Тест А - стандартний "незалежний двопробний тест на рівність засобів" , з рівними …

5
Яка хороша книга про філософію байєсівського мислення?
Яка хороша книга про байєсівську філософію, яка протиставляє суб'єктивістам проти об’єктивістів, що пояснює погляд на ймовірність як стан знань у баєсівській статистиці тощо? Можливо, книга Сайджена? Спочатку я думав, що Бергер (1986) міг би працювати, але це не те, що я шукаю. Пошук такої книги просто не веде до результатів, …


1
Зрозуміле мовне значення "залежних" та "незалежних" тестів у літературі з кількома порівняннями?
Як у літературі щодо рівня помилок (FWER), так і щодо помилкового виявлення (FDR), окремі методи контролю FWER або FDR вважаються відповідними залежним або незалежним тестам. Наприклад, у документі 1979 р. "Проста послідовно відхиляюча процедура багаторазового випробування" Холм писав, щоб протиставити його метод посилення Шідака проти його покрокового методу контролю Бонферроні: …

5
Виявлення змін у часових рядах (приклад R)
Я хотів би виявити зміни в даних часових рядів, які зазвичай мають однакову форму. Поки я працював з changepointпакетом для R cpt.mean(), cpt.var()та cpt.meanvar()функцій та . cpt.mean()з методом PELT добре працює, коли дані зазвичай залишаються на одному рівні. Однак я також хотів би виявити зміни під час спуску. Прикладом зміни, …

3
Про точний тест Фішера: Який тест був би доречним, якби дама не знала кількість перших чашок молока?
У відомому експерименті з чаєм, який пробував чай від Р. Фішера, леді повідомляється про те, скільки є чашок для молока / чаю з першим чаєм (4 на кожну з 8 чашок). Це враховує фіксовану граничну загальну припущення про тест Фішера. Я уявляв, як роблю цей тест зі своїм другом, але …

2
Прихована модель Маркова проти моделі переходу Маркова проти моделі держави-простору…?
Для своєї магістерської роботи я працюю над розробкою статистичної моделі переходів між різними станами, визначеної серологічним статусом. Поки що я не буду занадто багато деталей давати в цьому контексті, оскільки моє питання є більш загальним / теоретичним. У будь-якому випадку, моя інтуїція полягає в тому, що я повинен використовувати модель …

1
Використання завантажувальної програми під H0 для проведення тесту на різницю двох засобів: заміна в межах груп або в об'єднаному зразку
Припустимо, у мене є дані з двома незалежними групами: g1.lengths <- c (112.64, 97.10, 84.18, 106.96, 98.42, 101.66) g2.lengths <- c (84.44, 82.10, 83.26, 81.02, 81.86, 86.80, 85.84, 97.08, 79.64, 83.32, 91.04, 85.92, 73.52, 85.58, 97.70, 89.72, 88.92, 103.72, 105.02, 99.48, 89.50, 81.74) group = rep (c ("g1", "g2"), c …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.