Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Симуляційне дослідження: як вибрати кількість ітерацій?
Я хотів би генерувати дані за допомогою "Моделі 1" та підходити до них "Модель 2". Основна ідея полягає у дослідженні властивостей міцності "Моделі 2". Мене особливо цікавить ступінь покриття 95% довірчого інтервалу (на основі нормального наближення). Як встановити кількість запусків ітерації? Чи правда, що більші, ніж необхідні, тиражі можуть призвести …

1
Залишки Шенфельда
У моделі пропорційної небезпеки Кокса з багатьма змінними, якщо залишки Шенфельда не є однозначною для однієї зі змінних, чи це може визнати недійсною всю модель або просто може бути проігнорована лише неякісна змінна? Тобто інтерпретуйте коефіцієнти для інших змінних, але не інтерпретуйте отримані коефіцієнти для малоефективної змінної. Існує кілька стандартних …

2
Параметр дисперсії у висновку GLM
Я провів glm в R, і біля нижньої частини summary()виводу, він констатує (Dispersion parameter for gaussian family taken to be 28.35031) Я зробив кілька розкопок в Google і дізнався, що параметр дисперсії використовується для відповідності стандартним помилкам. Я сподіваюся, що хтось міг би надати більш детальну інформацію про те, що …

1
Рідж і LASSO отримали структуру коваріації?
Прочитавши розділ 3 в Елементах статистичного навчання (Хасті, Тібшрани та Фрідман), я задумався, чи можна реалізувати відомі методи усадки, які цитуються у назві цього питання, з урахуванням структури коваріації, тобто мінімізувати (можливо, більш загальне ) кількість ( у⃗ - Xβ⃗ )ТV- 1( у⃗ - Xβ⃗ ) + λ f( β) …

2
Вступ до прикладної ймовірності для чистих математиків?
У мене є освіта на рівні випускників з чистої математики (теорія вимірювань, функціональний аналіз, алгебра оператора тощо). У мене також є робота, яка вимагає певних знань теорії ймовірностей (від базових принципів до технічних технологій навчання). Моє запитання: Чи може хтось надати деякі канонічні читання та довідкові матеріали, які: Самостійне введення …


3
Наскільки виправданим є вибір
Коли я визначаю свою лямбда через перехресну перевірку, всі коефіцієнти стають нульовими. Але у мене є деякі натяки з літератури про те, що деякі прогнози обов'язково повинні вплинути на результат. Чи сміття довільно вибирати лямбда, щоб було стільки ж рідкості, скільки бажається? Я хочу вибрати топ-10 прогнозів з 135 для …
11 lasso 

2
Як перетворити стандартизовані коефіцієнти в нестандартні коефіцієнти?
Моя мета - використовувати коефіцієнти, отримані попередніми дослідженнями з цього питання, для прогнозування фактичних результатів, отриманих набором незалежних змінних. Однак у дослідницькому документі наведено лише коефіцієнти бета-версії та значення t. Хотілося б знати, чи можна перетворити стандартизовані коефіцієнти в нестандартні. Було б корисно перетворити мої нестандартні незалежні змінні в стандартизовані …

3
Курс експериментального проектування для шахтарів даних
Я вчений-інформатик, що працює в галузі видобутку даних. Не секрет сказати, що комп'ютерні фахівці доволі погано займаються систематичною експериментальною розробкою та оцінкою - використання p-значень і оцінок достовірності вважається просунутим :). Що я хотів би знати, чи є хороші курси / матеріал, щоб навчити комп'ютерних спеціалістів про хороший експериментальний дизайн. …

4
Чи є тест на опущені змінні зміщення в OLS?
Мені відомо тест Ramset Reset, який може виявити нелінійні залежності. Однак якщо ви просто викинете один з коефіцієнтів регресії (просто лінійні залежності), ви можете отримати зміщення, залежно від кореляцій. Очевидно, тест Скидання не виявляється. Я не знайшов тест для цього випадку, але це твердження: "Ви не можете перевірити OVB, крім …

2
Чому б не виконати метааналіз на частково імітованих даних?
Фон: Типовий метааналіз у психології може намагатися моделювати співвідношення між двома змінними X та Y. Аналіз, як правило, передбачає отримання набору відповідних кореляцій з літератури разом із розмірами вибірки. Потім формули можуть бути застосовані для обчислення середньозваженого співвідношення. Тоді можуть бути проведені аналізи, щоб побачити, чи відрізняються кореляції в різних …

3
Середній SD або Median MAD для узагальнення сильно перекошеної змінної?
Я працюю над сильно перекошеними даними, тому я використовую медіану замість середнього, щоб узагальнити центральну тенденцію. Я хотів би мати міру дисперсності. Хоча я часто бачу людей, які повідомляють про середнє стандартне відхилення±±\pm або медіану четвертинки,±±\pm щоб узагальнити центральну тенденцію, чи нормально повідомляти про середню середню абсолютну дисперсію (MAD)±±\pm ? …

2
Довідка для
У своїй відповіді на моє попереднє запитання @Erik P. дає вираз де κ - надлишок куртозу розподілу. Наведено посилання на запис у Вікіпедії щодорозподілу вибіркової дисперсії, але на сторінці Вікіпедії написано "потрібне цитування".Var[s2] = σ4( 2n - 1+ κн),Var[s2]=σ4(2n−1+κn), \mathrm{Var}[s^2]=\sigma^4 \left(\frac{2}{n-1} + \frac{\kappa}{n}\right) \>, κκ\kappa Моє первинне запитання: чи є …


5
Чи можу я перевірити гіпотезу щодо перекосу нормальних даних?
У мене є колекція даних, яку, на мою думку, спочатку я вважав звичайною. Тоді я насправді переглянув це і зрозумів, що це не так, головним чином через те, що дані перекошені, і я також зробив тест на шапіро-вілкс. Я все одно хотів би проаналізувати це за допомогою статистичних методів, і …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.