Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Залишки Пірсона
Питання початківця щодо залишків Пірсона в контексті тесту чі-квадрата на придатність придатності: Як і тестова статистика, chisq.testфункція R повідомляє про залишковий Пірсон: (obs - exp) / sqrt(exp) Я розумію, чому погляд на різну різницю між спостережуваними та очікуваними значеннями не є таким інформативним, оскільки менша вибірка призведе до меншої різниці. …

1
Питання про те, як нормалізувати коефіцієнт регресії
Не впевнений, чи нормалізувати це правильне слово, яке тут вживають, але я постараюся зробити все можливе, щоб проілюструвати те, що я намагаюся запитати. Тут використаний оцінювач - найменше квадратів. Припустимо, у вас , ви можете зосереджувати його навколо середнього значення де і , так що більше не впливає на оцінку …

1
Верхні межі для щільності копули?
Фреш-Хёфдінг верхньої межі відноситься до функції розподілу копули і задається С( у1, . . . , уг) ≤ хв { u1, . . , уг} .С(у1,...,уг)≤хв{у1,..,уг}.C(u_1,...,u_d)\leq \min\{u_1,..,u_d\}. Чи є схожа (в тому сенсі, що це залежить від граничної щільності) верхньої межі для щільності копули замість CDF?в ( у1, . . …

1
Розподіл з
Чи є там інформація про розподіл, чий nnn кумулянт задається 1n1n\frac 1 n ? Функція, що генерує кумулянт, має вигляд κ(t)=∫10etx−1x dx.κ(t)=∫01etx−1x dx. \kappa(t) = \int_0 ^ 1 \frac{e^{tx} - 1}{x} \ dx. Я зіткнувся з цим як обмежуючий розподіл деяких випадкових змінних, але я не зміг знайти жодної інформації …

1
Критерії встановлення ширини вікна STL
Використовуючи Rдля розкладання STL, s.windowконтролює, наскільки швидко може змінитися сезонний компонент. Невеликі значення дозволяють швидше змінюватися. Встановлення сезонного вікна нескінченним є еквівалентним примушуванню сезонного компонента бути періодичним (тобто однаковим протягом років). Мої запитання: Якщо у мене є щомісячний часовий ряд (тобто частота дорівнює ), які критерії слід використовувати для встановлення …

1
Правильна техніка завантаження для кластерних даних?
У мене є питання щодо належної техніки завантаження для використання з даними, де є сильна кластеризація. Мені було доручено оцінити багатоваріантну модель прогнозування змішаних ефектів щодо даних страхових відшкодувань, оцінивши поточну базову модель на даних останніх претензій, щоб визначити, наскільки модель спрогнозує, які епізоди догляду містять найвищу частоту сеансів (верхня …

2
Інформаційна матриця, що спостерігається, є послідовною оцінкою очікуваної інформаційної матриці?
Я намагаюся довести, що спостережувана інформаційна матриця, оцінена за слабко послідовним оцінкою максимальної ймовірності (MLE), є слабко послідовним оцінником очікуваної інформаційної матриці. Це широко цитований результат, але ніхто не дає посилань чи доказів (я вичерпав, я думаю, перші 20 сторінок результатів Google і мої підручники з статистикою)! Використовуючи слабко послідовну …

2
тренінгові підходи для сильно незбалансованого набору даних
У мене сильно незбалансований набір даних тесту. Позитивний набір складається з 100 випадків, тоді як негативний - 1500 випадків. Що стосується тренінгу, у мене є більший пул кандидатів: позитивний навчальний набір має 1200 випадків, а негативний навчальний набір - 12000 випадків. Для подібного сценарію у мене є кілька варіантів: 1) …

2
Які попередні розподіли могли / повинні бути використані для дисперсії в ієрархічній байєсанській моделі, коли середня дисперсія представляє інтерес?
У своїй широко цитованій статті Попередні розподіли щодо параметрів дисперсії в ієрархічних моделях (916 цитування до цих пір в Google Академія) Гельман пропонує, що хорошими неінформативними попередніми розподілами для дисперсії в ієрархічній баєсовій моделі є рівномірний розподіл і розподіл на пів t. Якщо я правильно розумію, це працює добре, коли …

3
Необов’язкові правила зупинки не в підручниках
Правила зупинки впливають на взаємозв'язок між значеннями Р та коефіцієнтами помилок, пов'язаних з рішеннями. Нещодавній документ Simmons et al. 2011 р. Запроваджує термін свободи дослідника для опису колекції поведінки, яку вони вважають відповідальною за багато доповідей у ​​психологічній літературі, які, як було виявлено, не відтворюються. З такої поведінки я зараз …

2
Вибір параметра складності в CART
У процедурі rpart () для створення моделей CART ви вказуєте параметр складності, до якого потрібно обрізати дерево. Я бачив дві різні рекомендації щодо вибору параметра складності: Виберіть параметр складності, пов'язаний з мінімально можливою перехресною вадою помилки. Цей метод рекомендують Quick-R та HSAUR. Виберіть параметр найбільшої складності, чия оціночна перехресна перевірена …
16 r  cart  rpart 

4
Низька точність класифікації, що робити далі?
Отже, я новачок у галузі ML та намагаюся зробити якусь класифікацію. Моя мета - передбачити результат спортивної події. Я зібрав декілька історичних даних і зараз намагаюся підготувати класифікатора. У мене було близько 1200 зразків, 0,2 з них я розділив для тестових цілей, інші я вклав у пошук сітки (включена перехресна …

2
Які процеси можуть генерувати розподілені по Лапласу (подвійні експоненціальні) дані чи параметри?
Багато розповсюджень мають "міфи про походження" або приклади фізичних процесів, які вони добре описують: Ви можете отримати нормально розповсюджені дані з сум некорельованих помилок за допомогою теореми центрального граничного рівня Ви можете отримати біноміально розподілені дані від незалежних фліп монет або розподілених Пуассоном змінних з межі цього процесу Ви можете …

4
Обрамлення негативного біноміального розподілу для послідовності ДНК
Негативний біноміальний розподіл став популярною моделлю для підрахунку даних (зокрема, очікуваної кількості зчитування послідовностей у певній області геному від заданого експерименту) у біоінформатиці. Пояснення варіюються: Деякі пояснюють це як щось, що працює як розподіл Пуассона, але має додатковий параметр, що дозволяє більше свободи моделювати справжній розподіл, причому дисперсія не обов'язково …

3
Пуассон - це експоненціальна, як до чого гамма-Пуассон?
Розподіл Пуассона може вимірювати події за одиницю часу, а параметр - . Експонентний розподіл вимірює час до наступної події параметром . Можна перетворити один розподіл в інший, залежно від того, чи легше моделювати події чи час.1λλ\lambda1λ1λ\frac{1}{\lambda} Тепер гамма-пуассон - це "розтягнутий" пуассон з більшою дисперсією. Розподіл Вейбула - це "розтягнута" …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.