Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Як можна використовувати моделі машинного навчання (GBM, NN тощо) для аналізу виживання?
Я знаю, що традиційні статистичні моделі, такі як регресія пропорційних ризиків Кокса та деякі моделі Каплана-Мейєра, можуть використовуватися для прогнозування днів до наступного виникнення події, наприклад, відмови тощо, тобто аналізу виживання Запитання Як можна використовувати регресійну версію моделей машинного навчання, таких як GBM, нейронні мережі тощо, для прогнозування днів до …

3
Які основні статистичні внески Рональда Фішера?
Річард Докінз описав Рональда Фішера як "батька сучасної статистики та експериментального дизайну", рядок якого цитується у біографії Вікіпедії Фішера . А також Андерс Халд назвав його "генієм, який майже власноруч створив основи сучасної статистичної науки" у своїй книзі "Історія математичної статистики" . Мені просто цікаво, що саме він зробив, щоб …

1
Оцініть випадковий ліс: OOB vs CV
Коли ми оцінюємо якість випадкового лісу, наприклад, використовуючи AUC, чи є більш доцільним обчислити ці величини за зразками з мішків або над набором перехресних перевірок? Я чую, що обчислення його через зразки OOB дає більш песимістичну оцінку, але не розумію, чому.

2
Пояснення Леймана щодо цензури в аналізі виживання
Я читав про те, що таке цензура, і як це потрібно враховувати в аналізі виживання, але хотів би почути менш математичне визначення цього і більш інтуїтивне визначення (фотографії були б чудовими!). Чи може хто-небудь надати мені пояснення: 1) цензура та 2) як це впливає на такі речі, як криві Каплана-Меєра …

2
Доведіть, що максимальний розподіл ентропії з фіксованою матрицею коваріації є гауссом
Я намагаюсь скрутити наступний доказ того, що у Гауса є максимальна ентропія. Як має значення зірковий крок? Конкретна коваріація фіксує лише другий момент. Що відбувається з третім, четвертим, п'ятим моментами тощо?

1
Струсово-дисперсійне розкладання
У розділі 3.2 Розпізнавання шаблону Єпископа та машинного навчання він розглядає декомпозицію дисперсійної дисперсії, заявляючи, що для функції збитку в квадраті очікувана втрата може бути розкладена на термін зсуву в квадрат (який описує, наскільки середні прогнози від істинного модель), термін дисперсії (який описує поширення прогнозів навколо середнього) та термін шуму …

4
Графіку малих зразків
У мене є невеликий набір даних 14 окремих разів для виконання завдання. Однак у мене виникають труднощі з пошуком відповідного графіка, який використовуватиметься для графіка даних. Якщо вибірка була б більшою, я використовував би графічну скриньку або гістограму, але я не впевнений, чи було б доцільно використовувати в цьому випадку, …


1
Чи покладається ANOVA на метод моментів, а не на максимальну ймовірність?
Я бачу в різних місцях, що ANOVA робить свою оцінку методом моментів. Мене бентежить це твердження, оскільки, хоча я не знайомий з методом моментів, моє розуміння полягає в тому, що це щось інше і не еквівалентне методу максимальної ймовірності; з іншого боку, ANOVA можна розглядати як лінійну регресію з категоричними …

1
Теорема Байєса з множинними умовами
Я не розумію, як було отримано це рівняння. P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M_{1}\cap M_{2}) \leq \frac{P(I)}{P(I')}\cdot \frac{P(M_{1}|I)P(M_{2}|I)}{P(M_{1}|I')P(M_{2}|I')} Це рівняння було виведене з статті "Проба з імовірністю", де в якості прикладу була подана справа О. Я. Сімпсона. Підсудного засуджено за подвійне вбивство та проти нього введено два докази. M1M1M_{1} - це випадок, коли кров підсудного …

1
Чому Деніел Вілкс (2011) каже, що регресія основних компонентів "буде упередженою"?
У статистичних методах наук про атмосферу Даніель Вілкс зазначає, що багаторазова лінійна регресія може призвести до проблем, якщо між предикторами є дуже сильні взаємозв'язки (3-е видання, стор. 559-560): Патологія, яка може виникати при множинній лінійній регресії, полягає в тому, що набір змінних прогнозів, що мають сильні взаємні кореляції, може призвести …
13 regression  pca  bias 

2
Чи прогноз є «золотим критерієм» для судження про здатність статистиків?
Я читав лінійні моделі підручника Faraway з R (1-е видання) минулих вихідних. Далекий розділ мав назву "Статистична стратегія та невизначеність моделі". Він описав (стр 158) , що він штучно створений деякі дані , використовуючи дуже складну модель, то він попросив своїх студентів моделювати дані і порівняти студентів передбачені результати проти …


1
Коефіцієнти прості
У мене виникають певні проблеми в розумінні шансів, і я хотів би просто пояснити, як їх інтерпретувати. Я знайшов різні дописи, пов'язані з шансами, але більшість з них складніші за те, що я намагаюся зрозуміти. Ось приклад того, як я трактую шанси: якщо шанси події, що відбувається, становлять 3 до …

1
Поясніть, як `eigen` допомагає інвертувати матрицю
Моє запитання стосується техніки обчислень, що експлуатується в geoR:::.negloglik.GRFабо geoR:::solve.geoR. У налаштуваннях лінійної змішаної моделі: де і - фіксовані та випадкові ефекти відповідно. Такожβ b Σ = cov ( Y )Y= Xβ+ Zb + eY=Xβ+Zb+e Y=X\beta+Zb+e ββ\betaбbbΣ = cov ( Y)Σ=cov(Y)\Sigma=\text{cov}(Y) Оцінюючи ефекти, виникає потреба в обчисленні що зазвичай можна …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.