Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Байезіан проти MLE, проблема, що відповідає
У PRML-книзі Бішопа він говорить, що надмірне оснащення - це проблема з максимальною оцінкою ймовірності (MLE), і Байєсій може цього уникнути. Але я думаю, що перевиконання - це проблема більше не щодо вибору моделі, а не щодо методу оцінки параметрів. Тобто, припустимо, у мене є набір даних , який генерується …

1
Інформація з матриці капелюхів для логістичної регресії
Мені зрозуміло, і на кількох сайтах добре пояснено, яку інформацію дають значення по діагоналі капелюшкової матриці для лінійної регресії. Матриця капелюхів моделі логістичної регресії мені менш зрозуміла. Чи вона ідентична інформації, яку ви отримуєте з матриці капелюхів, застосовуючи лінійну регресію? Це визначення матриці капелюхів я знайшов у іншій темі резюме …

5
Як пов'язаний куртоз розподілу з геометрією функції щільності?
Куртоз полягає в вимірюванні піку і плоскості розподілу. Функція щільності розподілу, якщо вона існує, може розглядатися як крива, і має геометричні особливості (наприклад, кривизна, опуклість, ...), пов'язані з її формою. Тож мені цікаво, чи пов'язаний куртоз розподілу з якимись геометричними особливостями функції густини, які можуть пояснити геометричне значення куртозу?

1
Чому F-тест у лінійних моделях Гаусса найпотужніший?
Y= μ + σГY=μ+σGY=\mu+\sigma Gмкμ\muWWWГGGRнRn\mathbb{R}^nЖFFН0: { μ ∈ U}H0:{μ∈U}H_0\colon\{\mu \in U\}U⊂ ШU⊂WU \subset Wf= ϕ ( 2 логсупμ ∈ W, σ> 0L ( μ , σ| у)супμ ∈ U, σ> 0L ( μ , σ| у)) .f=ϕ(2log⁡supμ∈W,σ>0L(μ,σ|y)supμ∈U,σ>0L(μ,σ|y)).f=\phi\left( 2\log \frac{\sup_{\mu \in W, \sigma>0} L(\mu, \sigma | y)}{\sup_{\mu \in U, \sigma>0} L(\mu, …


2
Чому для перевірки незалежності використовується розподіл chi-квадрата?
благість-оф-придатний тест використовує наступну статистику : У тесті, враховуючи , що умови виконані, як використовуються - розподіл для обчислення р-значення, враховуючи правда можна було б спостерігати таке значення в репрезентативній вибірці одного і того ж розміру.χ 2 0 = n ∑ i = 1 ( O i - E i …

2
-test В.С. -test для порівняння шансів підхопити застуду в 2 -х групах
Я просто читав у досить шанованому (популярному) науковому журналі (німецький прем’єр, 02/2013, с.36) про цікавий експеримент (без джерела, на жаль). Це привернуло мою увагу, тому що інтуїтивно я сумнівався у важливості результату, але надана інформація була достатньою для відтворення статистичного тестування. Дослідники задалися питанням, чи збільшує холодність у холодну погоду …

5
Рекурсивний (онлайн) алгоритм регуляризованих найменших квадратів
Чи може хтось вказати мені в напрямку онлайн (рекурсивного) алгоритму регуляризації Тихонова (регуляризовані найменші квадрати)? У режимі офлайн я б обчислював β^=(XTX+λI)−1XTYβ^=(XTX+λI)−1XTY\hat\beta=(X^TX+λI)^{−1}X^TY використовуючи свій оригінальний набір даних, де λλλ знайдено за допомогою n-кратної перехресної перевірки. Нове значення yyy можна передбачити для даного xxx використовуючи y=xTβ^y=xTβ^y=x^T\hat\beta . В онлайн-налаштуваннях я постійно …

4
Тест гіпотези на різницю медіанів серед більш ніж двох зразків
Питання Оцінки тестів трьох груп людей зберігаються як окремі вектори в Р. set.seed(1) group1 <- rnorm(100, mean = 75, sd = 10) group2 <- rnorm(100, mean = 85, sd = 10) group3 <- rnorm(100, mean = 95, sd = 10) Я хочу знати, чи є значна різниця в медіанах між …

1
Співвідношення ймовірностей та відношення PDF-файлів
Я використовую Байєса для вирішення проблеми кластеризації. Після деяких обчислень я закінчую необхідність отримати співвідношення двох ймовірностей: P(A)/P(B)P(A)/P(B)P(A)/P(B) мати можливість отримати . Ці ймовірності отримуються шляхом інтеграції двох різних двовимірних KDE, як пояснено у цій відповіді :P(H|D)P(H|D)P(H|D) P ( B ) = ∬ х Керівництво , Y : G ( …

3
Інтуїтивна причина, чому інформація про Фішера у біномалі обернено пропорційна
Це бентежить / дує мій погляд, що біноміал має відмінність, пропорційну p ( 1 - p )p(1−p)p(1-p) . Еквівалентно, що інформація про Фішера пропорційна 1p ( 1 - p )1p(1−p)\frac{1}{p(1-p)} . У чому причина цього? Чому інформація про Фішера мінімізована при р = 0,5p=0.5p=0.5 ? Тобто, чому висновок найскладніший при …

10
Поширені слова, які мають особливі статистичні значення
Я не статистик, але моя дослідницька робота включає статистику (аналіз даних, читання літератури тощо). Мені знову нагадали з коментаря до одного з моїх запитань, що тут розміщені, що є деякі загальні слова, які мають особливо специфічні значення або конотації для тих, хто добре практикується у галузі статистики. Буде корисно скласти …

2
Чи означає MLE завжди, що ми знаємо, що лежить в основі нашого PDF, і чи означає EM, що ми цього не робимо?
У мене є кілька простих концептуальних питань, які я хотів би уточнити стосовно MLE (Максимальна оцінка ймовірності), а також те, яке зв’язок воно має, якщо воно є, з EM (Максималізація очікування). Як я розумію, якщо хтось каже "Ми використовували MLE", чи це автоматично означає, що вони мають чітку модель PDF-файлів …

2
Як я можу об'єднати завантажені р-значення у множинні імпульсованих наборів даних?
Мене хвилює проблема, що я хотів би завантажувати p-значення для оцінки з множини імпульсованих (MI) даних, але мені незрозуміло, як поєднувати р-значення для МІ-множин.θθ\theta Для наборів даних ІМ стандартний підхід для досягнення загальної дисперсії оцінок використовує правила Рубіна. Дивіться тут огляд об’єднання наборів даних MI. Квадратний корінь загальної дисперсії служить …

2
Інтуїція за функцією щільності розподілів t
Я вивчаю т-розподіл Стьюдента, і мені стало цікаво, як можна отримати функцію щільності t-розподілів (з wikipedia, http://en.wikipedia.org/wiki/Student%27s_t-distribution ): f( t ) = Γ ( v + 12)v π--√Γ ( v2)( 1 + т2v)- v + 12f(t)=Γ(v+12)vπΓ(v2)(1+t2v)−v+12f(t) = \frac{\Gamma(\frac{v+1}{2})}{\sqrt{v\pi}\:\Gamma(\frac{v}{2})}\left(1+\frac{t^2}{v} \right)^{-\frac{v+1}{2}} де - ступеня свободи, а - гамма-функція. Яка інтуїція цієї функції? …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.