Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Які припущення про регресію хребта і як їх перевірити?
Розглянемо стандартну модель для множинної регресії де , тому нормальність, гомоскедастичність та некорельованість помилок утримуються.Y= Xβ+ εY=Хβ+εY=X\beta+\varepsilonε ∼ N( 0 , σ2Ян)ε∼N(0,σ2Ян)\varepsilon \sim \mathcal N(0, \sigma^2I_n) Припустимо, що ми виконуємо регресію хребта, додаючи однакову невелику кількість до всіх елементів діагоналі :ХХX βr i d g e= [ X'Х+ к я]- …

1
Чому квазі-Пуассон в ГЛМ не трактується як особливий випадок негативного бінома?
Я намагаюся пристосувати узагальнені лінійні моделі до деяких наборів даних про підрахунок, які можуть або не можуть бути перерозподілені. Два канонічні розподіли, які застосовуються тут, - пуассонівський та негативний біноміал (Негбін), з EV та дисперсієюмкмк\mu Va rП= μVаrП=мкVar_P = \mu Va rNБ= μ + μ2θVаrNБ=мк+мк2θVar_{NB} = \mu + \frac{\mu^2}{\theta} які …

1
Чи слід приймати рішення на основі мікро-усереднених або макросередніх оціночних заходів?
Я здійснив десятикратну перехресну перевірку за різними алгоритмами бінарної класифікації, з тим самим набором даних, і отримав як усереднені результати мікро- та макросів. Слід зазначити, що це була класифікаційна проблема з різними марками. У моєму випадку справжні негативи та справжні позитиви зважуються однаково. Це означає, що правильно прогнозувати справжні негативи …


4
Чому змішані дані є проблемою для алгоритмів кластеризації на основі евкліда?
Більшість класичних алгоритмів кластеризації та зменшення розмірності (ієрархічна кластеризація, аналіз основних компонентів, k-засоби, самоорганізуючі карти ...) розроблені спеціально для числових даних, а їх вхідні дані розглядаються як точки в евклідовому просторі. Це, звичайно, проблема, оскільки в багатьох реальних питаннях пов'язані змішані дані: наприклад, якщо ми вивчаємо автобуси, висота і довжина …

3
Дивні кореляції у результатах SVD випадкових даних; вони мають математичне пояснення чи це помилка LAPACK?
Я спостерігаю дуже дивну поведінку за результатами SVD випадкових даних, які я можу відтворити як у Matlab, так і R. Це виглядає як чисельне числове питання в бібліотеці LAPACK; є це? Я витягую зразків з мірних гауссів з нульовою середньою і коваріацією тотожності: . Я зібрати їх в даних матриця …

4
Як обчислити довірчі інтервали для ненормального розподілу?
У мене є 383 зразки, які мають великі ухили щодо деяких загальних значень, як би я обчислив середню значення 95%? Цільовий інтерфейс, який я обчислював, здається далеким, тому я вважаю, що мої дані не схожі на криву, коли я роблю гістограму. Тому я думаю, що я повинен використовувати щось на …

4
Як перевірити, чи мій розподіл мультимодальний?
Коли я будую гістограму своїх даних, вона має два піки: Чи означає це потенційний мультимодальний розподіл? Я запустив dip.testR ( library(diptest)), і вихід: D = 0.0275, p-value = 0.7913 Я можу зробити висновок, що мої дані мають мультимодальний розподіл? ДАНІ 10346 13698 13894 19854 28066 26620 27066 16658 9221 13578 …

2
У простій лінійній регресії звідки береться формула дисперсії залишків?
Відповідно до тексту, який я використовую, формула дисперсії залишку задається:ithithi^{th} σ2(1−1n−(xi−x¯¯¯)2Sxx)σ2(1−1n−(xi−x¯)2Sxx)\sigma^2\left ( 1-\frac{1}{n}-\frac{(x_{i}-\overline{x})^2}{S_{xx}} \right ) Я знаходжу це важко повірити , так як залишкова різниця між спостережуваним значенням і підігнаній значення; якби було обчислити дисперсію різниці, я, принаймні, очікував би певних «плюсів» у отриманому виразі. Будь-яка допомога в розумінні походження …

3
Значення "кількості параметрів" в АПК
При обчисленні AIC, AIC=2k−2lnLAIC=2k−2lnLAIC = 2k - 2 ln L k означає 'кількість параметрів'. Але що вважається параметром? Так, наприклад, у моделі y=ax+by=ax+by = ax + b Чи завжди a і b зараховуються як параметри? Що робити, якщо я не переймаюся значенням перехоплення, чи можу я його ігнорувати чи все …
21 aic 


2
Як описати чи візуалізувати множинну лінійну регресійну модель
Я намагаюся підходити до моїх даних декілька лінійних регресійних моделей з парою вхідних параметрів, скажімо 3. Ж( х )Ж( х)= А х1+ B x2+ Сх3+ дабо= ( А Б C)Т(х1 х2 х3) + д(i)(ii)(i)Ж(х)=Ах1+Бх2+Сх3+габо(ii)Ж(х)=(А Б С)Т(х1 х2 х3)+г\begin{align} F(x) &= Ax_1 + Bx_2 + Cx_3 + d \tag{i} \\ &\text{or} …

2
Що розуміється під стандартною помилкою максимальної оцінки ймовірності?
Я математик, який самостійно вивчає статистику і бореться особливо з мовою. У книзі, яку я використовую, є така проблема: Випадкова величина XXX задається як Pareto(α,60)Pareto(α,60)\text{Pareto}(\alpha,60) -розподілений з α>0α>0\alpha>0 . (Звичайно, ви можете взяти будь-який розподіл залежно від одного параметра заради цього питання.) Потім дається вибірка з п'яти значень 141414 , …

2
Якщо кластеризація k-засобів є формою моделювання суміші Гаусса, чи можна її використовувати, коли дані не є нормальними?
Я читаю Бішопа про алгоритм ЕМ для GMM та взаємозв'язок між GMM та k-засобами. У цій книзі йдеться про те, що k-засоби - це тверда версія GMM. Мені цікаво, чи означає це, що якщо дані, які я намагаюся кластеризувати, не є гауссовими, я не можу використовувати k-засоби (або, принаймні, непридатні …

1
Два способи використання завантажувальної програми для оцінки інтервалу довіри коефіцієнтів у регресії
Я застосовую лінійну модель до своїх даних: уi= β0+ β1хi+ ϵi,ϵi∼ N( 0 , σ2) .уi=β0+β1хi+ϵi,ϵi∼N(0,σ2). y_{i}=\beta_{0}+\beta_{1}x_{i}+\epsilon_{i}, \quad\epsilon_{i} \sim N(0,\sigma^{2}). Я хотів би оцінити довірчий інтервал (CI) коефіцієнтів ( , ), використовуючи метод завантаження. Існує два способи застосувати метод завантаження: β 1β0β0\beta_{0}β1β1\beta_{1} Зразок парного передбачувача відповідей: Випадково перепробовуйте пари і …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.