Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
AIC регресії хребта: ступінь свободи та кількість параметрів
Я хочу обчислити AICc моделі регресії хребта. Проблема - кількість параметрів. Для лінійної регресії більшість людей припускають, що кількість параметрів дорівнює кількості оцінених коефіцієнтів плюс сигма (дисперсія похибки). Якщо мова йде про регресію хребта, я читаю, що слід матриці капелюхів - ступінь свободи (df) - просто використовується як кількість термінів …

1
Як знайти 95% надійний інтервал?
Я намагаюся обчислити 95% достовірний інтервал наступного заднього розподілу. Я не зміг знайти для нього функцію в R, але правильний підхід нижче? x <- seq(0.4,12,0.4) px <- c(0,0, 0, 0, 0, 0, 0.0002, 0.0037, 0.018, 0.06, 0.22 ,0.43, 0.64,0.7579, 0.7870, 0.72, 0.555, 0.37, 0.24, 0.11, 0.07, 0.02, 0.009, 0.005, 0.0001, …

1
Чому ecdf використовує ступінчасту функцію, а не лінійну інтерполяцію?
Емпіричні функції CDF зазвичай оцінюються за допомогою крокової функції. Чи є причина, чому це робиться таким чином, а не за допомогою лінійної інтерполяції? Чи має ступінчаста функція цікавих теоретичних властивостей, які змушують нас віддавати перевагу цьому? Ось приклад двох: ecdf2 <- function (x) { x <- sort(x) n <- length(x) …
13 r  distributions  ecdf 

1
Пакет GBM проти Caret з використанням GBM
Я налаштовував модель за допомогою caret, але потім повторно запустив модель за допомогою gbmпакета. Наскільки я розумію, що caretпакет використовує gbmі вихід повинен бути однаковим. Однак, лише швидкий тестовий пробіг із застосуванням data(iris)показує невідповідність моделі приблизно 5%, використовуючи RMSE і R ^ 2 в якості метрики оцінювання. Я хочу знайти …

2
Коваріаційні функції або ядра - що це саме?
Я досить новачок у галузі гауссових процесів і як вони застосовуються в машинному навчанні. Я продовжую читати та чути про те, що функції коваріації є головною привабливістю цих методів. То чи міг би хто-небудь пояснити інтуїтивно, що відбувається в цих коваріаційних функціях? В іншому випадку, якщо ви можете вказати на …

1
Чи можете ви дати просте інтуїтивне пояснення методу IRLS, щоб знайти MLE GLM?
Фон: Я намагаюся дотримуватися огляду Прінстона на оцінку MLE для GLM . Я розумію основи оцінки MLE: likelihood, score, яка спостерігається і очікувана Fisher informationі Fisher scoringтехніка. І я знаю, як виправдати просту лінійну регресію з оцінкою MLE . Питання: Я не можу зрозуміти навіть перший рядок цього методу :( …

2
Чому відрізок P> 0,5 не є "оптимальним" для логістичної регресії?
ПЕРЕДБАЧЕННЯ: Мене не хвилюють переваги використання обрізання чи ні, або як слід обрати обріз. Моє питання суто математичне і обумовлене цікавістю. Логістична регресія моделює задню умовну ймовірність класу А проти класу В, і вона відповідає гіперплану, коли задні умовні ймовірності рівні. Тож теоретично я зрозумів, що точка класифікації 0,5 зведе …


1
Повна загальна статистика: Єдина (a, b)
Нехай X=(x1,x2,…xn)X=(x1,x2,…xn)\mathbf{X}= (x_1, x_2, \dots x_n) - випадкова вибірка з рівномірного розподілу на (a,b)(a,b)(a,b) , де a&lt;ba&lt;ba < b . Нехай Y1Y1Y_1 і YnYnY_n - найбільша і найменша статистика порядку. Покажіть, що статистика (Y1,Yn)(Y1,Yn)(Y_1, Y_n) є спільно повною достатньою статистикою для параметра θ=(a,b)θ=(a,b)\theta = (a, b). Мені не проблема виявляти …

2
Як визначити регіон відхилення, коли немає UMP?
Розглянемо модель лінійної регресії y=Xβ+uy=Xβ+u\mathbf{y}=\mathbf{X\beta}+\mathbf{u} , u∼N(0,σ2I)u∼N(0,σ2I)\mathbf{u}\sim N(\mathbf{0},\sigma^2\mathbf{I}) , E(u∣X)=0E(u∣X)=0E(\mathbf{u}\mid\mathbf{X})=\mathbf{0} . Нехай H0:σ20=σ2H0:σ02=σ2H_0: \sigma_0^2=\sigma^2 проти H1:σ20≠σ2H1:σ02≠σ2H_1: \sigma_0^2\neq\sigma^2 . Ми можемо зробити висновок, що yTMXyσ2∼χ2(n−k)yTMXyσ2∼χ2(n−k)\frac{\mathbf{y}^T\mathbf{M_X}\mathbf{y}}{\sigma^2}\sim \chi^2(n-k) , де dim(X)=n×kdim(X)=n×kdim(\mathbf{X})=n\times k . І MXMX\mathbf{M_X} є типовим позначенням матриці знищення MXy=y^MXy=y^\mathbf{M_X}\mathbf{y}=\hat{\mathbf{y}} , де y^y^ \hat{\mathbf{y}} є залежною змінною yy\mathbf{y} регресував на XX\mathbf{X} . …

2
Навіщо використовувати групове ласо замість ласо?
Я прочитав те, що груповий ласо використовується для вибору змінних і обмеженості в групі змінних. Я хочу знати інтуїцію, що стоїть за цим твердженням. Чому груповий ласо віддається перевагу ласо? Чому шлях розв’язання групового ласо не є кусочно лінійним?

3
Проста лінійна регресія, p-значення та AIC
Я усвідомлюю, що ця тема виникала вже не раз, наприклад, тут , але я все ще не знаю, як найкраще інтерпретувати результати регресії. У мене дуже простий набір даних, що складається з стовпця значень x та стовпця значень y , розділених на дві групи відповідно до місцезнаходження (loc). Точки виглядають …

2
Пояснення варіації моделі регресії
Це може бути простим поясненням (я все одно сподіваюся). Я зробив аналіз регресії в Matlab, використовуючи інструмент регресії. Однак я натрапив на дослідження, яке говорить про це: "За допомогою регресійного аналізу вдалося встановити модель прогнозування, використовуючи лише чотири звукові функції, які пояснюють 60% дисперсії" Посилання на статтю знаходиться за необхідності: …
13 variance 

2
Чи є нормальність спільності необхідною умовою, щоб сума нормальних випадкових величин була нормальною?
У коментарях після цієї моєї відповіді на відповідне запитання користувачі ssdecontrol і Glen_b запитали, чи потрібна спільна нормальність XXX і YYY для підтвердження нормальності суми X+YX+YX+Y ? Це спільне нормальність достатню кількість , звичайно ж , добре відомо. Це додаткове питання там не було розглянуте, і, мабуть, варто його розглянути …

1
Що таке оптимальний поріг F1? Як його обчислити?
Я використовував функцію h2o.glm () в R, яка дає таблицю непередбачених результатів разом з іншою статистикою. Таблиця на випадок надзвичайних ситуацій очолюється " Перехресна вкладка на основі оптимального порогового значення F1 " Вікіпедія визначає показник F1 або F оцінка як гармонійне середнє значення точності та відкликання. Але чи Precision and …
13 threshold 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.