Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Порівняння між Newey-West (1987) та Hansen-Hodrick (1980)
Питання: Які основні відмінності та схожість між використанням стандартних помилок Newey-West (1987) та Hansen-Hodrick (1980)? У яких ситуаціях слід віддати перевагу одній із них перед іншою? Примітки: Я знаю, як працює кожна з цих процедур коригування; однак я ще не знайшов жодного документа, який би їх порівнював, ні в Інтернеті, …

2
Чому це передбачення часових рядів "досить бідне"?
Я намагаюся навчитися користуватися нейронними мережами. Я читав цей підручник . Після встановлення нейронної мережі на часовій серії, використовуючи значення в для прогнозування значення на автор отримує наступний сюжет, де синя лінія є тимчасовим рядом, зелена - прогноз на дані поїздів, червона - прогнозування даних випробувань (він використав тест на …

3
Інтуїція для підтримки векторних машин та гіперплану
У своєму проекті я хочу створити логістичну регресійну модель для прогнозування бінарної класифікації (1 або 0). У мене 15 змінних, 2 з яких категоричні, а решта - це суміш безперервних та дискретних змінних. Для того, щоб відповідати моделі логістичної регресії, мені порадили перевірити наявність лінійної відокремленості за допомогою SVM, перцептрон …

4
Чому дерево рішень має низький ухил та велику дисперсію?
Запитання Це залежить від того, чи є дерево дрібним чи глибоким? Або ми можемо сказати це незалежно від глибини / рівнів дерева? Чому ухил низький і дисперсія висока? Будь-ласка, поясніть інтуїтивно та математично

3
Чому припущення ANOVA мають значення (рівність дисперсії, нормальність залишків)?
Під час роботи програми ANOVA нам кажуть, що для її застосування до даних повинні бути певні припущення тесту. Я ніколи не розумів причини, чому для тестування були необхідні наступні припущення: Варіант Вашої залежної змінної (залишки) повинен бути рівним у кожній комірці конструкції Ваша залежна змінна (залишки) повинна бути приблизно нормально …

4
Типовий набір концепції
Я вважав, що концепція типового набору є досить інтуїтивно зрозумілою: послідовність довжини nnn належить до типового набору A(n)ϵAϵ(n)A_\epsilon ^{(n)} якщо ймовірність виходу послідовності буде великою. Отже, будь-яка послідовність, яка, ймовірно, була б в A(n)ϵAϵ(n)A_\epsilon ^{(n)} . (Я уникаю формального визначення, пов'язаного з ентропією, тому що я намагаюся його зрозуміти якісно.) …

4
Очікуване значення проти найбільш ймовірного значення (режим)
Очікуване значення розподілу - середнє, тобто середньозважене значення E [ x ] = ∫ + ∞ - ∞ xf(x)f(x)f(x)E[x]=∫+∞−∞xf(x)dxE[x]=∫−∞+∞xf(x)dxE[x]=\int_{-\infty}^{+\infty} x \, \, f(x) dx Найбільш ймовірне значення - режим, тобто найбільш вірогідне значення. Однак чи очікуємо ми якось багато разів бачити ? Цитуючи звідси :E[x]E[x]E[x] Якщо результати не є однаково …

3
Мінімальна кількість шарів у глибокій нейромережі
З цього моменту ми починаємо класифікувати багатошарові нейронні мережі як глибокі нейронні мережі або викласти його по-іншому: "Яка мінімальна кількість шарів у глибокій нейронній мережі?"

2
Поетапна регресія в R - Як це працює?
Я намагаюся зрозуміти основну різницю між покроковою і зворотною регресією в R за допомогою функції кроку. Для поетапної регресії я використав таку команду step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="both") Я отримав нижче вихід для вищевказаного коду. Для вибору зворотної змінної я використав таку команду step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="backward") І я отримав нижчий вихід для відсталого Наскільки я зрозумів, …
15 r  regression 

3
Чи насправді потрібно включати "всіх відповідних прогнозів?"
Основним припущенням використання регресійних моделей для висновку є те, що "всі відповідні предиктори" були включені в рівняння прогнозування. Обґрунтування полягає в тому, що невключення важливого фактору реального світу призводить до упереджених коефіцієнтів і, отже, неточних висновків (тобто пропущених змінних зміщень). Але в дослідницькій практиці я ніколи не бачив нікого, включаючи …

5
Питання сингулярності в моделі суміші Гаусса
У розділі 9 книги Розпізнавання візерунків та машинне навчання є цією частиною про модель суміші Гаусса: Якщо чесно, я не дуже розумію, чому це створило б особливість. Хтось може мені це пояснити? Вибачте, але я просто студент і початківець у машинному навчанні, тому моє запитання може звучати трохи нерозумно, але …

3
Логістична регресія: Scikit Learn vs glmnet
Я намагаюся дублювати результати з sklearnлогістичної регресійної бібліотеки за допомогою glmnetпакету в Р. sklearnminw,c12wTw+C∑i=1Nlog(exp(−yi(XTiw+c))+1)minw,c12wTw+C∑i=1Nlog⁡(exp⁡(−yi(XiTw+c))+1)\min_{w,c} \frac12 w^Tw + C\sum_{i=1}^N \log(\exp(-y_i(X_i^Tw+c)) + 1) З віньєток з glmnetйого реалізація мінімізує дещо інший вартість функції хвβ, β0- [ 1N∑i=1Nyi(β0+xTiβ) -log( 1 + е( β0+ хТiβ)) ] + λ [ ( α - 1 ) …

2
2 Зразок Колмогорова-Смірнова проти Андерсона-Дарлінга проти Крамера-фон-Мізеса
Мені було цікаво, якими критеріями користуються Колмогоров-Смірнов, Креймер-фон-Міз і Андерсон-Дарлінг при порівнянні 2 ECDFS. Я знаю математику, як кожен відрізняється, але якщо у мене є деякі дані ECDF, як я можу знати, який тест доцільно використовувати?

3
Чи мають для лінійних класифікаторів більші коефіцієнти важливіші характеристики?
Я програмний інженер, який працює над машинним навчанням. З мого розуміння, лінійна регресія (наприклад, OLS) та лінійна класифікація (наприклад, логістична регресія та SVM) роблять прогноз на основі внутрішнього добутку між тренованими коефіцієнтами та змінними характеристик → x :ш⃗ ш→\vec{w}х⃗ х→\vec{x} у^= f( ш⃗ ⋅ x⃗ ) = f( ∑iшiхi)у^=f(ш→⋅х→)=f(∑iшiхi) \hat{y} …

1
Сума або середнє значення градієнтів у (міні) градієнті партії пристойне?
Коли я реалізував пристойний міні-градієнт градієнта, я просто усереднював градієнти всіх прикладів у навчальній партії. Однак я помітив, що зараз оптимальна швидкість навчання набагато вища, ніж для онлайн-градієнтів пристойних. Моя інтуїція полягає в тому, що це тому, що усереднений градієнт менш шумний, і тому він може дотримуватися швидше. Тож, можливо, …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.