Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Теорія, що стоїть за аргументом ваг у R при використанні lm ()
Після року в середній школі моє розуміння "найменш зважених квадратів" таке: нехай y∈Rny∈Rn\mathbf{y} \in \mathbb{R}^n , XX\mathbf{X} - якась матриця дизайну n×pn×pn \times p , - параметр вектор, бути вектор помилки таким, що , де і . Тоді модель β∈Rpβ∈Rp\boldsymbol\beta \in \mathbb{R}^pϵ∈Rnϵ∈Rn\boldsymbol\epsilon \in \mathbb{R}^nϵ∼N(0,σ2V)ϵ∼N(0,σ2V)\boldsymbol\epsilon \sim \mathcal{N}(\mathbf{0}, \sigma^2\mathbf{V})V=diag(v1,v2,…,vn)V=diag(v1,v2,…,vn)\mathbf{V} = \text{diag}(v_1, v_2, …

1
XGBoost може обробляти відсутні дані на етапі прогнозування
Нещодавно я переглянув алгоритм XGBoost і помітив, що цей алгоритм може обробляти відсутні дані (не вимагаючи імпутації) на етапі навчання. Мені було цікаво, чи може XGboost обробляти відсутні дані (не вимагаючи імпутації), коли він використовується для прогнозування нових спостережень або необхідно імпутувати відсутні дані. Заздалегідь спасибі.

3
Випадкова регресія лісу, яка не прогнозує вище, ніж дані про навчання
Я помітив, що при побудові випадкових лісових регресійних моделей, принаймні в R, передбачуване значення ніколи не перевищує максимальне значення цільової змінної, видно у навчальних даних. Як приклад, дивіться код нижче. Я будую регресійну модель для прогнозування mpgна основі mtcarsданих. Я будую OLS та випадкові лісові моделі та використовую їх для …
12 r  random-forest 

2
«В зв’язках не повинно бути присутніх» в однопробному тесті Колмгорова-Смірнова в R
Я буду використовувати тест Колмогорова-Смірнова, щоб перевірити нормальність MYDATA в Р. Це приклад того, що я роблю ks.test(MYDATA,"pnorm",mean(MYDATA),sd(MYDATA)) Ось результат, який дає мені R: data: MYDATA D = 0.13527, p-value = 0.1721 alternative hypothesis: two-sided Warning message: In ks.test(MYDATA, "pnorm", mean(MYDATA), sd(MYDATA)) : ties should not be present for the …

4
Bootstrap vs Monte Carlo, оцінка помилок
Я читаю статтю Поширення помилок методом Монте-Карло в геохімічних розрахунках, Андерсон (1976), і є щось, що я не зовсім розумію. Розглянемо деякі вимірювані дані та програму, яка їх обробляє та повертає задане значення. У статті ця програма використовується для того, щоб спочатку отримати найкраще значення за допомогою даних даних (тобто: …

3
Лассо проти адаптивного Лассо
LASSO та адаптивний LASSO - це дві різні речі, правда? (Для мене покарання виглядають інакше, але я просто перевіряю, чи я щось пропускаю.) Якщо ви загалом говорите про еластичну сітку, це особливий корпус LASSO або адаптивний LASSO? Який з них виконує пакунок glmnet, якщо ви вибрали альфа = 1? Адаптивний …

2
Чи кращі моделі часових рядів журналу кращі за темпи зростання?
Часто я бачу, як автори оцінюють модель "різниці в журналі", наприклад журнал( ут) - журнал( уt - 1) = журнал( ут/ уt - 1) = α + βхтжурнал⁡(ут)-журнал⁡(ут-1)=журнал⁡(ут/ут-1)=α+βхт\log (y_t)-\log(y_{t-1}) = \log(y_t/y_{t-1}) = \alpha + \beta x_t Я погоджуюся, що це доречно співвідносити із зміною відсотків у тоді як - .y …

1
Вибірка з граничного розподілу з використанням умовного розподілу?
Я хочу взяти вибірку з одновимірної щільності але я знаю лише взаємозв'язок:fХfXf_X fХ( x ) = ∫fХ| Y( х | у) fY( у) dу.fХ(х)=∫fХ|Y(х|у)fY(у)гу.f_X(x) = \int f_{X\vert Y}(x\vert y)f_Y(y) dy. Я хочу уникати використання MCMC (безпосередньо на інтегральному поданні), і оскільки і легко , я думав про використання наступного пробника …

2
Чим відрізняється
Я читав про регресійні метрики в посібнику з python scikit-learn, і хоча кожен з них має власну формулу, я не можу інтуїтивно сказати, у чому різниця між R2R2R^2 та шкалою дисперсії, а отже, коли використовувати те чи інше для оцінки мого моделей.

3
Різниця - це підсумкова статистика: коефіцієнт Джині та стандартне відхилення
Існує кілька підсумкових статистичних даних. Якщо ви хочете описати поширення розподілу, ви можете використовувати, наприклад, стандартне відхилення або коефіцієнт Джині . Я знаю, що стандартне відхилення базується на центральній тенденції, тобто відхиленні від середнього, а коефіцієнт Джині - загальному вимірюванні дисперсії. Я також знаю, що коефіцієнт Джіні має нижню і …


1
Байєсське моделювання часу очікування поїздів: Визначення моделі
Це моя перша спроба, щоб хтось із табору часто виявився для аналізу байєсівських даних. Я прочитав ряд навчальних посібників та декілька розділів з Байєсівського аналізу даних А. Гельмана. Як перший, більш-менш незалежний приклад аналізу даних, який я вибрав, є час очікування поїздів. Я запитав себе: який розподіл часу очікування? Набір …
12 bayesian  pymc 

1
Інтервал довіри та P Невизначеність значення для тесту перестановки
Я зараз вивчаю тести рандомізації. Мені на думку спадають два питання: Так, легко та інтуїтивно зрозуміло, як р-значення обчислюється тестом рандомізації (на мою думку, це те саме, що і тест на перестановку?). Однак як ми могли також генерувати довірчий інтервал 95%, як це робимо при звичайних параметричних тестах? Коли я …

1
Як підходити ваги до Q-значень з наближенням лінійної функції
У навчанні підкріплення часто використовується лінійне наближення функції, коли є великі простори стану. (Коли шукати таблиці стають нездійсненними.) Форма значення з наближенням до лінійної функції задається числомQ -Q−Q- Q ( s , a ) = w1f1( з , а ) + ш2f2( s , a ) + ⋯ ,Q(s,a)=w1f1(s,a)+w2f2(s,a)+⋯,Q(s,a) = …

3
Що робити, якщо шлях c не є значущим, але шляхи a і b є? Непрямий ефект при посередництві
У класичній моделі посередництва маємо контури, показані на схемі нижче , в якій першим етапом тестування опосередковуючого ефекту M між X і Y є те, що X значно корелює з Y (як показано на панелі A на малюнку). Тим НЕ менше, я зіткнувся з ситуацією , коли Шлях а й …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.