Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних


2
Лінійність дисперсії
Я думаю, що дві наступні формули вірні: Var(aX)=a2Var(X)Var(aX)=a2Var(X) \mathrm{Var}(aX)=a^2 \mathrm{Var}(X) а a - постійне число якщо,незалежніVar(X+Y)=Var(X)+Var(Y)Var(X+Y)=Var(X)+Var(Y) \mathrm{Var}(X + Y)=\mathrm{Var}(X)+\mathrm{Var}(Y) XXXYYY Однак я не впевнений, що не так із наведеним нижче: Var(2X)=Var(X+X)=Var(X)+Var(X)Var(2X)=Var(X+X)=Var(X)+Var(X)\mathrm{Var}(2X) = \mathrm{Var}(X+X) = \mathrm{Var}(X) + \mathrm{Var}(X) що не дорівнює , тобто .22Var(X)22Var(X)2^2 \mathrm{Var}(X)4Var(X)4Var(X)4\mathrm{Var}(X) Якщо припустити, що - це вибірка, …

1
R пакет для зваженого випадкового лісу? варіант classwt?
Я намагаюся використовувати Random Forest для прогнозування результатів надзвичайно незбалансованого набору даних (показник класу меншості становить приблизно лише 1% або навіть менше). Оскільки традиційний алгоритм випадкового лісу мінімізує загальний показник помилок, а не приділяє особливу увагу класам меншин, він не застосовується безпосередньо для незбалансованих даних. Тому я хочу віднести високу …
16 r  random-forest 

1
Чи не існує в статистиці теорії навчання проблема надмірного розміщення на тестовому наборі?
Розглянемо проблему класифікації набору даних MNIST. Згідно з веб-сторінкою MNIST Янна Лекуна , "Ciresan та ін." отримали 0,23% помилок на тестовому наборі MNIST за допомогою Convolutional Neural Network. Позначимо навчальний набір MNIST як , тестовий набір MNIST як D t e s t , остаточну гіпотезу, яку вони отримали, використовуючи …

3
Що саме таке розподіл?
Я дуже мало знаю про ймовірність та статистику, і бажаю вчитися. Я бачу, що слово "розповсюдження" вживається в усьому світі в різних контекстах. Наприклад, дискретна випадкова величина має "розподіл ймовірності". Я знаю, що це таке. Неперервна випадкова величина має функцію густини ймовірності, тоді для x∈Rx∈Rx\in\mathbb{R} інтеграл від −∞−∞-\infty до xxx …

2
Пост-тест для тесту на придатність чи-квадрата на придатність
Я провожу тест на користь придатності чи-квадрат (GOF) з трьома категоріями і конкретно хочу перевірити нульове значення, що пропорції населення в кожній категорії рівні (тобто пропорція становить 1/3 у кожній групі): Спостерігаються даними Група 1 Група 2 Група 3 Разом 686 928 1012 2626 Таким чином, для цього тесту на …

3
Чому достатня статистика містить всю інформацію, необхідну для обчислення будь-якої оцінки параметра?
Я щойно почав вивчати статистику і не можу зрозуміти достатності. Якщо точніше, я не можу зрозуміти, як показати, що наступні два абзаци рівнозначні: Приблизно, враховуючи набір X незалежних ідентично розподілених даних, обумовлених невідомим параметром θ, достатньою статистикою є функція T (X), значення якої містить всю інформацію, необхідну для обчислення будь-якої …

1
Чому "розслаблене ласо" відрізняється від стандартного ласо?
Якщо ми почнемо з набору даних , застосуємо до нього Лассо і отримаємо рішення , ми можемо знову застосувати Лассо до набору даних , де - безліч не- нульові індекси , щоб отримати рішення, , що називається "розслабленим LASSO" рішенням (виправте мене, якщо я помиляюся!). Рішення повинно задовольняти умовам Каруша …

2
Чому GLM відрізняється, ніж LM з перетвореною змінною
Як пояснено у цьому розкладі курсу (стор. 1) , лінійну модель можна записати у вигляді: y=β1x1+⋯+βpxp+εi,y=β1x1+⋯+βpxp+εi, y = \beta_1 x_{1} + \cdots + \beta_p x_{p} + \varepsilon_i, де - змінна відповіді, а - пояснювальна змінна .yyyxixix_{i}ithithi^{th} Часто з метою задоволення тестових припущень можна перетворити змінну відповіді. Наприклад, ми застосовуємо функцію …

1
Який типовий діапазон можливих значень параметра усадки в пенізованій регресії?
У регресії ласо або хребта потрібно вказати параметр усадки, який часто називають або . Це значення часто вибирається за допомогою перехресної перевірки, перевіряючи купу різних значень на навчальних даних і бачачи, що дає найкращі результати, наприклад на тестових даних. Який діапазон значень слід перевірити? Це ?λλ\lambdaαα\alphaR2R2R^2(0,1)(0,1)(0,1)

2
Оцініть коефіцієнти ARMA за допомогою перевірки ACF та PACF
Як ви оцінюєте відповідну модель прогнозування для часового ряду шляхом візуального огляду сюжетів АКФ та ПАКФ? Який з них (тобто ACF або PACF) повідомляє AR або MA (або вони обидва)? Яка частина графіків розповідає про сезонну та несезонну частину сезонного ARIMA? Розглянемо функції ACF та PCF, показані нижче. Вони складаються …

1
Чи гарантувала ймовірність журналу в GLM гарантовану конвергенцію до глобальних максимумів?
Мої запитання: Чи гарантовано узагальнені лінійні моделі (ГЛМ) наближаються до глобального максимуму? Якщо так, то чому? Крім того, які обмеження існують у функції зв'язку для забезпечення опуклості? Моє розуміння GLM полягає в тому, що вони максимізують дуже нелінійну функцію вірогідності. Таким чином, я б міг уявити, що існує кілька локальних …

2
Обчислення AIC "від руки" в R
Я спробував обчислити AIC лінійної регресії в R, але без використання AICфункції, як це: lm_mtcars <- lm(mpg ~ drat, mtcars) nrow(mtcars)*(log((sum(lm_mtcars$residuals^2)/nrow(mtcars))))+(length(lm_mtcars$coefficients)*2) [1] 97.98786 Однак AICдає інше значення: AIC(lm_mtcars) [1] 190.7999 Може хтось скаже мені, що я роблю не так?

2
Які вимоги щодо стаціонарності використання регресії з помилками ARIMA для висновку?
Які вимоги щодо стаціонарності використання регресії з помилками ARIMA (динамічна регресія) для висновку? Зокрема, у мене є нестаціонарна безперервна змінна результат , нестаціонарна безперервна змінна прогнозова х x a та манекенна змінна серія x b . Мені хотілося б дізнатись, чи лікування було пов'язане зі зміною змінної результату, яка більше …

3
Яка різниця між онлайн та пакетним навчанням?
Зараз я читаю статтю « Ефективне навчання в режимі он-лайн та пакетне навчання», використовуючи розділення «Вперед-назад», розроблені Джоном Дючі та Йорамом Зінгер. Мене дуже бентежить використання термінів "Інтернет" та "Пакет". Я подумав, що "Інтернет" означає, що ми оновлюємо вагові параметри після обробки однієї одиниці даних тренувань. Потім ми використовуємо нові …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.