Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Порядок відставання для тесту на причинність Грейнджера
Припустимо, я розглядаю кілька незалежних змінних для можливого включення в модель ARIMAX, яку я розробляю. Перш ніж встановлювати різні змінні, я хотів би викреслити змінні, які виявляють зворотну причинну зв’язок за допомогою тесту Ґрейнджера (я використовую granger.testфункцію з MSBVARпакету в R, хоча, я вважаю, інші імплементації працюють аналогічно). Як визначити, …

4
Як поводитися з відсутніми значеннями, щоб підготувати дані для вибору функцій за допомогою LASSO?
Моя ситуація: невеликий розмір зразка: 116 двійкова змінна результат довгий список пояснювальних змінних: 44 пояснювальні змінні не надходили з моєї голови; їх вибір ґрунтувався на літературі. більшість випадків у вибірці та більшість змінних мають відсутні значення. Вибраний підхід до вибору функцій: LASSO Пакет glmnet R не дозволить мені запустити програму …

2
Зовнішнє виявлення за допомогою регресії
Чи може бути використана регресія для виявлення лієрів. Я розумію, що є способи вдосконалити регресійну модель шляхом видалення залишків. Але головна мета тут - не підходити до регресійної моделі, а з’ясувати корисність за допомогою регресії

2
Процентні функції втрат
Рішення проблеми: minmE[|m−X|]minmE[|m−X|] \min_{m} \; E[|m-X|] добре відомо, що є медіаною XXX , але як виглядає функція втрат для інших відсотків? Наприклад: 25-й перцентиль X - це рішення для: minmE[L(m,X)]minmE[L(m,X)] \min_{m} \; E[ L(m,X) ] Що таке LLL у цьому випадку?

1
Плюси дистанції Джефріса Матусіта
Згідно з деякою книгою, яку я читаю, зазвичай використовується дистанція Джефріса та Матусіти. Але я не зміг знайти багато інформації про нього, окрім наведеної нижче формули JMD (x, y) = ∑(xi−−√2−yi−−√2)2−−−−−−−−−−−−−√2∑(xi2−yi2)22\sqrt[2]{\sum(\sqrt[2]{x_i}-\sqrt[2]{y_i})^2} Він схожий на евклідову відстань за винятком квадратного кореня E (x, y) = ∑(xi−yi)2−−−−−−−−−−√2∑(xi−yi)22\sqrt[2]{\sum(x_i-y_i)^2} Вважається, що відстань JM є …

5
Алгоритм Метрополіс Гастінгс
Мені потрібно вивчити методи Марковського ланцюга Монте-Карло, щоб бути більш конкретним, мені потрібно вивчити алгоритм Metropolis Hastings і все про нього, як критерії конвергенції. Хто може прописати мені книгу, або папір, або веб-сайт, які пояснюють цей аргумент за допомогою простих термінів, але без банальності?
11 references  mcmc 

3
Як тренувати (логістичну?) Регресію в R за допомогою функції втрати L1?
Я можу тренувати логістичну регресію в Rвикористанні glm(y ~ x, family=binomial(logit))) але, IIUC, це оптимізує ймовірність журналу. Чи є спосіб тренувати модель, використовуючи лінійну ( ) функцію втрат (яка в даному випадку така ж, як загальна відстань варіації )?L1L1L_1 Тобто, даючи числовий вектор і бітовий (логічний) вектор , я хочу …
11 logistic 

5
Інтуїція щодо визначення коваріації
Я намагався краще зрозуміти коваріацію двох випадкових змінних і зрозуміти, як перша людина, яка думала про це, дійшла до визначення, яке звичайно використовується в статистиці. Я пішов у вікіпедію, щоб краще зрозуміти це. Зі статті виходить, що хороший показник або кількість кандидата для повинен мати такі властивості:Cov(X,Y)Cov(X,Y)Cov(X,Y) Це має бути …

2
Логістична регресія: тлумачення суцільних змінних
У мене було кілька запитань щодо інтерпретації коефіцієнтів шансів для безперервних змінних в логістичній регресії. Мені здається, що це основні питання щодо логістичної регресії (і, мабуть, про регресію взагалі), і хоча я трохи соромлюсь, що не знаю відповідей, я проковтну свою гордість і запитаю їх, щоб я знав їх у …

3
Різниця між ep-SVR і nu-SVR (і найменшими квадратами SVR)
Я намагаюся з’ясувати, який SVR підходить для такого роду даних. Я знаю 4 типи СВР: епсилон ну найменші квадрати і лінійний. Я розумію, лінійний SVR більше-менш схожий на ласо з L1 Reg, але яка різниця між рештою 3 методами?
11 regression  svm 

1
Як ми прогнозуємо рідкісні події?
Я працюю над розробкою моделі прогнозування страхового ризику. Ці моделі є "рідкісними подіями", такими як прогнозування несанкціонованого обслуговування авіакомпанії, виявлення несправностей в апараті тощо. Під час підготовки набору даних я намагався застосувати класифікацію, але не зміг отримати корисні класифікатори через велику частку негативних випадків . Я не маю багато досвіду …

1
Як вибрати ймовірність відсічення для рідкісної події Логістична регресія
У мене 100 000 спостережень (9 фіктивних змінних показників) з 1000 позитивних. Логістична регресія повинна спрацьовувати нормально в цьому випадку, але ймовірність відсічення мене спантеличує. У загальній літературі ми обираємо 50% відсікання для прогнозування 1 і 0. Я не можу цього зробити, оскільки моя модель дає максимальне значення ~ 1%. …

4
Вступ до непараметричної статистики
Я вивчаю статистику останні два роки. Майже все, що я дізнався, - це параметрична статистика. Тепер я хотів би дізнатися більше про непараметричну статистику. Чи може хтось запропонувати короткий (можливо, читабельний) вступ у цю область?

3
Який алгоритм я повинен використовувати для кластеризації величезного бінарного набору даних у декілька категорій?
У мене є велика (650 К рядків * 62 стовпчики) матриця двійкових даних (лише 0-1 записи). Матриця переважно розріджена: заповнено близько 8%. Я хотів би класифікувати його в 5 груп - скажімо, названі від 1 до 5. Я спробував ієрархічну кластеризацію, і вона не змогла впоратися з розміром. Я також …

1
Формула оцінки кількісної регресії
Я бачив два різних уявлення оцінника кількісної регресії, які є Q(βq)=∑i:yi≥x′iβnq∣yi−x′iβq∣+∑i:yi&lt;x′iβn(1−q)∣yi−x′iβq∣Q(βq)=∑i:yi≥xi′βnq∣yi−xi′βq∣+∑i:yi&lt;xi′βn(1−q)∣yi−xi′βq∣Q(\beta_{q}) = \sum^{n}_{i:y_{i}\geq x'_{i}\beta} q\mid y_i - x'_i \beta_q \mid + \sum^{n}_{i:y_{i}< x'_{i}\beta} (1-q)\mid y_i - x'_i \beta_q \mid і Q(βq)=∑i=1nρq(yi−x′iβq),ρq(u)=ui(q−1(ui&lt;0))Q(βq)=∑i=1nρq(yi−xi′βq),ρq(u)=ui(q−1(ui&lt;0))Q(\beta_q) = \sum^{n}_{i=1} \rho_q (y_i - x'_i \beta_q), \hspace{1cm} \rho_q(u) = u_i(q - 1(u_i < 0 )) де . Хтось …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.