Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Чому важливо розмежовувати "лінійну" проти "нелінійну" регресію?
Яке значення відрізняє лінійна та нелінійна моделі? Питання Нелінійна проти узагальненої лінійної моделі: як ви ставитесь до логістичної, пуассонової регресії тощо? і його відповідь була надзвичайно корисним з’ясуванням лінійності / нелінійності узагальнених лінійних моделей. Мабуть критично важливим є відмежування лінійних від нелінійних моделей, але мені незрозуміло чому? Наприклад, розглянемо такі …

1
Спеціальний розподіл ймовірностей
Якщо - розподіл ймовірності з ненульовими значеннями на , для якого типу (s) існує константа така, що для всіх ?p(x)p(x)p(x)[0,+∞)[0,+∞)[0,+\infty)p(x)p(x)p(x)c>0c>0c\gt 0∫∞0p(x)logp(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2∫0∞p(x)log⁡p(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2\int_0^{\infty}p(x)\log{\frac{ p(x)}{(1+\epsilon)p({x}(1+\epsilon))}}dx \leq c \epsilon^20<ϵ<10<ϵ<10\lt\epsilon\lt 1 Нерівність, наведена вище, насправді є дивергенцією Кулбека-Лейблера між розподілом та стислим його варіантом . Я з’ясував, що ця нерівність стосується розподілів експоненціальної, гамма та …

2
Чи справедлива теорема Слуцького, коли обидві послідовності сходяться до невиродженої випадкової величини?
Мене бентежить деякі деталі теореми Слуцького : Нехай , дві послідовності скалярних / векторних / матричних випадкових елементів.{Xn}{Xn}\{X_n\}{ Yн}{Yn}\{Y_n\} Якщо у розподілі до випадкового елемента а вірогідно до постійної , то умови, що є незворотним, де позначає конвергенцію розподілу.ХнXnX_nХXXYнYnY_ncccХн+ Yн ХнYн Хн/ Ун →г Х+ c→г c X→г Х/ с,Xn+Yn …

2
Похідне Гауссового процесу
Я вважаю, що похідна Гауссового процесу (GP) - це інший GP, і тому я хотів би знати, чи є рівняння закритої форми для рівнянь прогнозування похідної GP? Зокрема, я використовую квадратичне експоненціальне ядро ​​коваріації (яке також називають гауссова) і хочу знати, як робити прогнози щодо похідної Гауссового процесу.

3
Чому ієрархічна софтмакс краща для рідкісних слів, тоді як негативна вибірка краща для частих слів?
Цікаво, чому ієрархічний софтмакс кращий для нечастого слова, тоді як негативний вибірки краще для частих слів у моделях CBOW та пропуску грам word2vec. Я прочитав претензію на https://code.google.com/p/word2vec/ .

1
Очікуване значення , коефіцієнт визначення, під нульовою гіпотезою
Мені цікаво твердження, зроблене внизу першої сторінки цього тексту стосовно коригуванняR2adjustedRadjusted2R^2_\mathrm{adjusted} R2adjusted=1−(1−R2)(n−1n−m−1).Radjusted2=1−(1−R2)(n−1n−m−1).R^2_\mathrm{adjusted} =1-(1-R^2)\left({\frac{n-1}{n-m-1}}\right). У тексті зазначено: Логіка коригування така: у звичайній множинній регресії випадковий предиктор пояснює в середньому частку 1/(n–1)1/(n–1)1/(n – 1) варіації відповіді, так що mmm випадкові предиктори пояснюють разом, в середньому, m/(n–1)m/(n–1)m/(n – 1) варіації відповіді; іншими словами, …

2
Як вибрати оптимальну ширину бункера при калібруванні ймовірних моделей?
Передумови: Тут є кілька чудових питань / відповідей щодо того, як відкалібрувати моделі, які прогнозують ймовірність того, що результат відбудеться. Наприклад Шкала барію та його розкладання на роздільну здатність, невизначеність та надійність . Калібрувальні графіки та ізотонічна регресія . Ці методи часто вимагають використання методу бінінгу за передбачуваними ймовірностями, так …

1
Ідентичні коефіцієнти, оцінені в моделі Пуассона проти Квазі-Пуассона
При моделюванні даних про кількість позовів у страховому середовищі я почав із Пуассона, але потім помітив перевищення рівня. Квазі-Пуассон краще моделював більшу співвідношення середньої дисперсії, ніж основний Пуассон, але я помітив, що коефіцієнти були однаковими як у моделях Пуассона, так і в Квазі-Пуассона. Якщо це не помилка, чому це відбувається? …

1
Оцінки "Приблизно нормально" для t-тестів
Я тестую рівність засобів, використовуючи t-тест Вельча. Основний розподіл далеко не нормальний (більш хиткий, ніж приклад у відповідній дискусії тут ). Я можу отримати більше даних, але хотів би дещо принципово визначити, в якій мірі це робити. Чи є хороша евристика для оцінки оцінки прийнятності розподілу вибірки? Які відхилення від …

4
Зрозуміло, що проблема добре підходить для лінійної регресії
Я вивчаю лінійну регресію, використовуючи Вступ до лінійного регресійного аналізу Монтгомері, Пека та Вінінга . Я хотів би вибрати проект аналізу даних. Я наївно вважаю, що лінійна регресія підходить лише тоді, коли можна підозрювати, що між пояснювальними змінними та змінною відповіді існують лінійні функціональні зв'язки. Але, здається, не багато додатків …

1
Гра в карти: Якщо я намалюю чотири картки випадковим чином, а ви намалюєте шість, яка ймовірність того, що моя найвища карта вища за вашу найвищу?
Як зазначено в назві, скажіть, якщо я малюю випадковим чином 4 картки, а ви малюєте 6 з тієї ж колоди, яка ймовірність того, що моя найвища карта б'є вашу найвищу карту? Як це зміниться, якщо ми будемо малювати з різних колод? Дякую!

1
Тест на придатність у логістичній регресії; яку "форму" ми хочемо протестувати?
Я маю на увазі питання та його відповіді: Як порівняти (ймовірність) прогнозованої здатності моделей, розроблених за допомогою логістичної регресії? автор @Clark Chong та відповіді / коментарі від @Frank Harrell. і до питання Ступені свободи у тесті Хосмера-Лемешоуχ2χ2\chi^2 та коментарі. Я прочитав статті Д. В. Хосмера, Т. Хосмера, С. Ле Чессі, …

1
Звичайна логістична регресія в Python
Я хотів би провести порядкову логістичну регресію в Python - для змінної відповіді з трьома рівнями та з кількома пояснювальними факторами. statsmodelsПакет підтримує двійковий логит і модель полиномиального логіт (MNLogit), але не впорядковану логит. Оскільки основна математика не така вже й інша, мені цікаво, чи можна її легко реалізувати, використовуючи …

2
Захоплення початкових шаблонів при використанні усіченого зворотного розповсюдження через час (RNN / LSTM)
Скажіть, що я використовую RNN / LSTM для аналізу настроїв, що є підходом до багатьох (див. Цей блог ). Мережа тренується за допомогою усіченого зворотного розповсюдження через час (BPTT), де мережа розкручується лише 30 останніх кроків, як зазвичай. У моєму випадку кожен мій розділ тексту, який я хочу класифікувати, набагато …

2
Переведення проблеми машинного навчання в регресійну систему
Припустимо, у мене є панель пояснювальних змінних , для , , а також вектор змінних залежних від бінарних результатів . Тож спостерігається лише в кінцевий час а не в будь-який раніше час. Повністю загальний випадок полягає в тому, щоб мати кілька для для кожної одиниці в кожен момент часу , …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.