Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Очікувана кількість кидків до появи першої голови
Припустимо, що справедлива монета кидається неодноразово, поки вперше не вийде голова. Яка очікувана кількість кидок, які знадобляться? Яка очікувана кількість хвостів, які будуть отримані до отримання першої голови?

3
Аналіз розбіжності Куллбека-Лейблера
Розглянемо наступні два розподіли ймовірностей P Q 0.01 0.002 0.02 0.004 0.03 0.006 0.04 0.008 0.05 0.01 0.06 0.012 0.07 0.014 0.08 0.016 0.64 0.928 Я підрахував розбіжність -Лейблера, яка дорівнює , я хочу взагалі знати, що мені показує це число? Взагалі, розбіжність Куллбека-Лейблера показує мені, наскільки далеко один розподіл …

4
Коли Баєсові методи переважніші перед частотологами?
Мені дуже хочеться дізнатися про байєсівські методики, тому я намагався трохи навчити себе. Однак мені важко бачити, коли використання байєсівських методів коли-небудь надає перевагу перед частотологічними методами. Наприклад: Я бачив у літературі трохи про те, як одні використовують інформативні пріори, тоді як інші використовують неінформативні попередні. Але якщо ви використовуєте …

1
Умовне очікування R-квадрата
Розглянемо просту лінійну модель: уy = X ′ ββ + ϵyy=X′ββ+ϵ\pmb{y}=X'\pmb{\beta}+\epsilon де і , і містить стовпець констант.ϵ i ∼ i . i . д .N ( 0 , σ 2 ) ϵi∼i.i.d.N(0,σ2)\epsilon_i\sim\mathrm{i.i.d.}\;\mathcal{N}(0,\sigma^2)X ∈ R n × pX∈Rn×pX\in\mathbb{R}^{n\times p} p ≥ 2 p≥2p\geq2XXX Моє запитання, з огляду на , \ …


5
Чому мій R-квадрат настільки низький, коли моя t-статистика настільки велика?
Я побіг регресії з 4 змінних, і всі вони дуже статистично значущими, зі значеннями T ≈7,9,26≈7,9,26\approx 7,9,26 і 313131 (я говорю ≈≈\approx бо здається недоречним включати десяткові) , які є дуже високими і чітко значущими. Але тоді R2R2R^2 лише .2284. Чи неправильно я тлумачу значення t тут, щоб означати те, …

1
Побудова розподілу Діріхле з розподілом Гамма
Нехай X1,…,Xk+1X1,…,Xk+1X_1,\dots,X_{k+1} - взаємно незалежні випадкові величини, кожна з яких має розподіл гами з параметрами αi,i=1,2,…,k+1αi,i=1,2,…,k+1\alpha_i,i=1,2,\dots,k+1 показують, що Yi=XiX1+⋯+Xk+1,i=1,…,kYi=XiX1+⋯+Xk+1,i=1,…,kY_i=\frac{X_i}{X_1+\cdots+X_{k+1}},i=1,\dots,k, мають спільний розподіл у виглядіDirichlet(α1,α2,…,αk;αk+1)Dirichlet(α1,α2,…,αk;αk+1)\text{Dirichlet}(\alpha_1,\alpha_2,\dots,\alpha_k;\alpha_{k+1}) Спільний pdf з (X1,…,Xk+1)=e−∑k+1i=1xixα1−11…xαk+1−1k+1Γ(α1)Γ(α2)…Γ(αk+1)(X1,…,Xk+1)=e−∑i=1k+1xix1α1−1…xk+1αk+1−1Γ(α1)Γ(α2)…Γ(αk+1)(X_1,\dots,X_{k+1})=\frac{e^{-\sum_{i=1}^{k+1}x_i}x_1^{\alpha_1-1}\dots x_{k+1}^{\alpha_{k+1}-1}}{\Gamma(\alpha_1)\Gamma(\alpha_2)\dots \Gamma(\alpha_{k+1})} Тоді, щоб знайти спільний pdf з(Y1,…,Yk+1)(Y1,…,Yk+1)(Y_1,\dots,Y_{k+1})я не можу знайти якобіан, тобтоJ(x1,…,xk+1y1,…,yk+1)J(x1,…,xk+1y1,…,yk+1)J(\frac{x_1,\dots,x_{k+1}}{y_1,\dots,y_{k+1}})

2
Візуалізація основи сплайну
У підручниках зазвичай є прикладні графіки основи для рівномірних сплайнів, коли вони пояснюють тему. Щось на зразок ряду маленьких трикутників для лінійного сплайна або ряду маленьких горбків для кубічного сплайна. Це типовий приклад: http://support.sas.com/documentation/cdl/en/statug/63033/HTML/default/viewer.htm#statug_introcom_a0000000525.htm Мені цікаво, чи існує простий спосіб генерувати графік основи сплайну за допомогою стандартних функцій R (наприклад, …

1
Стандартні похибки для множинних коефіцієнтів регресії?
Я розумію, що це дуже основне питання, але я не можу знайти відповіді ніде. Я обчислюю коефіцієнти регресії, використовуючи звичайні рівняння або QR-розкладання. Як я можу обчислити стандартні помилки для кожного коефіцієнта? Зазвичай я вважаю, що стандартні помилки обчислюються як: SEx¯ =σx¯n√SEx¯ =σx¯nSE_\bar{x}\ = \frac{\sigma_{\bar x}}{\sqrt{n}} Що таке для кожного …

2
Частка поясненої дисперсії в моделі зі змішаними ефектами
Я не знаю, чи це просили раніше, але я нічого не знайшов про це. Моє запитання полягає в тому, якщо хтось може надати хороший посилання, щоб дізнатися, як отримати пропорцію дисперсії, пояснену кожним із фіксованих та випадкових факторів у моделі зі змішаними ефектами.

1
Припущення LASSO
У сценарії регресії LASSO де y=Xβ+ϵy=Xβ+ϵy= X \beta + \epsilon , і оцінки LASSO даються наступною проблемою оптимізації minβ||y−Xβ||+τ||β||1minβ||y−Xβ||+τ||β||1 \min_\beta ||y - X \beta|| + \tau||\beta||_1 Чи існують припущення щодо розповсюдження інформації щодо ϵϵ\epsilon ? У сценарії OLS можна очікувати, що є незалежним та нормально розподіленим.ϵϵ\epsilon Чи має сенс аналізувати …

2
Чому ми робимо велику метушню з приводу використання балів Fisher, коли ми підходимо до GLM?
Мені цікаво, чому ми ставимося до встановлення GLMS як до якоїсь особливої ​​проблеми оптимізації. Чи вони? Мені здається, що вони просто максимальна ймовірність, і ми записуємо ймовірність, а потім ... ми її максимально збільшуємо! То чому ми використовуємо бал Фішера замість будь-якої безлічі схем оптимізації, розроблених у прикладній математичній літературі?

1
Як працює випадкова кухонна мийка?
Минулого року на NIPS 2017 Алі Рахімі та Бен Рехт виграли нагороду за тест часу за свою статтю "Випадкові функції для крупномасштабних машин ядра", де вони ввели випадкові функції, пізніше кодифіковані як алгоритм випадкових мийок на кухні. У рамках оприлюднення своїх робіт вони показали, що їх модель може бути реалізована …

4
Про CNN, ядра та інваріантність масштабу / обертання
У мене є пара питань, які мене бентежать стосовно CNN. 1) Особливості, отримані за допомогою CNN, - інваріантність масштабу та обертання? 2) Ядра, які ми використовуємо для згортання з нашими даними, вже визначені в літературі? що це за ядра? це різне для кожної програми?

4
Формули ACF та PACF
Я хочу створити код для побудови ACF та PACF з даних часових рядів. Так само, як цей генерований сюжет із minitab (нижче). Я спробував шукати формулу, але я все ще не добре її розумію. Ви не проти сказати мені формулу і як її використовувати, будь ласка? Яка горизонтальна червона лінія …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.