Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Чому кілька (якщо не всі) параметричних тестів на гіпотезу припускають випадкову вибірку?
Тести, такі як Z, t та кілька інших, припускають, що дані базуються на випадковій вибірці. Чому? Припустимо, я роблю експериментальні дослідження, де я дбаю набагато більше про внутрішню обгрунтованість, ніж про зовнішню. Отже, якщо мій зразок може бути трохи упередженим, добре, як я прийняв не виводити гіпотезу для цілих груп …

3
Чи зберігається стаціонарність при лінійному поєднанні?
Уявіть, у нас є два часові ряди процесів, які є стаціонарними, виробляючи: .xt,ytxt,ytx_t,y_t Чи , також нерухомий? ∀ α , β ∈ Rzt=αxt+βytzt=αxt+βytz_t=\alpha x_t +\beta y_t∀α,β∈R∀α,β∈R\forall \alpha, \beta \in \mathbb{R} Будь-яка допомога буде вдячна. Я б сказав, що так, оскільки він має представництво MA.

2
Як жорстко обгрунтувати вибрані помилково-позитивні / хибно-негативні коефіцієнти помилок та базовий коефіцієнт витрат?
Контекст Група соціологів та статистиків ( Benjamin et al., 2017 ) нещодавно висловили припущення, що типовий хибнопозитивний показник ( = .05), який використовується як поріг для визначення "статистичної значущості", повинен бути пристосований до більш консервативного порогу ( α = .005). Конкуруюча група соціологів та статистиків ( Lakens et al., 2018 …

3
Як запрограмувати симуляцію Монте-Карло парадоксального коду Бертранда?
Наступна проблема була розміщена на сторінці Mensa International у Facebook: \quad\quad\quad\quad\quad\quad\quad\quad Сама публікація отримала 1000+ коментарів, але я не буду вникати в деталі щодо дебатів там, оскільки знаю, що це парадокс Бертранда, і відповідь - . Що мене тут цікавить - це як можна відповісти на цю проблему, використовуючи підхід …

5
коли і незалежно
Y X ∼ χ 2 ( n - 1 ) Y ∼ Beta ( nXXX і незалежно розподілені випадковими змінними, де і . Який розподіл ?YYYX∼χ2(n−1)X∼χ(n−1)2X\sim\chi^2_{(n-1)}Y∼Beta(n2−1,n2−1)Y∼Beta(n2−1,n2−1)Y\sim\text{Beta}\left(\frac{n}{2}-1,\frac{n}{2}-1\right)Z=(2Y−1)X−−√Z=(2Y−1)XZ=(2Y-1)\sqrt X Щільність суглоба задається числом(X,Y)(X,Y)(X,Y) fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x&gt;0,0&lt;y&lt;1}fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x&gt;0,0&lt;y&lt;1}f_{X,Y}(x,y)=f_X(x)f_Y(y)=\frac{e^{-\frac{x}{2}}x^{\frac{n-1}{2}-1}}{2^{\frac{n-1}{2}}\Gamma\left(\frac{n-1}{2}\right)}\cdot\frac{y^{\frac{n}{2}-2}(1-y)^{\frac{n}{2}-2}}{B\left(\frac{n}{2}-1,\frac{n}{2}-1\right)}\mathbf1_{\{x>0\,,\,00\,,\,|z|<w\}} Тоді граничний pdf із - , що мене нікуди не веде.f Z ( z ) = ∫ ∞ …

3
Дослідник 1 проводить 1000 регресій, дослідник 2 працює лише 1, обидва отримують однакові результати - чи повинні вони робити різні умовиводи?
Уявіть, що дослідник досліджує набір даних та виконує 1000 різних регресій, і він виявляє одне цікаве відношення між ними. Тепер уявіть, що інший дослідник з тими ж даними виконує лише 1 регресію, і виявляється, що той самий дослідник взяв 1000 регресій, щоб знайти. Дослідник 2 не знає дослідника 1. Чи …

1
Матрична форма зворотного розмноження з партійною нормалізацією
Нормалізація партії пояснюється значним покращенням продуктивності глибоких нейронних сіток. Багато матеріалів в Інтернеті показує, як реалізувати його на основі активації за допомогою активації. Я вже реалізував backprop, використовуючи матричну алгебру, і враховуючи, що я працюю на мовах високого рівня (покладаючись на Rcpp(а згодом і на GPU) для щільного множення матриці), …

1
Чи є
Мій колега хоче проаналізувати деякі дані після перетворення змінної відповіді, піднявши її до потужності (тобтоу0,125).1818\frac18у0,125у0,125y^{0.125} Мені це незручно, але я намагаюся сформулювати чому. Я не можу придумати жодного механістичного обгрунтування цієї трансформації. Також я ніколи не бачив цього раніше, і я переживаю, що, можливо, це завищує коефіцієнти помилок типу I …

1
Узагальнені моделі добавок (GAM), взаємодії та коваріати
Я досліджував цілий ряд інструментів для прогнозування і виявив, що узагальнені моделі добавок (GAM) мають найбільший потенціал для цієї мети. Ігри чудові! Вони дозволяють задавати складні моделі дуже стисло. Однак ця сама лаконічність викликає у мене певну плутанину, зокрема, стосовно того, як GAM сприймають терміни взаємодії та коваріати. Розглянемо приклад …
12 r  modeling  gam  mgcv 

5
Чи лінійна регресія застаріла? [зачинено]
Закрито . Це питання ґрунтується на думці . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб на нього можна було відповісти фактами та цитатами, відредагувавши цю публікацію . Закрито 2 роки тому . Зараз я перебуваю в класі лінійної регресії, але не можу похитнутись від того, що …

2
Розуміння логістичної регресії та ймовірності
Як насправді працює оцінка параметрів / Навчання логістичній регресії? Я спробую поставити те, що у мене поки що. Вихід - y вихід логістичної функції у вигляді ймовірності залежно від значення x: P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)={1\over1+e^{-\omega^Tx}}\equiv\sigma(\omega^Tx) P(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1-P(y=1|x)=1-{1\over1+e^{-\omega^Tx}} Для одного виміру так звані коефіцієнти визначаються наступним чином: p(y=1|x)1−p(y=1|x)=p(y=1|x)p(y=0|x)=eω0+ω1xp(y=1|x)1−p(y=1|x)=p(y=1|x)p(y=0|x)=eω0+ω1x{{p(y=1|x)}\over{1-p(y=1|x)}}={{p(y=1|x)}\over{p(y=0|x)}}=e^{\omega_0+\omega_1x} Тепер додаємо logфункції для отримання W_0 та …

1
Короткий виклад підходу GAM
Якщо ми підходимо до гри, наприклад: gam.fit = gam::gam(Outstate ~ Private + s(Room.Board, df = 2) + s(PhD, df = 2) + s(perc.alumni, df = 2) + s(Expend, df = 5) + s(Grad.Rate, df = 2), data = College) Де ми використовуємо набір даних College, який можна знайти всередині пакета …
12 anova  gam 

1
Як можна вирішити відсутні дані, використовуючи сплайни або дробові многочлени?
Я читаю багатоваріантну побудову моделей: прагматичний підхід до регресійного аналізу на основі дробових поліномів моделювання безперервних змінних Патріка Ройстона та Віллі Зауербрей. Поки що я вражений, і цікавий підхід я раніше не розглядав. Але автори не мають справу з відсутніми даними. Дійсно, на с. 17 вони кажуть, що відсутні дані …

1
Чому надлишкова середня параметризація прискорює Gibbs MCMC?
У книзі Gelman &amp; Hill (2007) (Аналіз даних за допомогою регресії та багаторівневих / Ієрархічних моделей) автори стверджують, що включення надлишкових середніх параметрів може допомогти прискорити MCMC. Наведений приклад - це вкладена модель "тренажера польоту" (урівень 13.9): уiγjδк∼ N( μ + γj [ i ]+ δk [ i ], σ2у)∼ …

2
Сплайни в GLM та GAM
Чи не так, що сплайни доступні лише в GAM-моделях, а не в GLM-моделях? Я почув це деякий час назад і замислювався, чи це просто помилкова думка, чи є якась правда в цьому. Ось ілюстрація:

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.