Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Незаангажований, позитивний оцінювач квадрата середнього
Припустимо, у нас є доступ до зразків iid з розподілу з істинною (невідомою) середньою та дисперсією , і ми хочемо оцінити .μ,σ2μ,σ2\mu, \sigma^2μ2μ2\mu^2 Як ми можемо побудувати неупереджений, завжди позитивний оцінювач цієї кількості? Якщо взяти квадрат зразка, середнє значення є упередженим і переоцінить кількість, esp. якщо близький до 0 і …

2
Чому ми використовуємо залишки для перевірки припущень щодо помилок у регресії?
Припустимо, у нас є модель .Yi=β0+β1Xi1+β2Xi2+⋯+βkXik+ϵiYi=β0+β1Xi1+β2Xi2+⋯+βkXik+ϵiY_i = \beta_0 + \beta_1X_{i1} + \beta_2X_{i2} + \dots + \beta_kX_{ik} + \epsilon_i Регресія має ряд припущень, наприклад, що помилки повинні бути нормально розподілені із середнім нулем та постійною дисперсією. Мене вчили перевіряти ці припущення, використовуючи звичайний графік QQ, щоб перевірити нормальність залишків та графік …

4
Як статистично довести, чи стовпець має категоричні дані чи не використовує Python
У мене є фрейм даних в python, де мені потрібно знайти всі категоричні змінні. Перевірка типу стовпця не завжди працює, тому що intтип може бути також категоричним. Тож я шукаю допомоги у пошуку правильного методу тестування гіпотез, щоб визначити, категорія категорія чи ні. Я пробував нижче тесту чи-квадрата, але не …

1
Яка різниця між функцією прийняття рішення, прогнозом_проблемою та функцією передбачення для проблеми логістичної регресії?
Я переглядав документацію sklearn, але не можу зрозуміти мету цих функцій в контексті логістичної регресії. Бо decision_functionвін говорить, що його відстань між гіперпланом і тестовим екземпляром. чим корисна ця конкретна інформація? і як це стосується predictта predict-probaметодів?

3
регресія гауссових процесів для великих наборів даних
Я дізнався про регресію процесу Гаусса з онлайн-відео та конспектів лекцій. Я розумію, що якщо у нас є набір даних з точок, то ми припускаємо, що дані вибираються з -вимірного багатовимірного гаусса. Так що моє запитання в тому випадку , коли є 10 - х мільйонів робить гауссовский процес регресії …

2
Призначення шуму Діріхле в роботі AlphaZero
У документах AlphaGo Zero та AlphaZero DeepMind вони описують додавання шуму Діріхле до попередніх імовірностей дій з кореневого вузла (стан плати) в дереві Монте-Карло: Додаткова розвідка досягається додаванням шуму Діріхле до попередніх ймовірностей у кореневому вузлі с0s0s_0конкретно П( s , a ) = ( 1 - ε )pа+ εηаП(с,а)=(1-ε)pа+εηаP(s, a) …

5
Умовні ймовірності - чи властиві вони байєсіанству?
Цікаво, чи умовні ймовірності характерні лише для байєсіанства, чи вони є більш загальною концепцією, яка поділяється серед кількох шкіл думки серед людей статистики / ймовірності. Я начебто припускаю, що це так, тому що я припускаю, що ніхто не може виглядати логічно, тому я думаю, що часто лікарі теоретично погоджуються, застерігаючи …

3
Розподіл коли є незалежними змінними
Як звичайна вправа, я намагаюся знайти розподіл де і є незалежними випадковими змінними.X2+Y2−−−−−−−√X2+Y2\sqrt{X^2+Y^2}XXXYYYU(0,1)U(0,1) U(0,1) Щільність суглоба дорівнює (X,Y)(X,Y)(X,Y)fX,Y(x,y)=10&lt;x,y&lt;1fX,Y(x,y)=10&lt;x,y&lt;1f_{X,Y}(x,y)=\mathbf 1_{0\cos^{-1}\left(\frac{1}{z}\right)cosθcos⁡θ\cos\thetaθ∈[0,π2]θ∈[0,π2]\theta\in\left[0,\frac{\pi}{2}\right]zsinθ&lt;1⟹θ&lt;sin−1(1z)zsin⁡θ&lt;1⟹θ&lt;sin−1⁡(1z)z\sin\theta<1\implies\theta<\sin^{-1}\left(\frac{1}{z}\right)sinθsin⁡θ\sin\thetaθ∈[0,π2]θ∈[0,π2]\theta\in\left[0,\frac{\pi}{2}\right] Отже, для маємо .1&lt;z&lt;2–√1&lt;z&lt;21< z<\sqrt 2cos−1(1z)&lt;θ&lt;sin−1(1z)cos−1⁡(1z)&lt;θ&lt;sin−1⁡(1z)\cos^{-1}\left(\frac{1}{z}\right)<\theta<\sin^{-1}\left(\frac{1}{z}\right) Абсолютне значення якобіана перетворення становить|J|=z|J|=z|J|=z Таким чином, щільність стику задається виразом(Z,Θ)(Z,Θ)(Z,\Theta) fZ,Θ(z,θ)=z1{z∈(0,1),θ∈(0,π/2)}⋃{z∈(1,2√),θ∈(cos−1(1/z),sin−1(1/z))}fZ,Θ(z,θ)=z1{z∈(0,1),θ∈(0,π/2)}⋃{z∈(1,2),θ∈(cos−1⁡(1/z),sin−1⁡(1/z))}f_{Z,\Theta}(z,\theta)=z\mathbf 1_{\{z\in(0,1),\,\theta\in\left(0,\pi/2\right)\}\bigcup\{z\in(1,\sqrt2),\,\theta\in\left(\cos^{-1}\left(1/z\right),\sin^{-1}\left(1/z\right)\right)\}} Інтегруючи , отримуємо pdf asθθ\thetaZZZ fZ(z)=πz210&lt;z&lt;1+(πz2−2zcos−1(1z))11&lt;z&lt;2√fZ(z)=πz210&lt;z&lt;1+(πz2−2zcos−1⁡(1z))11&lt;z&lt;2f_Z(z)=\frac{\pi z}{2}\mathbf 1_{0\sqrt 2 \end{cases} що виглядає …

2
KL Втрата з одиницею Гаусса
Я впроваджував VAE і помітив в Інтернеті дві різні реалізації спрощеної універсальної гауссової дивергенції KL. Оригінальна розбіжність, як тут, є КLl o s s= журнал(σ2σ1) +σ21+ (мк1-мк2)22σ22-12КLлосс=журнал⁡(σ2σ1)+σ12+(мк1-мк2)22σ22-12 KL_{loss}=\log(\frac{\sigma_2}{\sigma_1})+\frac{\sigma_1^2+(\mu_1-\mu_2)^2}{2\sigma^2_2}-\frac{1}{2} Якщо припустити, що наша попередня - це одиниця гаусса, тобто мк2= 0мк2=0\mu_2=0 і σ2= 1σ2=1\sigma_2=1, це спрощує вниз до КLl o s …

1
Додавання лінійного предиктора регресії зменшує R квадрат
Мій набір даних ( ) має залежну змінну (DV), п'ять незалежних змінних "базової лінії" (P1, P2, P3, P4, P5) та одну незалежну змінну, що цікавить (Q).N≈10,000N≈10,000N \approx 10,000 Я запустив лінійні регресії OLS для наступних двох моделей: DV ~ 1 + P1 + P2 + P3 + P4 + P5 …

1
Фільтр ARIMA vs Kalman - як вони пов’язані
Коли я почав читати про фільтр Кальмана, то подумав, що це особливий випадок моделі ARIMA (а саме ARIMA (0,1,1)). Але насправді здається, що ситуація складніша. Перш за все, ARIMA можна використовувати для прогнозування, а фільтр Kalman - для фільтрації. Але вони не тісно пов'язані? Питання: Який взаємозв'язок між фільтрами ARIMA …

3
Гіперплани оптимально класифікують дані, коли входи умовно незалежні - чому?
У статті під назвою " Глибоке навчання та принцип інформації " автори вказують у розділі II А) наступне: Одиничні нейрони класифікують лише лінійно відокремлювані входи, оскільки вони можуть реалізовувати лише гіперплани у своєму вхідному просторі . Гіперплани можуть оптимально класифікувати дані, коли входи є умовнонезалежними.u = w h + bу=шгод+бu …

1
Чому випадкові риси Фур’є є негативними?
Випадкові функції Фур'є забезпечують наближення до функцій ядра. Вони використовуються для різних методів ядра, таких як SVM та процеси Гаусса. Сьогодні я спробував використовувати реалізацію TensorFlow, і я отримав від’ємні значення для половини моїх функцій. Як я розумію, цього не повинно статися. Тож я повернувся до оригінального документу , який …

3
Якщо є кінцевим, то ?
Для безперервної випадкової величини XXX , якщо E(|X|)E(|X|)E(|X|) кінцева, limn→∞nP(|X|&gt;n)=0limn→∞nP(|X|&gt;n)=0\lim_{n\to\infty}n P(|X|>n)=0 ? Це проблема, яку я знайшов в Інтернеті, але я не впевнений, тримається він чи ні. Я знаю, що nP(|X|&gt;n)&lt;E(|X|)nP(|X|&gt;n)&lt;E(|X|)n P(|X|>n)<E(|X|) дотримується нерівності Маркова, але я не можу показати, що він іде до 0, оскільки nnn переходить до нескінченності.

1
Різниця між Outlier та Inlier
Я натрапив на термін inlier в мірі LOF (Local Outlier Factor), я знайомий з терміном "outliers" (в основному, laers - екземпляри, які не поводяться як решта екземплярів). Що означає "Inliers" у контексті виявлення аномалії? і як це пов’язано з (відмінними від) пережилими?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.