Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Лінійна регресія з помилками Лапласа
Розглянемо модель лінійної регресії: де , тобто , Розподіл Лапласа з параметром середнього та масштабу, взаємно незалежні. Розглянемо оцінку максимальної вірогідності невідомого параметра : з якого yi=xi⋅β+εi,i=1,…,n,yi=xi⋅β+εi,i=1,…,n, y_i = \mathbf x_i \cdot \boldsymbol \beta + \varepsilon _i, \, i=1,\ldots ,n, εi∼L(0,b)εi∼L(0,b)\varepsilon _i \sim \mathcal L(0, b)000bbbββ\boldsymbol \beta−logp(y∣X,β,b)=nlog(2b)+1b∑i=1n|xi⋅β−yi|−log⁡p(y∣X,β,b)=nlog⁡(2b)+1b∑i=1n|xi⋅β−yi| -\log p(\mathbf y …

1
Неможливо зробити цю мережу автоматичного кодеру належним чином (із згортковими та макспулярними шарами)
Мережі автоматичного кодування здаються набагато складнішими, ніж звичайні MLP-мережі класифікатора. Після декількох спроб використання Lasagne все, що я отримую на реконструйованому виході, - це щось, що в кращому випадку нагадує розмите усереднення всіх зображень бази даних MNIST, не залежно від того, що насправді є вхідною цифрою. Я вибрав структуру мереж …

1
Як обчислити ймовірність результату цього механічного кочення кісток?
Це питання задає питання про ймовірність успіху в рольовій грі. Однак питання та його відповіді не охоплюють деяких складностей механіка-кубика. Зокрема, він взагалі не охоплює ботів (один можливий результат). У гравця є пул для кісток, який базується на механіці в грі, яка не стосується цього питання. Пул для кісток - …
9 dice 

3
Що це за компенсація дисперсії зміщення коефіцієнтів регресії та як це отримати?
У цій роботі ( Байєсівські умовиводи про варіаційні компоненти, що використовують лише контрасти помилок , Harville, 1974), автор стверджує бути "добре відомим співвідношення ", для лінійної регресії де (y−Xβ)′H−1(y−Xβ)=(y−Xβ^)′H−1(y−Xβ^)+(β−β^)′(X′H−1X)(β−β^)(y−Xβ)′H−1(y−Xβ)=(y−Xβ^)′H−1(y−Xβ^)+(β−β^)′(X′H−1X)(β−β^)(y-X\beta)'H^{-1}(y-X\beta)=(y-X\hat\beta)'H^{-1}(y-X\hat\beta)+(\beta-\hat\beta)'(X'H^{-1}X)(\beta-\hat\beta)y=Xβ+ϵ,y=Xβ+ϵ,y=X\beta+\epsilon,ϵ∼N(0,H).ϵ∼N(0,H).\epsilon\sim\mathcal{N}(0, H). Як це добре відомо? Який найпростіший спосіб довести це?

1
Чому коефіцієнти лінійної та логістичної регресії неможливо оцінити за допомогою одного методу?
Я читав у книзі машинного навчання, що параметри лінійної регресії можна оцінити (серед інших методів) за допомогою градієнтного спуску, тоді як параметри логістичної регресії зазвичай оцінюються за максимальною оцінкою ймовірності. Чи можна пояснити новакові (мені), чому нам потрібні різні методи для лінійної / логістичної регресії. а чому б не MLE …

1
Чи можемо ми завжди переписати правильний косий розподіл з точки зору складу довільного та симетричного розподілу?
Розглянемо подвійно диференційований і симетричний розподіл . Тепер розглянемо друге вдвічі диференційоване розподіл rigth, перекошене в тому сенсі, що:FXFX\mathcal{F}_XFZFZ\mathcal{F}_Z (1)FX⪯cFZ.(1)FX⪯cFZ.(1)\quad\mathcal{F}_X\preceq_c\mathcal{F}_Z. де - це опуклий порядок ван Zwet [0], так що еквівалентний:⪯c⪯c\preceq_c(1)(1)(1) (2)F−1ZFX(x) is convex ∀x∈R.(2)FZ−1FX(x) is convex ∀x∈R.(2)\quad F^{-1}_ZF_X(x)\text{ is convex $\forall x\in\mathbb{R}.$} Розглянемо тепер третій вдвічі диференційований розподіл задовольняє:FYFY\mathcal{F}_Y …

1
Оновлення фактора Байєса
Коефіцієнт Байєса визначається в баєсівському тестуванні гіпотези та підборі байесівської моделі за співвідношенням двох граничних ймовірностей: з урахуванням iid вибірки та відповідної щільності вибірки та , з відповідними пріорами та , коефіцієнт Байєса для порівняння двох моделей - книга Я в даний час розглядає має дивне твердження , що вище …

3
Як довести, що
Я намагався встановити нерівність |Ti|=∣∣Xi−X¯∣∣S≤n−1n−−√|Ti|=|Xi−X¯|S≤n−1n\left| T_i \right|=\frac{\left|X_i -\bar{X} \right|}{S} \leq\frac{n-1}{\sqrt{n}} де середнє значення вибірки і стандартне відхилення вибірки, тобто .X¯X¯\bar{X}SSSS=∑ni=1(Xi−X¯)2n−1−−−−−−−−−√S=∑i=1n(Xi−X¯)2n−1S=\sqrt{\frac{\sum_{i=1}^n \left( X_i -\bar{X} \right)^2}{n-1}} Неважко помітити, що і так але це не дуже близько до того, що я шукав, і не є корисним пов'язаним. Я експериментував з нерівностями Коші-Шварца і …

3
Як я можу сказати, що в результатах PCA немає візерунка?
У мене є більш ніж 1000 зразків набору даних із 19 змінних. Моя мета - передбачити бінарну змінну на основі інших 18 змінних (бінарних та безперервних). Я впевнений, що 6 змінних прогнозування пов'язані з двійковою відповіддю, однак я хотів би додатково проаналізувати набір даних та шукати інші асоціації чи структури, …
9 pca 

7
Знайдіть близькі пари у дуже великому просторі з розрідженими векторами
Я маю NNN(~ мільйон) функціональних векторів. ІснуєMMM (~ мільйон) двійкових функцій, але лише в кожному векторі KKK (~ тисяча) з них було б 111, решта є 000. Я шукаю пари векторів, які мають хоча бLLL (~ сотня) спільних ознак (111в обох). Кількість таких пар має аналогічну величинуNNN (~ мільйон). Я …

1
Скільки сторін має штамп? Байєсівські умовиводи в JAGS
Проблема Я хотів би зробити якийсь висновок у системі, аналогічній тому, щоб померти з невідомою кількістю сторін. Штамп прокочується кілька разів, після чого я хотів би зробити розподіл ймовірності за параметром, відповідним кількості сторін, що має штамб, θ. Інтуїція Якщо після 40 рулонів ви спостерігали 10 червоних, 10 блюзових, 10 …

2
Чому при додаванні пояснювальної змінної сума залишків у квадраті не збільшується?
У моєму економетричному підручнику (Вступна економетрика), що охоплює OLS, автор пише: "SSR повинен впасти, коли додається ще одна пояснювальна змінна". Чому це?

1
Як встановити власні контрасти з lmer в R
Я використовую lmer в R, щоб перевірити вплив умови ( cond) на деякий результат. Ось деякі складені дані, де s є предметом ідентифікатора і a, bі cє умовами. library("tidyr") library("dplyr") set.seed(123) temp <- data.frame(s = paste0("S", 1:30), a = rnorm(30, -2, 1), b = rnorm(30, -3, 1), c = rnorm(30, …

2
Як інтерпретувати та робити прогнозування за допомогою пакету tsoutliers та auto.arima
У мене є щомісячні дані з 1993 по 2015 рік і я б хотів зробити прогнозування цих даних. Я використовував пакет tsoutliers для виявлення людей, що втратили життя, але я не знаю, як продовжувати прогнозувати свій набір даних. Це мій код: product.outlier<-tso(product,types=c("AO","LS","TC")) plot(product.outlier) Це мій вихід із пакета tsoutliers ARIMA(0,1,0)(0,0,1)[12] …

1
Це все в сім’ї; але чи включаємо ми і закони?
Припустимо, я маю експеримент з двома і більше факторами. Загальна ANOVA будується, і потім ми проводимо подальші дії з двома або більше наборами пост-спеціальних тестів, скажімо, декілька порівнянь. Моє запитання - про те, наскільки великі --- і скільки --- сімей повинні бути використані як основа для коригування кратності цих пост-спеціальних …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.