Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних


1
Яку функцію втрати я повинен використовувати, щоб оцінити модель RNN seq2seq?
Я працюю над документом Cho 2014, який представив архітектуру кодер-декодер для моделювання seq2seq. У статті вони, здається, використовують ймовірність виходу даного входу (або це негативна ймовірність журналу) як функцію втрати для входу довжини та виходу довжини :xxxMMMyyyNNN P(y1,…,yN|x1,…,xM)=P(y1|x1,…,xm)P(y2|y1,x1,…,xm)…P(yN|y1,…,yN−1,x1,…,xm)P(y1,…,yN|x1,…,xM)=P(y1|x1,…,xm)P(y2|y1,x1,…,xm)…P(yN|y1,…,yN−1,x1,…,xm)P(y_1, …, y_N | x_1, …, x_M) = P(y_1 | x_1, …, x_m) …

2
Легкий доказ
Нехай - незалежні стандартні звичайні випадкові величини. Існує багато (тривалих) доказів, що показують цеZ1,⋯,ZnZ1,⋯,ZnZ_1,\cdots,Z_n ∑i=1n(Zi−1n∑j=1nZj)2∼χ2n−1∑i=1n(Zi−1n∑j=1nZj)2∼χn−12 \sum_{i=1}^n \left(Z_i - \frac{1}{n}\sum_{j=1}^n Z_j \right)^2 \sim \chi^2_{n-1} Багато доказів досить довгі, і деякі з них використовують індукцію (наприклад, статистичні умовиводи Casella). Мені цікаво, чи є легкий доказ цього результату.


2
Чи охоплює парадокс Сімпсона всі випадки повернення від прихованої змінної?
Далі йде питання про безліч візуалізацій, пропонованих як «доказ за картиною» існування парадоксу Сімпсона, і, можливо, питання про термінологію. Парадокс Сімпсона - досить просте явище для опису та надання чисельних прикладів (причина, чому це може статися, є глибокою та цікавою). Парадокс полягає в тому, що існують таблиці на випадок 2–2x2 …

6
Як називається «гаряче» кодування у науковій літературі?
Як називається оператор, який приймає категоричний вектор і перетворює його у двійкове представлення за допомогою однокольорового кодування? Мені цікаво, оскільки я пишу науковий документ і мені потрібна відповідна назва.

2
Назвіть декілька найважливіших “ранніх статей” про методи регуляризації?
У кількох відповідях я бачив, що користувачі CrossValided пропонують ОП знайти перші документи про Lasso, Ridge та Elastic Net. Що стосується нащадків, які семінарні роботи про Лассо, Рідж та Еластичну Мережу?

2
Чому нахил завжди рівно 1 при регресуванні помилок на залишках за допомогою OLS?
Я експериментував із взаємозв'язком між помилками та залишками, використовуючи прості імітації в Р. Одне, що я знайшов, - це те, що незалежно від розміру вибірки чи відхилення помилки я завжди отримую рівно 111 для нахилу, коли підходить модель errors∼β0+β1×residualserrors∼β0+β1×residualс {\rm errors} \sim \beta_0 + \beta_1 \times {\rm residuals} Ось моделювання, …

3
Питання інтерв'ю вченого: Лінійна регресія низька і що б ви зробили
Я стикався з питанням інтерв'ю для роботи, де інтерв'юер запитав мене, припустимо, що ваш дуже низький (від 5 до 10%) для моделі еластичності ціни. Як би ви вирішили це питання?R2R2R^2 Я не міг придумати нічого іншого, крім того, що я буду робити регресійну діагностику, щоб побачити, що пішло не так, …


1
Як масштабується Лассо з розміром матриці дизайну?
Якщо у мене є матриця проектування Х∈ Rn × dХ∈Rн×гX\in\mathcal{R}^{n\times d} , де - кількість спостережень розмірності , яка складність рішення для з LASSO, wrt і ? Я думаю, що відповідь має стосуватися того, як одна ітерація LASSO масштабується з цими параметрами, а не як масштабує кількість ітерацій (конвергенції), якщо …

1
Чому я отримую різні передбачення щодо ручного розширення поліномів та використання функції R `poly`?
Чому я отримую різні прогнози щодо ручного розширення поліномів та використання функції R poly? set.seed(0) x <- rnorm(10) y <- runif(10) plot(x,y,ylim=c(-0.5,1.5)) grid() # xp is a grid variable for ploting xp <- seq(-3,3,by=0.01) x_exp <- data.frame(f1=x,f2=x^2) fit <- lm(y~.-1,data=x_exp) xp_exp <- data.frame(f1=xp,f2=xp^2) yp <- predict(fit,xp_exp) lines(xp,yp) # using poly …

1
Інтуїтивне пояснення зворотної ймовірності ваги лікування (IPTW) у ваговій оцінці?
Я розумію механіку обчислення ваг, використовуючи показники схильності : а потім застосувати ваги в регресійному аналізі, і те, що ваги служать для "контроль" або роз'єднання ефектів коваріатів у групах лікування та контрольних груп із змінною результату.p(xi)p(xi)p(x_i)wi,j=treatwi,j=control=1p(xi)=11−p(xi)wi,j=treat=1p(xi)wi,j=control=11−p(xi)\begin{align} w_{i, j={\rm treat}} &= \frac{1}{p(x_i)} \\[5pt] w_{i, j={\rm control}} &= \frac{1}{1-p(x_i)} \end{align} Однак на …

2
Ефективна вибірка порогового розподілу бета-версії
Як я маю ефективну вибірку з наступного розподілу? x ∼ B ( α , β) , x > k x∼B(α,β), x>k x \sim B(\alpha, \beta),\space x > k Якщо не надто великий, то вибір вибірки відхилення може бути найкращим підходом, але я не впевнений, як діяти, коли k великий. Можливо, …


Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.