Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Чому t-тест та ANOVA дають різні р-значення для порівняння у двох групах?
У статті Вікіпедії про ANOVA про це йдеться У своїй найпростішій формі ANOVA проводить статистичний тест на те, наскільки рівними є засоби декількох груп, і тому узагальнює t-тест на більш ніж дві групи. Я розумію це в тому, що ANOVA - це те саме, що і t-тест, коли мова йде …

4
Чому Q-Learning використовує жадібний епсілон під час тестування?
У статті DeepMind про Deep Q-Learning для відеоігор Atari ( тут ) вони використовують метод жадібного епсилону для дослідження під час тренувань. Це означає, що коли в тренінгу вибирається дія, вона вибирається як дія з найвищим значенням q, або випадкова дія. Вибір між цими двома є випадковим і ґрунтується на …

2
Чи існує припущення про логістичну регресію?
Чи існує припущення про змінну реакцій логістичної регресії? Наприклад, припустимо, що у нас є точок даних. Здається, відповідь надходить з розподілу Бернуллі з . Тому у нас повинно бути розподілів Бернуллі з різним параметром .Y i p i = logit ( β 0 + β 1 x i ) 1000 …

4
Теоретична мотивація використання лого-ймовірності проти ймовірності
Я намагаюсь зрозуміти на більш глибокому рівні всюдисутність імовірності логарифма (і, можливо, більш загальної логістичної ймовірності) в статистиці та теорії ймовірностей. Імовірності журналу з'являються всюди: ми зазвичай працюємо з логопедичністю для аналізу (наприклад, для максимізації), інформація про Фішера визначається з точки зору другої похідної вірогідності журналу, ентропія - очікувана вірогідність …

2
Припустимо, . Показати
Який найпростіший спосіб зрозуміти, що таке твердження є правдивим? Припустимо, . Покажіть .Y1,…,Yn∼iidExp(1)Y1,…,Yn∼iidExp(1)Y_1, \dots, Y_n \overset{\text{iid}}{\sim} \text{Exp}(1)∑ni=1(Yi−Y(1))∼Gamma(n−1,1)∑i=1n(Yi−Y(1))∼Gamma(n−1,1)\sum_{i=1}^{n}(Y_i - Y_{(1)}) \sim \text{Gamma}(n-1, 1) Зауважимо, що .Y(1)=min1≤i≤nYiY(1)=min1≤i≤nYiY_{(1)} = \min\limits_{1 \leq i \leq n}Y_i Під X∼Exp(β)X∼Exp(β)X \sim \text{Exp}(\beta) це означає, що fX(x)=1βe−x/β⋅1{x>0}fX(x)=1βe−x/β⋅1{x>0}f_{X}(x) = \dfrac{1}{\beta}e^{-x/\beta} \cdot \mathbf{1}_{\{x > 0\}} . Неважко помітити, що Y(1)∼Exponential(1/n)Y(1)∼Exponential(1/n)Y_{(1)} …

1
Що означає зробити розмір вибірки випадковою змінною?
Френк Харрелл запустив блог ( статистичне мислення) . У своєму прем'єрському посту він перераховує деякі ключові риси його статистичної філософії. Серед інших предметів він включає: Зробіть розмір вибірки випадковою змінною, коли це можливо Що означає "зробити розмір вибірки випадковою змінною"? Які переваги цього робити? Чому це може бути кращим?

5
Чи робить статистика Баєса застарілим мета-аналіз?
Мені просто цікаво, чи буде Баєсова статистика застосовуватися внаслідок цього від першого дослідження до останнього, якщо це робить мета-аналіз застарілим. Наприклад, припустимо 20 досліджень, які проводилися в різні моменти часу. Оцінка або розподіл першого дослідження проводили з неінформативним попереднім. Друге дослідження використовує задній розподіл як попереднє. Новий задній розподіл зараз …

6
Інтуїтивне пояснення терміну в дисперсії оцінювача найменшого квадрата
Якщо є повним рангом, існує обернена , і ми отримуємо оцінку найменших квадратів: таХ Т Х β = ( Х Т Х ) - 1 х Y вар ( β ) = σ 2 ( Х Т Х ) - 1XXXXTXXTXX^TXβ^=(XTX)−1XYβ^=(XTX)−1XY\hat\beta = (X^TX)^{-1}XYVar(β^)=σ2(XTX)−1Var⁡(β^)=σ2(XTX)−1\operatorname{Var}(\hat\beta) = \sigma^2(X^TX)^{-1} Як можна інтуїтивно пояснити у …

1
Думки про перенапруження в цілому і зокрема алгоритм SMOTE [закритий]
Закрито . Це питання ґрунтується на думці . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб на нього можна було відповісти фактами та цитатами, відредагувавши цю публікацію . Закрито 2 роки тому . Яка ваша думка щодо надмірного зразка в класифікації взагалі та алгоритму SMOTE зокрема? Чому …

3
Чому існує функція щільності розподілу бета-версії -1?
Бета-розподіл з’являється під двома параметрами (або тут ) f(x)∝xα(1−x)β(1)(1)f(x)∝xα(1−x)β f(x) \propto x^{\alpha} (1-x)^{\beta} \tag{1} або той, який, здається, використовується частіше f(x)∝xα−1(1−x)β−1(2)(2)f(x)∝xα−1(1−x)β−1 f(x) \propto x^{\alpha-1} (1-x)^{\beta-1} \tag{2} Але чому саме там є " " у другій формулі?−1−1-1 Перша рецептура, інтуїтивно зрозуміло , безпосередньо відповідає біноміального розподілу g(k)∝pk(1−p)n−k(3)(3)g(k)∝pk(1−p)n−k g(k) \propto p^k (1-p)^{n-k} …


5
Чому статистики визначали випадкові матриці?
Я вивчав математику десять років тому, тому в мене є математика та статистика, але це питання мене вбиває. Це питання для мене ще трохи філософське. Чому статистики розробляли всілякі методики для роботи зі випадковими матрицями? Тобто, чи не вирішив проблему випадковий вектор? Якщо ні, то яке середнє значення для різних …

1
Чи реально ми виконуємо багатоваріантний регресійний аналіз з коефіцієнтами * мільйона * / незалежними змінними?
Я витрачаю деякий час на вивчення машинного навчання (вибачте за рекурсію :), і мені не вдалося заінтригувати правилом вибору градієнтного спуску над рішенням прямого рівняння для обчислення коефіцієнтів регресії, у випадку багатовимірної лінійної регресії. Правило: якщо кількість функцій (коефіцієнти зчитування / незалежні змінні) становить від або вище мільйона, перейдіть за …

4
Чи є дисперсія більш принциповим поняттям, ніж стандартне відхилення?
На цьому веб-сайті з психометрики я це прочитав [A] та глибока дисперсія рівня є більш фундаментальним поняттям, ніж стандартне відхилення. Сайт насправді не пояснює, чому дисперсія має бути більш фундаментальною, ніж стандартне відхилення, але це нагадало мені, що я читав деякі подібні речі на цьому сайті. Наприклад, у цьому коментарі …

3
що робить нейронні мережі нелінійною моделлю класифікації?
Я намагаюся зрозуміти математичний зміст нелінійних моделей класифікації: Я щойно прочитав статтю, яка розповідає про нейронні мережі як нелінійну модель класифікації. Але я просто розумію, що: Перший шар: h1=x1∗wx1h1+x2∗wx1h2h1=x1∗wx1h1+x2∗wx1h2h_1=x_1∗w_{x1h1}+x_2∗w_{x1h2} h2=x1∗wx2h1+x2∗wx2h2h2=x1∗wx2h1+x2∗wx2h2h_2=x_1∗w_{x2h1}+x_2∗w_{x2h2} Наступний шар y=b∗wby+h1∗wh1y+h2∗wh2yy=b∗wby+h1∗wh1y+h2∗wh2уy=b∗w_{by}+h_1∗w_{h1y}+h_2∗w_{h2y} Можна спростити до =b'+(x1∗wx1h1+x2∗wx1h2)∗wh1y+(x1∗wx2h1+x2∗wx2h2)∗wh2y=b′+(x1∗wx1h1+x2∗wx1h2)∗wh1y+(x1∗wx2h1+x2∗wx2h2)∗wh2y=b′+(x_1∗w_{x1h1}+x_2∗w_{x1h2})∗w_{h1y}+(x_1∗w_{x2h1}+x_2∗w_{x2h2})∗w_{h2y} =b'+x1(wh1y∗wx1h1+wx2h1∗wh2y)+x2(wh1y∗wx1h1+wx2h2∗wh2y)=b′+x1(wh1y∗wx1h1+wx2h1∗wh2y)+x2(wh1y∗wx1h1+wx2h2∗wh2y)=b′+x_1(w_{h1y}∗w_{x1h1}+w_{x2h1}∗w_{h2y})+x_2(w_{h1y}∗w_{x1h1}+w_{x2h2}∗w_{h2y}) Двошарова нейромережа - це просто проста лінійна регресія =b′+x1∗W′1+x2∗W′2=b′+x1∗W1′+x2∗W2'=b^′+x_1∗W_1^′+x_2∗W_2^′ Це можна показати …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.