Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних


1
RMSProp та Adam проти SGD
Я виконую експерименти над набором валідації EMNIST, використовуючи мережі з RMSProp, Adam та SGD. Я досягаю 87% точності за допомогою SGD (ступінь навчання 0,1) та випадання (0,1 випадання задачі), а також регуляризація L2 (1e-05 штраф). Перевіряючи таку саму точну конфігурацію з RMSProp та Адамом, а також початковий рівень навчання 0,001, …

4
Який зв’язок між ANOVA для порівняння засобів декількох груп та ANOVA для порівняння вкладених моделей?
Я досі бачив, як ANOVA використовується двома способами: По-перше , у моєму вступному тексті статистики ANOVA було введено як спосіб порівняння засобів трьох або більше груп, як поліпшення порівняно з парним порівнянням, щоб визначити, чи має один із засобів статистично значущу різницю. По-друге , у своєму статистичному навчальному тексті я …

1
Причинний ефект завдяки регулюванням задніх та дверних дверей
Якщо ми хотіли обчислити причинний ефект на Y у причинному графіку нижче, ми можемо використовувати як теорему регулювання задньої двері, так і теореми регулювання передньої двері, тобто P ( y | do ( X = x ) ) = ∑ u P ( y | x , u ) P …

2
Чи можна (теоретично) тренувати нейронну мережу з меншою кількістю зразків тренувань, ніж ваги?
Перш за все: я знаю, немає загальної кількості розміру вибірки, необхідної для тренування нейронної мережі. Це залежить від занадто багато факторів, таких як складність завдання, шум у даних тощо. І чим більше навчальних зразків у мене буде, тим краще буде моя мережа. Але мені було цікаво: чи теоретично можливо тренувати …

5
Чи можливо, що дві випадкові змінні з однієї сімейства розподілу мають однакові очікування та дисперсію, але різні вищі моменти?
Я думав про значення сім’ї в масштабі локації. Я розумію, що для кожного члена місцезнаходження шкали сім'ї з параметрами розташування і шкалою, то розподіл не залежить від будь - яких параметрів , і це те ж саме для кожного , що належить до цього сімейства.XXXb Z = ( X - …

3
Які алгоритми вимагають однокольорового кодування?
Я ніколи не знаю, коли використовувати однокольорове кодування для не упорядкованих категоричних змінних, а коли не потрібно. Я використовую його, коли алгоритм використовує метрику відстані для обчислення подібності. Чи може хто-небудь дати загальне правило щодо того, які типи алгоритмів вимагатимуть, щоб не упорядковані категоричні ознаки були однокольоровими, а які - …

1
Варіативні умовиводи, дивергенція KL вимагає справжнього
На мій (дуже скромний) рівень розуміння варіативного висновку, намагається наблизити невідомий розподіл шляхом пошуку розподілу який оптимізує наступне:qpppqqq KL(p||q)=∑xp(x)logp(x)q(x)KL(p||q)=∑xp(x)logp(x)q(x)KL (p||q) = \sum\limits_{x} p(x)log \frac {p(x)}{q(x)} Щоразу, коли я вкладаю час на розуміння варіативного висновку, я продовжую вражати цією формулою і не можу не відчути, як я пропускаю суть. Здається, мені …

1
Який алгоритм класифікації слід використовувати, побачивши, що t-SNE добре розділяє класи?
Припустимо, у нас є проблема класифікації, і спочатку ми хочемо отримати деяке розуміння даних і ми робимо t-SNE. Результат t-SNE дуже добре розділяє класи. Це означає, що можна побудувати класифікаційну модель, яка також буде дуже добре розділяти класи (якщо t-SNE не відокремлюється добре, то це не означає багато). Знаючи, що …

2
Як спуск міні-партії градієнта оновлює ваги для кожного прикладу в партії?
Якщо ми обробляємо, наприклад, 10 прикладів у партії, я розумію, що ми можемо підсумовувати втрати за кожним прикладом, але як працює зворотне розмноження щодо оновлення ваг для кожного прикладу? Наприклад: Приклад 1 -> втрата = 2 Приклад 2 -> втрата = -2 Це призводить до середньої втрати 0 (E = …

3
Мотивація сигмоїдних вихідних одиниць у нейронних мережах, починаючи з ненормалізованих ймовірностей журналу, лінійних у
Передумови: Я вивчаю розділ 6 «Глибоке навчання» Іона Гудфллоу та Йошуа Бенджо та Аарона Курвіля. У розділі 6.2.2.2 (сторінки 182 з 183, які можна переглянути тут ) використання сигмоїдів для виведення P(y=1|x)P(y=1|x)P(y=1|x) мотивовано. Підсумовуючи частину матеріалу, вони дозволяють z=wTh+bz=wTh+bz = w^Th+b бути вихідним нейроном до застосування активації, де hhh - …

3
Чи є серйозна проблема із скиданням спостережень із відсутніми значеннями при обчисленні кореляційної матриці?
У мене є цей величезний набір даних, що містить 2500 змінних і як 142 спостереження. Я хочу запустити кореляцію між змінною X та рештою змінних. Але для багатьох стовпців записи відсутні. Я спробував це зробити в R, використовуючи аргумент "попарно-повний" ( use=pairwise.complete.obs), і він вивів купу кореляцій. Але тоді хтось …

2
Математична інтуїція рівняння зміщення-варіації
Нещодавно я задав питання, що шукав математичну інтерпретацію / інтуїцію за елементарним рівнянням, що стосується середньої вибірки та дисперсії: , геометрична чи інша.E[X2]=Var(X)+(E[X])2E[X2]=Var(X)+(E[X])2 E[X^2] = Var(X) +(E[X])^2 Але зараз мені цікаво поверхнево подібне рівняння компромісії відхилення. MSE(θ^)=E[(θ^−θ)2]==E[(θ^−E[θ^])2]+(E[θ^]−θ)2Var(θ^)+Bias(θ^,θ)2MSE(θ^)=E[(θ^−θ)2]=E[(θ^−E[θ^])2]+(E[θ^]−θ)2=Var(θ^)+Bias(θ^,θ)2 \begin{eqnarray} \text{MSE}(\hat{\theta}) = E [(\hat{\theta}-\theta)^2 ] &=& E[(\hat{\theta} - E[\hat\theta])^2] + (E[\hat\theta] - …
12 variance  bias 

1
Чому lm і biglm в R дають різні значення p для одних і тих же даних?
Ось невеликий приклад: MyDf<-data.frame(x=c(1,2,3,4), y=c(1.2, .7, -.5, -3)) Тепер із base::lm: > lm(y~x, data=MyDf) %>% summary Call: lm(formula = y ~ x, data = MyDf) Residuals: 1 2 3 4 -0.47 0.41 0.59 -0.53 Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 3.0500 0.8738 3.491 0.0732 . x -1.3800 0.3191 …

2
Яка різниця між «регулярною» лінійною регресією та лінійною регресією глибокого навчання?
Я хочу знати різницю між лінійною регресією у звичайному аналізі машинного навчання та лінійною регресією в умовах «глибокого навчання». Які алгоритми використовуються для лінійної регресії в умовах глибокого навчання.

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.