Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Чому навчання з глибокого підкріплення нестабільне?
У статті DeepMind за 2015 рік про глибоке підкріплення навчання йдеться про те, що "попередні спроби поєднати RL з нейронними мережами значною мірою зазнали невдачі через нестабільне навчання". Потім у статті перераховані деякі причини цього на основі співвідношень спостережень. Скажіть, будь ласка, хтось пояснить, що це означає? Це форма надмірного …

2
Конфліктні підходи до вибору змінної: AIC, p-значення або те й інше?
Як я розумію, вибір змінних на основі p-значень (принаймні, в контексті регресії) сильно хибний. Здається, вибір змінних на основі AIC (або подібного) також вважається дефектом з деяких причин, хоча це здається трохи незрозумілим (наприклад, дивіться моє запитання та деякі посилання на цю тему тут: Що саме таке "поетапний вибір моделі"? …

2
Гармонічне середнє мінімізує суму відносних помилок у квадраті
Я шукаю посилання, де доведено, що гармонійне значення x¯h=n∑ni=11xix¯h=n∑i=1n1xi\bar{x}^h = \frac{n}{\sum_{i=1}^n \frac{1}{x_i}} мінімізує (в ) суму відносних помилок у квадратіzzz ∑i=1n((xi−z)2xi).∑i=1n((xi−z)2xi).\sum_{i=1}^n \left( \frac{(x_i - z)^2}{x_i}\right).

2
Що говорить нам r, r квадрат і залишкове стандартне відхилення про лінійну залежність?
Невеликий фон Я працюю над інтерпретацією регресійного аналізу, але мене дуже розгублено щодо значення r, r квадрата та залишкового стандартного відхилення. Я знаю визначення: Характеристики r вимірює силу і напрямок лінійної залежності між двома змінними на розсіювачі R-квадрат - це статистичний показник того, наскільки близькі дані до встановленої лінії регресії. …

4
Як сума двох змінних може пояснити більше дисперсії, ніж окремі змінні?
Я отримую деякі непрості результати для співвідношення суми з третьою змінною, коли два предиктори негативно співвідносяться. Що викликає ці неспокійні результати? Приклад 1: Кореляція між сумою двох змінних та третьої змінної Розглянемо формулу 16.23 на сторінці 427 тексту Гільдфорда 1965 року, показану нижче. Непроста знахідка: Якщо обидві змінні співвідносяться .2 …

2
ККТ у двох словах графічно
Об'єктивна Підтвердьте, чи розуміння KKT є правильним чи ні. Шукайте додаткові пояснення та підтвердження на KKT. Фон Намагаючись зрозуміти умови KKT, особливо додаткові умови, які завжди випливають із синього кольору у статтях SVM. Мені не потрібен список абстрактних формул, але мені потрібно конкретні, інтуїтивні та графічні пояснення. Питання Якщо P, …

1
Моделювання часових рядів кругових даних
Я будую моделі ARIMA для отримання даних про вітер / хвилі. Я будую окрему модель для кожної змінної. Дві зі змінних, які мені потрібні для моделювання, - це напрямок хвилі та вітру. Значення знаходяться в градусах (0-360 °). Чи можна моделювати такий тип даних, коли інтервал значень круговий? Якщо ні, …

3
Вибір гіперпараметрів з використанням T-SNE для класифікації
В якості специфічної проблеми, з якою я працюю (конкуренція), у мене є наступне налаштування: 21 функція (числовий на [0,1]) та двійковий вихід. У мене близько 100 К рядків. Налаштування здається дуже галасливим. Я та інші учасники впродовж певного часу застосовуємо генерацію функцій, і вбудована стохастична сусідська вбудована версія t виявилася …

1
Рішення закритої форми задачі Лассо, коли матриця даних є діагональною
\newcommand{\diag}{\operatorname{diag}} ім'я У нас проблема: minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),\min_{w\in\mathbb{R}^{d}}\left( \frac{1}{n}\sum_{i=1}^{n} \left( \langle w,x_{i}\rangle-y_{i} \right)^{2} +2\lambda||w||_1\right), з припущенням, що: ∑i=1nxixTi=diag(σ21,...,σ2d).∑i=1nxixiT=diag⁡(σ12,...,σd2).\sum_{i=1}^nx_ix_i^T=\diag(\sigma_1^2,...,\sigma_d^2). Чи є в цьому випадку рішення закритої форми? Я маю це: (XTX)−1=diag(σ−21,...,σ−2d),(XTX)−1=diag⁡(σ1−2,...,σd−2),(X^TX)^{-1}=\diag\left(\sigma_1^{-2},...,\sigma_d^{-2}\right), і тому я думаю, що відповідь: : wj=yjmax{0,1−λn|yj|},wj=yjmax{0,1−λn|yj|},w\,^j=y\,^j\max\left\{0,1-\lambda \frac{n}{|y^j|}\right\}, для yj=∑i=1nyixijσ2iyj=∑i=1nyixijσi2y\,^j=\displaystyle\sum_{i=1}^n\frac{y_ix_i\,^j}{\sigma_i^2} , але я не впевнений.

2
З статистичної точки зору: перетворення Фур'є проти регресії на основі Фур'є
Я намагаюся зрозуміти, чи дискретна трансформація Фур'є дає таке ж представлення кривої, як і регресія, використовуючи основу Фур'є. Наприклад, library(fda) Y=daily$tempav[,1] ## my data length(Y) ## =365 ## create Fourier basis and estimate the coefficients mybasis=create.fourier.basis(c(0,365),365) basisMat=eval.basis(1:365,mybasis) regcoef=coef(lm(Y~basisMat-1)) ## using Fourier transform fftcoef=fft(Y) ## compare head(fftcoef) head(regcoef) FFT дає комплексне …

2
Чому нейронні мережі легко обдурити?
Я прочитав кілька статей про створення вручну зображень, щоб "обдурити" нейронну мережу (див. Нижче). Це тому, що мережі лише моделюють умовну ймовірність ? Якщо мережа може моделювати спільну ймовірність p ( y , x ) , чи все ж такі випадки будуть мати місце?p(y|x)p(y|x)p(y|x)p(y,x)p(y,x)p(y,x) Я здогадуюсь, що такі штучно створені …

3
Чому , але ?
На цій центральній сторінці AP « Випадкові змінні проти алгебраїчних змінних» автор Пітер Фланаган-Гайд розрізняє алгебраїчні та випадкові змінні. Частково каже X + X ≠ 2 Xx+x=2xx+x=2xx + x = 2x , але X+X≠2XX+X≠2XX + X \neq 2X - насправді це підзаголовок статті. У чому полягає основна відмінність алгебраїчної змінної …

3
Виконайте MCMC: використовуйте jags / stan або реалізуйте його самостійно
Я новачок у баєсівській статистиці. Я чув від дослідників, що байєсські дослідники краще впроваджують MCMC самостійно, а не використовують такі інструменти, як JAGS / Stan. Чи можу я запитати, яка користь від самостійного впровадження алгоритму MCMC ("не дуже швидкими" мовами, такими як R), за винятком цілей навчання?
13 bayesian  mcmc 

2
Чи корельовані вхідні дані призводять до перевиконання нейронних мереж?
На мою думку, корельовані вхідні дані повинні призвести до надмірного розміщення в нейронних мережах, оскільки мережа засвоює кореляцію, наприклад, шум у даних. Це правильно?

3
Чому існують великі коефіцієнти для поліномів вищого порядку
У книзі Бішопа про машинне навчання він обговорює проблему притаманння кривої функції полінома до набору точок даних. Нехай M - порядок встановленого многочлена. У ньому йдеться про те Ми бачимо, що по мірі збільшення М величина коефіцієнтів зазвичай збільшується. Зокрема, для многочлена M = 9 коефіцієнти стали точно налаштовані на …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.