Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Латентна змінна інтерпретація узагальнених лінійних моделей (ГЛМ)
Коротка версія: Ми знаємо, що логістичну регресію та пробіт-регресію можна інтерпретувати як такі, що включають суцільну приховану змінну, яка стає дискретизованою відповідно до деякого фіксованого порогу перед спостереженням. Чи існує аналогічна латентна мінлива інтерпретація, скажімо, для пуассонової регресії? Як щодо біноміальної регресії (наприклад, logit або probit), коли є більше двох …

2
Межа оцінювача регресії хребта "одинична дисперсія" при
Розглянемо регресію хребта з додатковим обмеженням, що вимагає, щоб має одиницю суми квадратів (еквівалентно одиниці дисперсії); при необхідності можна припустити, що має одиничну суму квадратів:y^y^\hat{\mathbf y}yy\mathbf y β^∗λ=argmin{∥y−Xβ∥2+λ∥β∥2}s.t.∥Xβ∥2=1.β^λ∗=arg⁡min{‖y−Xβ‖2+λ‖β‖2}s.t.‖Xβ‖2=1.\hat{\boldsymbol\beta}_\lambda^* = \arg\min\Big\{\|\mathbf y - \mathbf X \boldsymbol \beta\|^2+\lambda\|\boldsymbol\beta\|^2\Big\} \:\:\text{s.t.}\:\: \|\mathbf X \boldsymbol\beta\|^2=1. Яка межа β^∗λβ^λ∗\hat{\boldsymbol\beta}_\lambda^* коли λ→∞λ→∞\lambda\to\infty ? Ось кілька тверджень, які …

1
Показано, що 100 вимірювань для 5 суб'єктів дають набагато менше інформації, ніж 5 вимірювань для 100 предметів
На конференції я почув таке твердження: 100 вимірювань для 5 суб'єктів дають набагато менше інформації, ніж 5 вимірювань для 100 предметів. Це начебто очевидно, що це правда, але мені було цікаво, як можна це довести математично ... Я думаю, що можна використовувати лінійну змішану модель. Однак я не знаю багато …

1
t-SNE проти MDS
Останнім часом читав кілька запитань щодо t-SNE ( t-Distributed Stochastic Neighbor Embedding ), а також відвідав декілька питань щодо MDS ( багатовимірного масштабування ). Вони часто використовуються аналогічно, тому здавалося, що непогано змусити це запитання, побачивши, що тут є багато питань як щодо, так і окремо (або порівняно з PCA …

7
Чи може хтось допомогти пояснити різницю між незалежним та випадковим?
Чи в статистиці незалежні та випадкові описують однакові характеристики? Яка різниця між ними? Ми часто стикаємось з описом на зразок "двох незалежних випадкових змінних" або "випадкової вибірки". Мені цікаво, яка точна різниця між ними. Чи може хтось пояснити це і навести кілька прикладів? наприклад, незалежний, але випадковий процес?

2
Машина Больцмана з обмеженими можливостями: як вона використовується в машинному навчанні?
Фон: Так, для обмеження ваг нейронної мережі МОЖЕ бути використана обмежена машина Больцмана (БРМ). Також його можна використовувати "пошарово" шляхом побудови глибокої мережі вірування (тобто тренування -го шару на верхньому ( n - 1 ) -го шару, а потім для підготовки -й шар у верхній частині -го шару, промийте і …

4
Чи можна використовувати алгоритми машинного навчання або глибокого навчання для «покращення» процесу вибірки методу MCMC?
На основі мало знань, які я маю щодо методів MCMC (ланцюг Маркова Монте-Карло), я розумію, що відбір проб є важливою частиною вищезгаданої методики. Найпоширенішими методами відбору проб є Гамільтоніан та Метрополіс. Чи є спосіб використовувати машинне навчання або навіть глибоке навчання для побудови більш ефективного пробника MCMC?


5
Наряд: Ні срібної кулі?
Я розумію, що навіть якщо в відповідності з належною перехресної процедурою вибору перевірки і моделі, перенавчання буде , якщо один шукає в моделі досить важко , якщо накласти обмеження на складності моделі, період. Крім того, часто люди намагаються навчитися штрафувати щодо складності моделі з даних, що підриває захист, який вони …

4
Різниця між припущеннями, що лежать в основі кореляції, і значущі тести регресійного нахилу
Моє запитання виріс із обговорення з @whuber в коментарях до іншого питання . Зокрема, коментар @whuber був такий: Однією з причин, яка може вас здивувати, є те, що припущення, що лежать в основі тесту кореляції та тесту регресійного нахилу, різні - тож навіть коли ми розуміємо, що кореляція та нахил …

3
Чи можливий градієнтний спуск для kernelized SVM (якщо так, то чому люди використовують квадратичне програмування)?
Чому люди використовують методи квадратичного програмування (наприклад, SMO) при роботі з ядрами SVM? Що не так з градієнтним узвозом? Чи неможливо користуватися ядрами або це занадто повільно (і чому?). Ось трохи більше контексту: намагаючись зрозуміти SVMs трохи краще, я використовував Gradient Descent для підготовки лінійного класифікатора SVM, використовуючи наступну функцію …

2
Підвищення нейронних мереж
Нещодавно я працював над вивченням алгоритмів прискорення, таких як adaboost, gradient boost, і я знав той факт, що найпоширенішими слабовживаними є дерева. Мені дуже хочеться знати, чи є кілька останніх успішних прикладів (я маю на увазі деякі статті чи статті) для використання нейронних мереж як базового учня.

1
Anscombe-подібні набори даних із тим самим графіком вікон і вусів (середнє / std / медіан / MAD / хв / макс)
EDIT: Оскільки це питання завищене, підсумок: пошук різних значущих та інтерпретованих наборів даних із однаковою змішаною статистикою (середня, середня, середня та їх пов’язана дисперсія та регресія). Квартет Anscombe (див. Призначення візуалізації даних високих розмірів? ) - відомий приклад чотирьох наборів даних - , з однаковим граничним середнім / стандартним відхиленням …

4
«Напівнавчальне навчання» - це надмірна підготовка?
Я читав звіт про переможне рішення конкурсу Kaggle ( Класифікація зловмисних програм ). Звіт можна знайти у цьому дописі на форумі . Проблема була проблемою класифікації (дев'ять класів, метрика - логарифмічна втрата) із 10000 елементами в наборі поїздів, 10000 елементами в тестовому наборі. Під час змагань моделі оцінювались проти 30% …

2
Додавання ваг до логістичної регресії для незбалансованих даних
Я хочу моделювати логістичну регресію з незбалансованими даними (9: 1). Я хотів спробувати параметр ваг у glmфункції у R, але я не на 100% впевнений, що це робить. Скажімо, моя вихідна змінна c(0,0,0,0,0,0,0,0,0,1). тепер я хочу надати «1» вагу в 10 разів більше. тому я навожу аргумент ваг weights=c(1,1,1,1,1,1,1,1,1,1,1,10). Коли …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.