Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Інтуїтивне розуміння теореми Халмоса-Сайджена
Теорема Пол Річард Халмош-Savage каже , що для домінували статистичної моделі статистика достатньо, якщо (і тільки якщо) для всіх існує мірна версія похідної Нікодима Радона де є привілейований міра така , що для і .(Ω,A,P)(Ω,A,P)(\Omega, \mathscr A, \mathscr P)T:(Ω,A,P)→(Ω′,A′)T:(Ω,A,P)→(Ω′,A′)T: (\Omega, \mathscr A, \mathscr P)\to(\Omega', \mathscr A'){P∈P}{P∈P}\{P \in \mathscr{P} \} TTTdPdP∗dPdP∗\frac{dP}{dP*}dP∗dP∗dP*P∗=∑∞i=1PiciP∗=∑i=1∞PiciP*=\sum_{i=1}^\infty …

1
Різні типи коваріації для гауссових моделей сумішей
Спробувавши тут Гауссові моделі сумішей , я знайшов ці 4 типи коваріацій. 'full' (each component has its own general covariance matrix), 'tied' (all components share the same general covariance matrix), 'diag' (each component has its own diagonal covariance matrix), 'spherical' (each component has its own single variance). Я дуже багато …

2
Чому RNN з одиницями LSTM також можуть страждати від "вибуху градієнтів"?
У мене є основні знання про те, як працюють RNN (і, зокрема, з одиницями LSTM). У мене є живописне уявлення про архітектуру блоку LSTM, тобто клітинки та декількох воріт, які регулюють потік значень. Однак, мабуть, я не до кінця зрозумів, як LSTM вирішує проблему "зникаючих та вибухаючих градієнтів", яка виникає …

1
Формат введення для відповіді у двочленному glm в R
В R, існує три методи для форматування вхідних даних для логістичної регресії з використанням glmфункції: Дані можуть бути у "двійковому" форматі для кожного спостереження (наприклад, y = 0 або 1 для кожного спостереження); Дані можуть бути у форматі "Вілкінсон-Роджерс" (наприклад, y = cbind(success, failure)) у кожному рядку, що представляє одну …

3
Розуміння MCMC: якою була б альтернатива?
Вивчення байєсівської статистики вперше; як кут до розуміння MCMC я задумався: чи це робиться щось, що принципово не можна зробити іншим способом, чи це просто робити щось набагато ефективніше, ніж альтернативи? Для ілюстрації, припустимо, що ми намагаємося обчислити ймовірність наших параметрів за даними даною моделлю, яка обчислює навпаки, . Щоб …
13 bayesian  mcmc 

5
Чому спуск градієнта неефективний для великого набору даних?
Скажімо, наш набір даних містить 1 мільйон прикладів, тобто , і ми хочемо використовувати спуск градієнта для виконання логістичної або лінійної регресії на цих наборах даних.х1, … , Х106x1,…,x106x_1, \ldots, x_{10^6} Що це з методом градієнтного спуску робить його неефективним? Нагадаємо, що крок градієнта спуску в момент часу задається:тtt шt …

2
Як обчислюється метод подібності у SpaCy?
Не впевнений, що це правильний стек-сайт, але тут ідеться. Як працює метод .симіліарності? Нічого чудовий spaCy! Модель tfidf може бути простішою, але w2v лише з одним рядком коду ?! У своєму підручнику з 10 рядків про spaCy andrazhribernik покажіть нам метод подібності, який можна запускати на лексемах, сентах, фрагментах слів …

4
Якщо кожен нейрон в нейронній мережі в основному є функцією логістичної регресії, чому багатошаровий краще?
Я проходжу курс DeepAI Cousera (відео 1 тиждень "Огляд нейронних мереж"), і Ендрю Нг пояснює, як кожен шар в нейронній мережі - лише чергова логістична регресія, але він не пояснює, як це робить більш точним. Отже, у двошаровій мережі, як обчислення логістичного багаторазового використання робить її більш точною?

3
Чи оптимізація PCA опукла?
Цільова функція аналізу головних компонент (PCA) є мінімізація похибки відновлення в нормі L2 (дивіться розділ 2.12 тут Інший вид намагається максимізувати дисперсію на проекції У нас також є відмінний пост тут: .. Яка цільова функція PCA ? ). Моє запитання полягає в тому, що оптимізація PCA опукла? (Я знайшов тут …

1
Чому класифікатор наївних баєсів оптимальний для втрати 0-1?
Класифікатор Naive Bayes - це класифікатор, який присвоює елементи хxx класу СCC на основі максимізації заднього П( С| х)P(C|x)P(C|x) для приналежності до класу, і передбачає, що функції елементів не залежать. Втрата 0-1 - це втрата, яка присвоює будь-якій помилковій класифікації втрату "1", а втрату "0" - будь-якій правильній класифікації. Я …

1
Чому на практиці не застосовується алгоритм спуску «Без сідла» Ньютона?
Нещодавно я прочитав статтю Янна Дофіна та ін. Виявлення та атака проблеми сідлових точок у великомірній невипуклій оптимізації , де вони запроваджують цікавий алгоритм спуску під назвою Ньютон , що не є сідлом , який, здається, є спеціально розробленим для оптимізації нейронної мережі і не повинен страждати від застрявання в …

1
Чи точно визначені 2SLS-медіа-неупереджені?
У Здебільшого безшкодній економетрії: Супутник емпіриків (Ангріст і Пішке, 2009: стор. 209) я прочитав наступне: (...) Насправді, щойно визначений 2SLS (скажімо, простий Оцінювач Вальда) є приблизно неупередженим . Це важко показати формально, оскільки щойно визначений 2SLS не має моментів (тобто розподіл вибірки має жирові хвости). Тим не менш, навіть із …


2
Чи є обставини, коли слід застосовувати поетапну регресію?
Поступова регресія в минулому використовувалася в багатьох біомедичних працях, але, схоже, це покращується з кращою освітою багатьох її питань. Однак багато старих рецензентів все ще просять цього. Які обставини, коли поетапна регресія відіграє певну роль і їх слід використовувати, якщо такі є?

1
Чи є норма MLE асимптотично нормальною та ефективною, навіть якщо модель не відповідає дійсності?
Приміщення: це може бути дурним питанням. Я знаю лише твердження про асимптотичні властивості MLE, але я ніколи не вивчав докази. Якби я це зробив, можливо, я б не задавав цих питань, або, можливо, я зрозумів би, що ці питання не мають сенсу ... тому, будь ласка, просто на мене :) …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.