Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Основні переваги моделей Гаусса
Гаусський процес широко використовувався, особливо в емуляції. Відомо, що обчислювальний попит високий ( ).0(n3)0(n3)0(n^3) Що робить їх популярними? Які їх основні та приховані переваги? Чому вони використовуються замість параметричних моделей (під параметричною моделлю я маю на увазі типову лінійну регресію, в якій різні параметричні форми можуть бути використані для опису …

3
Хороші книги для вивчення прикладної ймовірності?
Я шукаю книгу, яка забезпечує глибоке, суворе висвітлення теорії ймовірностей, але з акцентом на матеріал, який є корисним здебільшого за межами математичного відділу. Я чув, що "Теорія ймовірності: дослідження та застосування" досить гарна, але хотіла отримати ще деякі пропозиції. Наприклад, книга Ахіма Кленке для мене занадто велика ... вона організована …

1
Що стосується політики розгортання в роботі AlphaGo?
Папір тут . Політика розгортання ... - це лінійна політика softmax, заснована на швидких, поступово обчислених, локальних функціях на основі шаблону ... Я не розумію, що таке політика розгортання та як вона стосується мережі політики вибору кроку. Будь-яке простіше пояснення?

1
Вимірювання «відхилення» для нуля завищеного Пуассона або нульового надутого негативного двочлена?
Масштабне відхилення, визначене як D = 2 * (вірогідність логарифміки насиченої моделі мінус імовірність зручності пристосованої моделі), часто використовується як міра корисності придатності в моделях GLM. Процентне відхилення, що пояснюється, визначається як [D (нульова модель) - D (пристосована модель)] / D (нульова модель), також іноді використовується як аналог GLM-аналогу R-лінійної …

3
Оптимізація стохастичних комп'ютерних моделей
Це дуже важка для себе тема Google, оскільки використання слів оптимізації та стохастичності в пошуку майже автоматично встановлюється за замовчуванням для пошуку стохастичної оптимізації. Але що я дійсно хочу знати, які методи існують для оптимізації комп'ютерних моделей, коли вихід комп'ютерної моделі є стохастичним, тобто не детермінованим? Наприклад, якщо розглядати комп'ютерну …

3
Ще одне питання про центральну межу теореми
Нехай {Xn:n≥1}{Xn:n≥1}\{X_n:n\ge1\} - послідовність незалежних випадкових величин Бернуллі з P{Xk=1}=1−P{Xk=0}=1k.P{Xk=1}=1−P{Xk=0}=1k.P\{X_k=1\}=1-P\{X_k=0\}=\frac{1}{k}. Встановіть Sn=∑k=1n(Xk−1k), B2n=∑k=1nk−1k2Sn=∑k=1n(Xk−1k), Bn2=∑k=1nk−1k2S_n=\sum^{n}_{k=1}\left(X_k-\frac{1}{k}\right), \ B_n^2=\sum^{n}_{k=1}\frac{k-1}{k^2} Покажіть, щоSnBnSnBn\frac{S_n}{B_n} перетворюється в розподілі до стандартної нормальної змінноїZZZоскількиnnnпрагне до нескінченності. Моя спроба - використовувати CLT Ляпунова, тому нам потрібно показати, що існує δ>0δ>0\delta>0 такий, що limn→∞1B2+δn∑k=1nE[|Xk−1k|2+δ]=0.limn→∞1Bn2+δ∑k=1nE[|Xk−1k|2+δ]=0.\lim_{n\rightarrow \infty}\frac{1}{B_n^{2+\delta}}\sum_{k=1}^{n}E[|X_k-\frac{1}{k}|^{2+\delta}]=0. Тому задайте n ∑ k = …

1
Q-навчання за допомогою нейронної мережі як наближення функції
Я намагаюся використовувати нейронну мережу для того, щоб наблизити значення Q у Q-навчанні, як у питаннях про Q-навчання за допомогою нейронних мереж . Як було запропоновано в першій відповіді, я використовую функцію лінійної активації для вихідного шару, в той час як я все ще використовую функцію активації сигмоїдів у прихованих …

1
Наскільки відрізняється підтримка векторної регресії порівняно зі SVM?
Я знаю основи SVM та SVR, але все ще не розумію, як проблема пошуку гіперплану, який максимально збільшує запас, вписується в SVR. По-друге, я прочитав щось про використовується як межа толерантності в SVR. Що це означає?ϵϵ\epsilon По-третє, чи є різниця між параметрами функції прийняття рішення, використовуваними у SVM та SVR?

3
Як модель пропуску грам Word2Vec генерує вихідні вектори?
У мене виникають проблеми з розумінням пропускної грамної моделі алгоритму Word2Vec. У безперервному пакеті слів легко зрозуміти, як контекстні слова можуть "поміститися" в нейронній мережі, оскільки ви в основному їх середні після множення кожного з гарячих представлень кодування на вхідну матрицю W. Однак, у випадку пропуску грам, ви отримуєте вектор …

2
Дерева рішень та регресія - Чи можуть передбачувані значення виходити за межі даних про навчання?
Якщо мова йде про дерева рішень, чи може передбачуване значення лежати поза діапазоном даних про навчання? Наприклад, якщо діапазон набору навчальних даних цільової змінної становить 0-100, коли я генерую свою модель і застосовую її до чогось іншого, чи можуть мої значення становити -5? або 150? З огляду на те, що …

2
Чому класифікатор Байєса є ідеальним класифікатором?
Вважається ідеальним випадком, коли структура ймовірностей, що лежать в основі категорій, досконало відома. Чому саме завдяки класифікатору Bayes ми досягаємо найкращих показників, яких можна досягти? Яке формальне підтвердження / пояснення цьому? Ми завжди використовуємо класифікатор Байєса як орієнтир для порівняння продуктивності всіх інших класифікаторів.

1
Алгоритм: Двійковий пошук, коли значення невизначені
Мені потрібен алгоритм для здійснення двійкового пошуку, коли тест на кожному кроці може дати неправильний результат. Передумови: Мені потрібно розмістити учнів на найбільш відповідних 12 рівнях складності. Нинішній підхід є грубою силою і задає 60 запитань із численним вибором з 4 відповідями, що збільшують труднощі, зупиняючись після трьох неправильних, і …
11 algorithms 

3
Яку функцію втрати слід використовувати для отримання високої точності або високого виклику бінарного класифікатора?
Я намагаюся зробити детектор об'єктів, які трапляються дуже рідко (на зображеннях), планую використовувати двійковий класифікатор CNN, застосований у розсувному / зміненому вікні. Я сконструював збалансований набір для позитивних і негативних тренувань 1: 1 (чи правильно це робити в такому випадку btw?), І класифікатор добре працює на тестовому наборі з точки …

1
Як перевірити, чи є матриця перехресної коваріації не нульовою?
Передумови мого дослідження : У вибірці Гіббса, де ми відбираємо (змінну інтересів) і з і відповідно, де і - -вимірні випадкові вектори. Ми знаємо, що процес зазвичай розбивається на два етапи:Y P ( X | Y ) P ( Y | X ) X Y kXXXYYYP(X|Y)P(X|Y)P(X|Y)P(Y|X)P(Y|X)P(Y|X)XXXYYYkkk Період згоряння, де ми …

2
Ймовірність того, що влаштування Секретного Санта призведе до ідеальних пар
Отже, у нас був таємний Санта на роботі. Нас 8 людей. Ми кожен по черзі витягували з миски невеликий аркуш паперу з назвою. Єдине правило: якщо ви потягнете своє ім’я, вам потрібно покласти аркуш паперу назад в миску і спробувати ще раз. Давайте назвемо людей A, B, C, D, E, …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.