Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
XGBoost проти Python Sklearn сприяв збільшенню дерев
Я намагаюся зрозуміти, як працює XGBoost. Я вже розумію, як підсилені градієнти дерева працюють на склеарні Python. Що мені незрозуміло, це якщо XGBoost працює однаково, але швидше або якщо існують принципові відмінності між ним та реалізацією python. Коли я прочитав цей документ http://learningsys.org/papers/LearningSys_2015_paper_32.pdf Мені здається, що кінцевий результат, що виходить …

2
Максимальна оцінка ймовірності - багатоваріантний гаусс
Контекст Багатоваріантний Гауссан часто з'являється в машинному навчанні, і наступні результати використовуються у багатьох книгах та курсах МЛ без виводів. Наведені дані у вигляді матриці розмірів , якщо припустити, що за даними слід варіантний гауссовий розподіл із значеннями параметрів ( ) та матриці коваріації ( ) Оцінки максимальної ймовірності задаються:XX\mathbf{X} …

5
Глибоке навчання: як я можу знати, які змінні важливі?
Щодо мовлення нейронної мережі (y = вага * x + зміщення), як я можу знати, які змінні важливіші за інші? У мене є нейронна мережа з 10 входами, 1 прихованим шаром з 20 вузлами та 1 вихідним шаром, який має 1 вузол. Я не впевнений, як знати, які вхідні змінні …

3
Коли генетичні алгоритми є хорошим вибором для оптимізації?
Генетичні алгоритми є однією з форм методу оптимізації. Часто стохастичний градієнтний спуск та його похідні є найкращим вибором для оптимізації функцій, але генетичні алгоритми все ще іноді застосовуються. Наприклад, антена космічного корабля ST5 NASA була створена за допомогою генетичного алгоритму: Коли методи генетичної оптимізації є кращим вибором, ніж більш поширені …

3
Чому ваги мереж RNN / LSTM розподіляються впродовж часу?
Нещодавно я зацікавився LSTM, і я з подивом дізнався, що ваги діляться з часом. Я знаю, що якщо ви поділяєте ваги протягом часу, то ваші послідовності введення часу можуть бути різної довжини. З загальною вагою у вас є набагато менше параметрів для тренування. З мого розуміння, причина, з якої можна …

3
Інтуїція для умовного очікування
Нехай - простір ймовірностей, заданий випадковою змінною і -algebra ми можемо побудувати нову випадкову змінну , що є умовним очікуванням.( Ω , F , μ ) ξ : Ω → R σ G ⊆ F E [ ξ | G ](Ω,F,μ)(\Omega,\mathscr{F},\mu)ξ:Ω→R\xi:\Omega \to \mathbb{R}σ\sigmaG⊆F\mathscr{G}\subseteq \mathscr{F}E[ξ|G]E[\xi|\mathscr{G}] Яка саме інтуїція думати про ? …

2
Яке значення має суперскрипт 2 підрозділу 2 у контексті норм?
Я новачок в оптимізації. Я продовжую бачити рівняння , у яких праворуч від норми є суперскрипт 2 та підпис 2. Наприклад, ось рівняння найменших квадратів хв ||Ax−b||22||Ax−b||22 ||Ax-b||^2_2 Я думаю, що я розумію суперскрипт 2: це означає вирівняти значення норми. Але що таке індекс 2? Як я повинен прочитати ці …


1
k-кратна перехресна перевірка ансамблевого навчання
Мене бентежить питання про розподіл даних для k-кратної перехресної перевірки ансамблевого навчання. Якщо припустити, що я маю ансамблеву базу для класифікації. Мій перший шар містить класифікаційні моделі, наприклад svm, дерева рішень. Мій другий шар містить модель голосування, яка поєднує прогнози з першого шару і дає остаточний прогноз. Якщо ми використовуємо …

3
Очікувана помилка передбачення - виведення
Я намагаюся зрозуміти виведення очікуваної помилки прогнозування нижче (ESL), особливо щодо виведення 2,11 та 2,12 (обумовлення, крок до точкового мінімуму). Будь-які вказівки чи посилання високо оцінені. Нижче я повідомляю витяг із ESL pg. 18. Перші два рівняння - це, по порядку, рівняння 2.11 та 2.12. Нехай X∈RpX∈RpX \in \mathbb{R}^p позначає …

1
Дистанційний нагляд: під наглядом, напівнаглядачем чи обома?
"Дистанційний нагляд" - це схема навчання, за якою класифікатор вивчається, на якому навчається набір слабких міток (дані тренувань автоматично позначаються на основі евристики / правил). Я думаю, що як навчання під наглядом, так і напівконтрольне навчання можуть включати такий "дистанційний нагляд", якщо їхні мічені дані євристично / автоматично позначені. Однак …

1
Основна небезпека Кокса
Скажімо, у мене є набір даних "нирковий катетер". Я намагаюся моделювати криву виживання за допомогою моделі Кокса. Якщо я розглядаю модель Кокса: мені потрібна оцінка базової небезпеки. Використовуючи вбудовану функцію пакета R , я легко можу це зробити так:h(t,Z)=h0exp(b′Z),h(t,Z)=h0exp⁡(b′Z),h(t,Z) = h_0 \exp(b'Z),survivalbasehaz() library(survival) data(kidney) fit <- coxph(Surv(time, status) ~ age …
20 r  cox-model  hazard 

4
Чи корисно використовувати CNN для класифікації 1D-сигналу?
Я працюю над класифікацією сну. Я прочитав деякі дослідницькі статті з цієї теми, багато з них використовували метод SVM або ансамблю. Чи корисно використовувати звивисту нейронну мережу для класифікації одновимірного ЕЕГ-сигналу? Я новачок у цій роботі. Вибачте мене, якщо я попрошу щось не так?

1
Порівняння між SHAP (Shapley Additive Explanation) та LIME (Local Interpretable Model-Agnostic Explations)
Я читаю про дві популярні пост-спеціальні методи інтерпретації моделі: LIME та SHAP У мене виникають проблеми з розумінням ключової різниці цих двох методик. Щоб процитувати Скотт Lundberg , мізки позаду SHAP: Значення SHAP поставляються з перевагами локальної оцінки чорного поля LIME, а також мають теоретичні гарантії послідовності та локальної точності …

4
Коли я повинен використовувати варіативний автокодер, на відміну від автоенкодера?
Я розумію основну структуру варіабельного автокодера та нормальний (детермінований) автокодер і математику, що стоїть за ними, але коли і навіщо я віддаю перевагу одному типу автокодера перед іншим? Все, про що я можу подумати, - це попередній розподіл прихованих змінних варіабельного автокодера, який дозволяє нам вибирати приховані змінні та потім …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.