Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Ініціалізація ваги CNN xavier
У деяких навчальних посібниках я виявив, що ініціалізація ваги "Xavier" (стаття: Розуміння труднощів дресирування глибоких нейронних мереж ) є ефективним способом ініціалізації ваг нейронних мереж. Для повністю пов’язаних шарів у цих підручниках було правило: Var(W)=2nin+nout,simpler alternative:Var(W)=1ninVar(W)=2nin+nout,simpler alternative:Var(W)=1ninVar(W) = \frac{2}{n_{in} + n_{out}}, \quad \text{simpler alternative:} \quad Var(W) = \frac{1}{n_{in}} де - …

1
Чи підходить збільшення градієнта для даних із низькими показниками подій, як 1%?
Я намагаюся збільшити градієнт на наборі даних зі швидкістю події близько 1% за допомогою майнера Enterprise, але це не вдається отримати жодного результату. Моє питання, оскільки це підхід на основі дерева рішень, чи правильно використовувати градієнтний прискорення при такій низькій події?

3
Як отримати імовірнісну інтерпретацію AUC?
Чому область під кривою ROC вірогідність того, що класифікатор класифікує випадково вибраний "позитивний" екземпляр (із отриманих прогнозів) вище, ніж випадково обраний "позитивний" (від початкового позитивного класу)? Як можна довести це твердження математично, використовуючи інтеграл, даючи CDF та PDF справжнього розподілу класів на позитивні та негативні?
14 probability  roc  auc 


2
Інтуїція на хвилини про середню кількість розподілу?
Чи може хтось запропонувати інтуїцію, чому вищі моменти розподілу ймовірностей , як третій та четвертий моменти, відповідають косості та куртозу відповідно? Зокрема, чому відхилення від середнього значення, піднятого до третьої чи четвертої сили, в кінцевому підсумку перетворюється на міру косості та куртозу? Чи є спосіб пов'язати це з третьою чи …

2
Дивергенція Дженсена Шеннона проти дивергенції Куллбека-Лейблера?
Я знаю, що Дивергенція KL не є симетричною і її не можна чітко розглядати як метрику. Якщо так, то чому він використовується, коли JS Divergence задовольняє необхідні властивості для метрики? Чи існують сценарії, коли можна використовувати дивергенцію KL, але не JS Divergence чи навпаки?

3
Приклад того, як працює трюк log-sum-exp у Naive Bayes
Я читав про трюк log-sum-exp у багатьох місцях (наприклад, тут і тут ), але ніколи не бачив прикладу того, як він застосовується спеціально до класифікатора Naive Bayes (наприклад, з дискретними особливостями та двома класами) Як саме можна уникнути проблеми числового підтоку, використовуючи цей трюк?


6
Оцінка MLE проти MAP, коли використовувати який?
MLE = Максимальна оцінка ймовірності MAP = Максимум a posteriori MLE інтуїтивно зрозумілий / наївний тим, що він починається лише з ймовірності спостереження за даним параметром (тобто функцією ймовірності) і намагається знайти параметр, що найкраще відповідає спостереженню . Але це не враховує попередніх знань. MAP видається більш розумним, оскільки він …

2
Завищена дисперсія в логістичній регресії
Я намагаюся зрозуміти поняття наддисперсії в логістичній регресії. Я читав, що наддисперсія - це коли спостерігається дисперсія змінної відповіді більша, ніж можна було б очікувати від біноміального розподілу. Але якщо біноміальна змінна може мати лише два значення (1/0), то як вона може мати середнє та дисперсію? Я добре в тому, …

2
Перехресне підтвердження та оптимізація параметрів
У мене є питання щодо оптимізації параметрів, коли я використовую 10-кратну перехресну перевірку. Я хочу запитати, чи слід виправляти параметри під час тренінгу моделі кожного зразків, тобто (1) вибирати один набір оптимізованих параметрів для середньої точності кожного згину. або (2) Я повинен знайти оптимізований параметр для кожної складки, а потім …

1
Чому помилка "розрахункове коригування" a "є NA" генерується з пакета завантаження R при обчисленні довірчих інтервалів методом bca?
У мене є векторний номер, який я завантажив сюди (... / code / MyData.Rdata) за допомогою dput. Я хотів би отримати bca ci, тому я написав цей код: my.mean <- function(dat, idx){ return (mean(dat[idx], na.rm = TRUE)) } boot.out<-boot(data=my.data, statistic = my.mean, R=1000) Але коли я запускаю наступне, я отримую …
14 r  bootstrap 

3
Обчислювально ефективна оцінка багатоваріантного режиму
Коротка версія: Який найбільш обчислювально ефективний метод оцінювання режиму багатовимірного набору даних, відібраний з безперервного розподілу? Довга версія: У мене є набір даних, необхідний для оцінки режиму. Режим не збігається із середнім чи середнім. Зразок показаний нижче, це двовимірний приклад, але рішення ND було б краще: В даний час мій …

2
Оцінка ймовірності виживання в R
На основі вибірки з разів виживання, я хотів би оцінити ймовірність виживання часу , для деякого конкретного , використовуючи оцінювач Каплан-Мейє. Чи можливо це зробити в ? Зверніть увагу, що - це не обов'язково час події.ннnттtттtRттt
14 r  kaplan-meier 

1
Чи можуть однобічні довірчі інтервали мати 95% покриття
Мені було цікаво, якщо надати однобічну (однобічну) гіпотезу з альфа-рівнем .05, чи можна говорити про 95% довірчі інтервали? Наприклад, чи можемо ми побудувати окремо «односторонні» та «двосторонні» довірчі інтервали для одностороннього тесту Z або t? якою буде "інтерпретація" кожного з цих довірчих інтервалів з огляду на однобічний тест? Я трохи …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.