Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Коли ми повинні дискретизувати / бін безперервні незалежні змінні / функції, а коли не слід?
Коли ми повинні дискретизувати / бін незалежні змінні / функції, а коли не слід? Мої спроби відповісти на питання: Взагалі, ми не повинні бініти, оскільки бінінг втратить інформацію. Бінінг насправді збільшує ступінь свободи моделі, тому можливе сприятливе пристосування після бінінгу. Якщо у нас є модель "з великим ухилом", бінінг може …

3
Класифікаційні / оціночні показники для сильно незбалансованих даних
Я маю справу з проблемою виявлення шахрайства (як кредитно-рахунковий). Як такий, існує сильно незбалансований зв’язок між шахрайськими та не шахрайськими спостереженнями. http://blog.revolutionanalytics.com/2016/03/com_class_eval_metrics_r.html надає чудовий огляд різних класифікаційних показників. Precision and Recallабо kappaобидва здаються хорошим вибором: Одним із способів обґрунтувати результати таких класифікаторів є порівняння їх з результатами базових класифікаторів та …

3
Що таке попередня підготовка нейронної мережі?
Ну питання все це говорить. Що означає "попередня підготовка нейронної мережі"? Чи може хтось пояснити чистою простою англійською мовою? Я не можу знайти жодні ресурси, пов'язані з цим. Було б чудово, якби хтось міг вказати мені на них.

2
Чи всі алгоритми машинного навчання розділяють дані лінійно?
Я любитель програмування та машинного навчання. Лише кілька місяців тому я почав вивчати програмування машинного навчання. Як і багато хто, хто не має кількісного наукового досвіду, я також почав дізнаватися про ML, познайомившись з алгоритмами та наборами даних у широко використовуваному пакеті ML (caret R). Ще деякий час я читав …

6
Ймовірність - навіщо розмножуватися?
Я вивчаю оцінку максимальної ймовірності і читаю, що функція ймовірності є добутком ймовірностей кожної змінної. Чому саме продукт? Чому б не сума? Я намагався шукати в Google, але не можу знайти жодних змістовних відповідей. https://en.wikipedia.org/wiki/Maximum_likelihood

2
які припущення про тест на перестановку?
Часто зазначається, що тести на перестановку не мають припущень, однак це, безумовно, не вірно. Наприклад, якщо мої зразки якимось чином співвіднесені, я можу уявити, що перекручування їх міток було б не правильним. Думаю, що про цю проблему я знайшов, - це речення з вікіпедії: "Важливе припущення, що стоїть за тестом …

1
Чому розподіл дисперсії вибірки є розподілом у квадраті?
Заява Розподіл вибірки дисперсії вибірки - це розподіл у квадратичній формі зі ступенем свободи, рівним , де - розмір вибірки (враховуючи, що випадкова змінна величина, що становить інтерес, зазвичай розподіляється).nn - 1н-1n-1ннn Джерело Моя інтуїція Це ніби має для мене інтуїтивний сенс 1) тому, що тест чі-квадрата виглядає як сума …

2
Інтерпретація середньої абсолютної помилки (MASE)
Середня абсолютна масштабована помилка (MASE) - це міра точності прогнозування, запропонована Koehler & Hyndman (2006) . МA SЕ= МА ЕМА Еi n - s a m p l e ,n a i v eМАSЕ=МАЕМАЕiн-самpле,наivеMASE=\frac{MAE}{MAE_{in-sample, \, naive}} де - середня абсолютна похибка, вироблена фактичним прогнозом; тоді як - середня абсолютна похибка, …

3
інтерпретація осі y ділянок часткової залежності
Це запитання було перенесено із переповнення стека, оскільки на нього можна відповісти на перехресному підтвердженні. Мігрували 5 років тому . Я читав інші теми про графіки часткової залежності, і більшість з них стосується того, як ви насправді побудуєте їх за допомогою різних пакетів, а не як ви можете їх точно …

5
Як розділити набір даних для прогнозування часових рядів?
У мене є історичні дані про продажі пекарні (щодня, понад 3 роки). Тепер я хочу створити модель для прогнозування майбутніх продажів (використовуючи такі функції, як будній день, змінні погоди тощо). Як слід розділити набір даних для підгонки та оцінки моделей? Чи повинен це бути хронологічний потяг / перевірка / перевірка? …

2
Чому я отримую нульову дисперсію випадкового ефекту в моїй змішаній моделі, незважаючи на певні зміни в даних?
Ми виконали логістичну регресію зі змішаними ефектами, використовуючи наступний синтаксис; # fit model fm0 <- glmer(GoalEncoding ~ 1 + Group + (1|Subject) + (1|Item), exp0, family = binomial(link="logit")) # model output summary(fm0) Тема та предмет - випадкові ефекти. Ми отримуємо непарний результат, який є коефіцієнтом і стандартним відхиленням для предмета, …

4
Чи ЛСД Фішера настільки поганий, як кажуть, що це?
Коли ми проводимо експерименти (на невеликих розмірах вибірки (зазвичай розмір вибірки на групу лікування становить приблизно 7 ~ 8)) на двох групах, ми використовуємо t-тест для перевірки на різницю. Однак, коли ми виконуємо ANOVA (очевидно, для більш ніж двох груп), ми використовуємо щось по лінії Bonferroni (LSD / # попарних …

3
Чому максимальна ймовірність і не очікувана ймовірність?
Чому так часто буває отримання максимальних оцінок ймовірності параметрів, але ви практично ніколи не чуєте про очікувані оцінки параметрів ймовірності (тобто виходячи з очікуваного значення, а не режиму функції ймовірності)? Це в першу чергу з історичних причин, або з більш предметних технічних чи теоретичних причин? Чи будуть суттєві переваги та …

3
Як неправильне попереднє приведення до правильного заднього розподілу?
Ми знаємо, що у разі правильного попереднього розповсюдження, P(θ∣X)=P(X∣θ)P(θ)P(X)P(θ∣X)=P(X∣θ)P(θ)P(X)P(\theta \mid X) = \dfrac{P(X \mid \theta)P(\theta)}{P(X)} ∝ Р( X∣ θ ) П( θ )∝П(X∣θ)P(θ) \propto P(X \mid \theta)P(\theta) . Звичайне обгрунтування цього кроку полягає в тому, що граничний розподіл , є постійним відносно і може бути ігнорований при виведенні заднього розподілу.XXXθP(X)P(X)P(X)θθ\theta …

5
Як перевірити дослідницький аналіз великих наборів даних?
Коли я починаю дослідницький аналіз великого набору даних (багато зразків, багато змінних), я часто опиняюся з сотнями похідних змінних і тоннами різних ділянок, і немає реального способу відстежувати, що відбувається куди. Код закінчується як спагетті, тому що немає напряму з самого початку ... Чи є які-небудь рекомендовані методи для того, …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.