Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Оцінка коваріаційного заднього розподілу багатоваріантного гаусса
Мені потрібно «навчитися» розподілу біваріантного гаусса з кількома зразками, але гарна гіпотеза щодо попереднього розподілу, тому я хотів би скористатися байєсівським підходом. Я визначив своє попереднє: P(μ)∼N(μ0,Σ0)P(μ)∼N(μ0,Σ0) \mathbf{P}(\mathbf{\mu}) \sim \mathcal{N}(\mathbf{\mu_0},\mathbf{\Sigma_0}) μ0=[00] Σ0=[160027]μ0=[00] Σ0=[160027] \mathbf{\mu_0} = \begin{bmatrix} 0 \\ 0 \end{bmatrix} \ \ \ \mathbf{\Sigma_0} = \begin{bmatrix} 16 & 0 \\ …

1
Як оцінити процес Пуассона за допомогою R? (Або: як використовувати пакет NHPoisson?)
У мене є база даних про події (тобто змінна дата) та пов'язані з ними коріаріати. Події породжуються нестаціонарним процесом Пуассона, параметр якого є невідомою (але можливо лінійною) функцією деяких коваріатів. Я думаю, що пакет NHPoisson існує саме для цієї мети; але після 15 годин невдалого дослідження я ще ніде не …

2
Оцінка параметрів нормального розподілу: медіана замість середньої?
Загальний підхід для оцінки параметрів нормального розподілу полягає у використанні середнього та стандартного відхилення / дисперсії вибірки. Однак якщо є якісь пережиті люди, медіана та відхилення медіани від медіани повинні бути набагато стійкішими, правда? У деяких наборах даних, які я намагався, звичайний розподіл, оцінений N(median(x),median|x−median(x)|)N(median(x),median|x−median(x)|)\mathcal{N}(\text{median}(x), \text{median}|x - \text{median}(x)|) здається, набагато …

4
Чи завжди функція logit найкраща для регресійного моделювання бінарних даних?
Я думав над цією проблемою. Звичайною логістичною функцією для моделювання двійкових даних є: Однак чи завжди найкраща для моделювання даних функція logit, що являє собою S-подібну криву? Можливо, у вас є підстави вважати, що ваші дані не відповідають звичайній S-подібній кривій, а іншому типу кривої з доменом(0,1).журнал( с1 - с) …

2
Вказання структури коваріації: плюси і мінуси
Які переваги вказують структуру коваріації в GLM (замість того, щоб обробляти всі позадіагональні записи в матриці коваріації як нуль)? Окрім відображення того, що хтось знає про дані, це робить покращити корисність? підвищити точність прогнозування даних, що витримуються? дозволяєте оцінити ступінь коваріації? Які витрати на накладення коваріаційної структури? Робить це додати …

1
Значення термінів виводу в пакеті gbm?
Я використовую пакет gbm для класифікації. Як і очікувалося, результати хороші. Але я намагаюся зрозуміти вихід класифікатора. У виході є п'ять термінів. `Iter TrainDeviance ValidDeviance StepSize Improve` Хто-небудь може пояснити значення кожного терміна, особливо значення вдосконалення .

1
Чому ми стабілізуємо дисперсію?
Під час читання методу Kaggle Essay Eval я натрапив на стабілізацію дисперсії . Вони використовують дисперсію стабілізації дисперсії для перетворення значень каппи перед тим, як взяти середнє значення, а потім перетворити їх назад. Навіть після прочитання вікі про змінні стабілізуючі перетворення я не можу зрозуміти, чому ми насправді стабілізуємо дисперсії? …

3
Навіщо використовувати певний показник помилки прогнозу (наприклад, MAD) на відміну від іншого (наприклад, MSE)?
MAD = Середнє абсолютне відхилення MSE = Середня помилка квадрата Я бачив пропозиції з різних місць, що MSE використовується, незважаючи на деякі небажані якості (наприклад, http://www.stat.nus.edu.sg/~staxyc/T12.pdf , де зазначено на сторінці p8 "Поширена думка, що MAD є кращим критерієм, ніж MSE. Однак математично MSE зручніше, ніж MAD. ") Чи є …
15 forecasting  error  mse  mae 

1
Візуалізація змішаних результатів моделі
Однією з проблем, які у мене завжди були зі змішаними моделями, є розбір даних про візуалізацію даних - такого, який міг би опинитися на папері чи плакаті - як тільки вони отримають результати. Зараз я працюю над моделлю змішаних ефектів Пуассона з формулою, яка виглядає приблизно так: a <- glmer(counts …

7
Випадковий ліс витончений
Я намагаюся використовувати випадкову регресію лісу в науках-учах. Проблема в тому, що я отримую дійсно високу помилку тесту: train MSE, 4.64, test MSE: 252.25. Ось так виглядають мої дані: (синій: реальні дані, зелений: передбачуваний): Я використовую 90% для тренувань і 10% для тесту. Це код, який я використовую після спробу …

1
Регресія помилок в змінних: чи дійсно об'єднання даних з трьох сайтів?
Нещодавно мені прийшов клієнт, щоб зробити аналіз завантаження, оскільки рецензент FDA сказав, що регресія їх помилок у змінних є недійсною, оскільки при об'єднанні даних із сайтів аналіз включає об'єднання даних із трьох сайтів, де два сайти включали деякі зразки, які були той самий. Передумови У клієнта був новий метод аналізу, …

3
Деякі питання щодо статистичної випадковості
Зі статистичної випадковості Вікіпедії : Глобальна випадковість та локальна випадковість різні. Більшість філософських концепцій випадковості є глобальними, оскільки вони ґрунтуються на ідеї, що "з часом" послідовність виглядає справді випадковою, навіть якщо певні підрядки не виглядають випадковими. Наприклад, у "справді" випадковій послідовності чисел достатньої довжини, ймовірно, були б довгі послідовності нічого, …

5
Бібліотека Java з відкритим кодом для статистики на рівні, запропонованому випускним курсом статистики
Я беру аспірантуру з прикладної статистики, яка використовує наступний підручник (щоб ви відчули рівень матеріалу, який охоплюється): Статистичні поняття та методи Г.К. Бхаттачарія та Р.А. Джонсон. Професор вимагає від нас використовувати домашні завдання SAS. Моє запитання таке: чи існує бібліотека Java (я), яка може використовуватися замість SAS для проблем, які …
15 r  sas  java 

2
Середнє значення (бали) проти Оцінка (конкатенація) в перехресній валідації
TLDR: Мій набір даних досить малий (120) зразків. Коли я роблю 10-кратну перехресну перевірку, чи повинен я: Зберіть результати з кожної тестової складки, об'єднайте їх у вектор, а потім обчисліть помилку на цьому повному векторі прогнозів (120 зразків)? Або я повинен замість цього обчислити помилку на результатах, які я отримую …

11
Приклади процесів, які не є Пуассоном?
Я шукаю кілька хороших прикладів ситуацій, які не підходять для моделювання з розподілом Пуассона, щоб допомогти мені пояснити розподіл Пуассона студентам. Як правило, можна використовувати кількість клієнтів, які приходять до магазину за часовий проміжок, як приклад, який можна змоделювати за допомогою дистрибуції Пуассона. Я шукаю контрприклад у подібному ключі, тобто …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.