Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Чому деякі люди перевіряють регресійні припущення щодо моделей на своїх необроблених даних, а інші перевіряють їх на залишкові?
Я докторант з експериментальної психології і намагаюся вдосконалити свої вміння та знання щодо того, як аналізувати свої дані. До мого 5-го курсу психології я вважав, що регресійні моделі (наприклад, ANOVA) передбачають такі речі: нормальність даних дисперсія гомогенності даних тощо Мої бакалаврські курси спонукають мене до думки, що припущення стосуються даних. …

5
Термінова частота / обернена частота документа (TF / IDF): зважування
У мене є набір даних, який представляє 1000 документів і всі слова, які містяться в ньому. Отже, рядки представляють документи, а стовпці - слова. Так, наприклад, значення у комірці означає час, коли виникає в документі . Тепер я повинен знайти "вагу" слів, використовуючи метод tf / idf, але я фактично …


4
Придатність для дуже великих розмірів зразків
Я збираю дуже великі вибірки (> 1 000 000) категоричних даних щодня і хочу, щоб дані виглядали "суттєво" різними між днями, щоб виявити помилки в зборі даних. Я думав, що використання тесту на придатність (зокрема, G-тест) було б для цього добре (каламбур) призначений для цього. Очікуваний розподіл задається розподілом попереднього …

4
Як R, як обчислити р-значення для площі під ROC
Я намагаюся знайти спосіб обчислити р-значення для області під характеристикою оператора приймача (ROC). У мене є безперервна змінна та діагностичний результат тесту. Хочу дізнатися, чи AUROC є статистично значущим. Я знайшов багато пакетів, що стосуються кривих ROC: pROC, ROCR, caTools, верифікація, Epi. Але навіть після багатьох годин, проведених за читанням …
12 r  p-value  roc 

5
Дані Джона Керріха
Хто-небудь може підказати, де отримати результати 10 000 монетних переворотів (тобто всіх 10 000 голів і хвостів), виконаних Джоном Керріхом під час Другої світової війни?

2
Яка статистика зберігається при агрегації?
Якщо у нас довгий часовий ряд із високою роздільною здатністю, з великим рівнем шуму, часто має сенс агрегувати дані до нижчої роздільної здатності (скажімо, щоденних до місячних значень), щоб краще зрозуміти, що відбувається, ефективно видаляючи деякі шум. Я бачив принаймні один документ, який потім застосовує деякі статистичні дані до агрегованих …

1
Висновок про фіксовані ефекти в моделі змішаних ефектів
Я співвідносив дані і використовую модель змішаних ефектів логістичної регресії для оцінки індивідуального рівня (умовного) ефекту для прогнозованого інтересу. Я знаю, що для стандартних граничних моделей висновок про параметри моделі за допомогою тесту Вальда відповідає співвідношенню ймовірності та тестування балів. Зазвичай вони приблизно однакові. Оскільки Wald легко обчислити і доступний …

1
Приклад суворої нерівності фон Неймана
Нехай позначає ризик Байєса оцінювача щодо попереднього , нехай позначає набір усіх пріорів на просторі параметрів , а позначає набір всі правила (можливо рандомізовані) рішення.r(π,δ)r(π,δ)r(\pi, \delta)δδ\deltaππ\piΠΠ\PiΘΘ\ThetaΔΔ\Delta Статистичне тлумачення нерівномірності мінімакса Джона фон Неймана говорить про це supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ),supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ), \sup_{\pi\in\Pi} \inf_{\delta\in\Delta} r(\pi, \delta) \leq \inf_{\delta\in\Delta}\sup_{\pi\in\Pi} r(\pi, \delta), із суворою рівністю, гарантованою для …

1
Чи є проблема з мультиколінеарністю та регресією сплайнів?
При використанні природних (тобто обмежених) кубічних сплайнів базові функції, створені вкрай колінеарними, і при використанні в регресії, здається, створюють дуже високу статистику VIF (коефіцієнта дисперсії), що сигналізує про мультиколінеарність. Коли ми розглядаємо випадок моделі для прогнозування, це питання? Схоже, це завжди буде так через характер конструкції шпонки. Ось приклад в …

1
Чи є краща назва, ніж "середнє значення інтеграла"?
Я тестую датчики положення дросельних дроселів (TPS), що продається моїм бізнесом, і я друкую графік реакції напруги на обертання дроселя. TPS - датчик обертання з діапазоном 90 °, і вихід є як потенціометр з повним відкритим значенням 5 В (або вхідним значенням датчика), а початкове відкриття - деяким значенням від …

4
Значення, що збільшує стандартне відхилення
Мене спантеличує таке твердження: "Щоб збільшити стандартне відхилення набору чисел, потрібно додати значення, яке більше ніж одне стандартне відхилення від середнього" Що є доказом цього? Звичайно, я знаю, як ми визначаємо стандартне відхилення, але цю частину я, здається, якось пропускаю. Будь-які коментарі?

1
Плутанина щодо lmer і p-значень: як p-значення з пакету memisc порівнюються з MCMC?
У мене було враження, що функція lmer()в lme4пакеті не виробляє р-значень (див. lmer, P-значення та все таке ). Я використовую MCMC згенерованих значень р замість як на це питання: Значний ефект в lme4змішаній моделі і на це питання: Чи не вдається знайти р-значення у виведенні з lmer()в lm4пакеті вR . …

2
Чому не можна використовувати тести коефіцієнта ймовірності для моделей, які не вкладені?
Більш конкретно, чому тести на коефіцієнт ймовірності мають асимптотику розподіл 2, якщо моделі вкладені, але це вже не стосується вкладених моделей? Я розумію, що це випливає з теореми Вілкса, але, на жаль, я не розуміюїї доведення.χ2χ2\chi^2

1
Як перевести результат з lm (), що відповідає кубічному сплайну, в рівняння регресії
У мене є код і вихід, і я хотів би побудувати модель. Я не знаю, як побудувати модель, використовуючи цей вихід: require("splines") x <- c(0.2, 0.23, 0.26, 0.29, 0.33, 0.46, 0.53 ) y <- c(0.211, 0.2026, 0.2034, 0.2167, 0.2177, 0.19225, 0.182) fit <- lm(y ~ ns(x,3)) summary(fit) Зауважимо, що ns()генерується …
12 r  splines 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.