Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних


2
Розподіл "немішаних" деталей на основі порядку суміші
Припустимо, у мене є парні спостереження, намальовані в як для . НехайXi∼N(0,σ2x),Yi∼N(0,σ2y),Xi∼N(0,σx2),Yi∼N(0,σy2),X_i \sim \mathcal{N}\left(0,\sigma_x^2\right), Y_i \sim \mathcal{N}\left(0,\sigma_y^2\right),i=1,2,…,ni=1,2,…,ni=1,2,\ldots,nZi=Xi+Yi,Zi=Xi+Yi,Z_i = X_i + Y_i, і позначаємо черезZijZijZ_{i_j} то jjjНайбільше спостережуване значення ZZZ. Що таке (умовний) розподілXijXijX_{i_j}? (або еквівалентно, що вYijYijY_{i_j}) Тобто, що таке розподіл XiXiX_i умовний на ZiZiZ_i будучи jjjго найбільшого nnn спостережувані …

2
Переваги підходу до проблеми шляхом формулювання вартісної функції, оптимізованої в усьому світі
Це досить загальне питання (тобто не обов'язково специфічне для статистики), але я помітив тенденцію в машинному навчанні та статистичній літературі, де автори вважають за краще дотримуватися наступного підходу: Підхід 1 : Отримайте рішення практичної задачі, сформулювавши функцію витрат, для якої можна (наприклад, з обчислювальної точки зору) знайти оптимальне глобальне рішення …

1
Випадкова перевірка перестановки для вибору функції
Мене бентежить аналіз перестановки для вибору особливостей у контексті логістичної регресії. Чи можете ви надати чітке пояснення тесту випадкової перестановки та як це застосовується до вибору функцій? Можливо, з точним алгоритмом та прикладами. Нарешті, як воно порівнюється з іншими методами усадки, такими як Лассо або ЛАР?

1
Як інтерпретувати результати зменшення розмірності / багатовимірного масштабування?
Я здійснив як декомпозицію SVD, так і багатовимірне масштабування 6-мірної матриці даних, щоб краще зрозуміти структуру даних. На жаль, усі сингулярні значення мають однаковий порядок, що означає, що розмірність даних дійсно є 6. Однак я хотів би мати можливість інтерпретувати значення сингулярних векторів. Наприклад, перший здається більш-менш рівним у кожному …

3
Циклічний алгоритм k-означає
Згідно з wiki, найпоширенішим критерієм конвергенції є "призначення не змінилося". Мені було цікаво, чи може відбуватися їзда на велосипеді, якщо ми будемо використовувати такий критерій конвергенції? Буду радий, якщо хтось вказав на посилання на статтю, яка дає приклад їзди на велосипеді або доведе, що це неможливо.

5
Автоматичне визначення порогу для виявлення аномалії
Я працюю з тимчасовим рядом балів аномалій (фон - виявлення аномалії в комп'ютерних мережах). Щохвилини я отримую оцінку аномалії яка говорить про те, наскільки "несподіваним" чи ненормальним є поточний стан мережі. Чим вище оцінка, тим більше ненормальним є поточний стан. Теоретично можливі оцінки, близькі до 5, але майже ніколи не …

3
Обробка рівнів категорійних змінних "Не знаю / відмовлено"
Я моделюю прогноз діабету за допомогою логістичної регресії. Використовуваний набір даних - це система спостереження за поведінковим фактором ризику (BRFSS) Центру контролю захворювань (CDC). Однією з незалежних змінних є високий кров'яний тиск. Він категоричний з такими рівнями "Так", "Ні", "Не знаю / відмовляюся". Чи слід видаляти ці рядки за допомогою …

3
Простір-ефективна кластеризація
Більшість алгоритмів кластеризації, які я бачив, починаються зі створення відстані "кожен до кожного" серед усіх точок, що стає проблематичним для великих наборів даних. Чи є такий, хто цього не робить? Або це в якомусь частковому / наближеному / поетапному підході? Який алгоритм / реалізація кластеризації займає менше місця (O (n …

1
Як я можу оцінити відповідність GEE / логістичної моделі, коли коваріати мають деякі відсутні дані?
До моїх даних я встановив дві узагальнені моделі оцінювання рівняння (GEE): 1) Модель 1: Результат є поздовжньою змінною Так / Ні (A) (рік 1,2,3,4,5) з поздовжнім безперервним прогноктором (B) на роки 1,2,3,4,5. 2) Модель 2: Результат такий самий поздовжньої змінної Так / Ні (A), але тепер, коли мій прогноктор зафіксовано …
9 logistic  gee 

2
Статистична значущість змін у часі для 5-бального елемента Лікерта
Контекст: У мене є два набори даних з однієї анкети, які працюють протягом двох років. Кожне питання вимірюється за 5-бальною шкалою. Q1: Схема кодування На даний момент я зашифрував свої відповіді на інтервалі [0, 1], причому 0 означає "найбільш негативна відповідь", 1 означає "найбільш позитивна відповідь", а інші відповіді розташовані …

4
Як здійснити декілька пост-хо-хі-квадратних тестів на таблиці 2 X 3?
Мій набір даних складається із загальної смертності чи виживання організму на трьох типах ділянок, прибережних, середніх каналів та офшорних. Цифри в таблиці нижче представляють кількість сайтів. 100% Mortality 100% Survival Inshore 30 31 Midchannel 10 20 Offshore 1 10 Мені хотілося б дізнатися, чи кількість сайтів, де 100% смертність сталася, …

4
Аналітичне рішення оцінок коефіцієнта лінійної регресії
Я намагаюся зрозуміти матричне позначення та працюю з векторами та матрицями. Зараз я хотів би зрозуміти, як обчислюється вектор оцінок коефіцієнта при множинній регресії.β^β^\hat{\beta} Основне рівняння, здається, є ddβ(y−Xβ)′(y−Xβ)=0.ddβ(y−Xβ)′(y−Xβ)=0. \frac{d}{d\boldsymbol{\beta}} (\boldsymbol{y}-\boldsymbol{X\beta})'(\boldsymbol{y}-\boldsymbol{X\beta}) = 0 \>. Тепер як би я вирішив для вектора ββ\beta тут? Редагувати : Зачекайте, я застряг. Зараз я …

1
Чи існує еквівалент ARMA для кореляції рангів?
Я переглядаю надзвичайно нелінійні дані, для яких моделі ARMA / ARIMA не працюють добре. Хоча я бачу деяку автокореляцію, і підозрюю, що має кращі результати для нелінійної автокореляції. 1 / чи існує еквівалент PACF для кореляції рангів? (в R?) 2 / чи існує еквівалент моделі ARMA для нелінійної / рангової …

2
Як можна належним чином застосувати перехресну перевірку в контексті вибору параметрів навчання для векторних машин підтримки?
Чудовий пакет libsvm надає інтерфейс python та файл "easy.py", який автоматично шукає параметри навчання (вартість та гамма), які максимально підвищують точність класифікатора. У межах заданого кандидатом набору параметрів навчання точність функціонує шляхом перехресної перевірки, але я відчуваю, що це підриває мету перехресної перевірки. Тобто, якщо самі параметри навчання можуть бути …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.