Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Перекреслені випадкові ефекти та незбалансовані дані
Я моделюю деякі дані, де я думаю, що у мене є два перехрещені випадкові ефекти. Але набір даних не збалансований, і я не впевнений, що потрібно зробити для його врахування. Мої дані - це сукупність подій. Подія відбувається, коли клієнт зустрічається з провайдером для виконання завдання, яке є успішним чи …

3
Чи відображає розмір біноміального ефекту (BESD) оманливе зображення розміру ефекту?
Мені важко прийняти, що Дональд Рубін коли-небудь придумав би справжній лимон техніки. І все-таки таке моє сприйняття BESD [ 1 , 2 , 3 ]. Оригінальний документ Розенталя та Рубіна (1982) стверджував, що було важливим показник "як переробити будь-яке співвідношення моменту продукту на такий [2х2] дисплей, незалежно від того, чи …

3
Лінійна модель Гетероседастичність
У мене є така лінійна модель: Щоб вирішити гетероседастичність залишків, я спробував застосувати перетворення журналу на залежну змінну як але я все ще бачу такий же ефект від вентилятора на залишки. Значення DV порівняно невеликі, тому постійне додавання +1 до взяття журналу, мабуть, не підходить у цьому випадку.log(Y+1)log⁡(Y+1)\log(Y + 1) …

3
Як прогнозувати на основі агрегованих даних через нерегулярні інтервали?
Я намагаюся прогнозувати продажі продукції в торговому автоматі. Проблема полягає в тому, що машина заповнюється через нерівномірні проміжки часу, і ми можемо записувати лише сукупні продажі з моменту останньої заливки машини (тобто ми не маємо щоденних даних про продажі). Тому в основному ми маємо дані для сукупних продажів з нерегулярними …

2
Як виконувати регресію процесу Гаусса, коли наближення функції змінюється з часом?
Які хороші стратегії виконання регресії процесу Гаусса, коли функція, яку я намагаюся наблизити до змін, з часом? Наївний підхід, який мені спадає на думку, полягає у використанні лише N останніх точок даних для здійснення регресії. Які кращі стратегії?

1
Поза ядрами Фішера
На деякий час здавалося, що ядра Фішера можуть стати популярними, оскільки, здавалося, це спосіб побудувати ядра з імовірнісних моделей. Однак я рідко бачив, як вони використовуються на практиці, і я вважаю, що вони працюють не дуже добре. Вони покладаються на обчислення інформації про Фішера - цитуючи Вікіпедію: інформація Фішера - …

1
Довідка з моделювання SEM (OpenMx, polycor)
У мене багато проблем з одним набором даних, до якого я намагаюся застосувати SEM. Ми припускаємо існування 5 прихованих факторів A, B, C, D, E з показниками, відповідно. Від А1 до А5 (упорядковані фактори), від B1 до B3 (кількісні), C1, D1, E1 (всі три останні впорядковані фактори, лише 2 рівня …

1
Робота з дуже великими наборами часових рядів
У мене є доступ до дуже великого набору даних. Дані з MEG- записів людей, які слухають музичні уривки, з одного з чотирьох жанрів. Дані такі: 6 Предметів 3 Експериментальні повтори (епохи) 120 випробувань за епоху 8 секунд даних за пробу при 500 Гц (= 4000 зразків) з 275 МЕГ-каналів Отже, …

3
Підходи при навчанні з величезних наборів даних?
В основному, існує два поширених способи навчитися проти величезних наборів даних (коли ви стикаєтесь із обмеженнями часу та простору): Обман :) - використовуйте просто "керований" підмножину для тренувань. Втрата точності може бути незначною через закон зменшення віддачі - прогнозована ефективність моделі часто вирівнюється задовго до того, як у неї будуть …

3
Автоматичне очищення даних
Поширена проблема ML - це низька якість даних: помилки у значеннях значень, неправильно класифіковані екземпляри тощо тощо. Один із способів вирішення цієї проблеми - це вручну пройти дані та перевірити, але чи є інші методи? (Гадаю, що є!) Які з них краще і чому?

1
Чи є MFCC оптимальним методом подання музики до системи пошуку?
Техніка обробки сигналу, частота Cepstrum Mel , часто використовується для отримання інформації з музичного твору для використання в завданні машинного навчання. Цей метод дає короткочасний спектр потужності, а коефіцієнти використовуються як вхідні. При проектуванні систем пошуку музики такі коефіцієнти вважаються характерними для твору (очевидно, не обов'язково унікальні, але розрізняючі). Чи …

3
Чому існує значення R ^ 2 (і що його визначає), коли lm не має різниці у прогнозованому значенні?
Розглянемо наступний код R: example <- function(n) { X <- 1:n Y <- rep(1,n) return(lm(Y~X)) } #(2.13.0, i386-pc-mingw32) summary(example(7)) #R^2 = .1963 summary(example(62)) #R^2 = .4529 summary(example(4540)) #R^2 = .7832 summary(example(104))) #R^2 = 0 #I did a search for n 6:10000, the result for R^2 is NaN for #n = …
10 r  regression 

3
Повторні заходи моделювання структурного рівняння
Мені потрібно проаналізувати набір даних про клінічну реабілітацію. Мене цікавлять взаємозв'язки між кількісно вираженим "введенням" (кількістю терапії) та змінами стану здоров'я. Хоча набір даних порівняно невеликий (n ~ 70), ми повторювали дані, що відображають тимчасові зміни в обох. Я знайомий з нелінійним моделюванням змішаних ефектів в R, проте я зацікавлений …

4
Чи існує спосіб використання перехресної перевірки для вибору змінної / функції в R?
У мене є набір даних з приблизно 70 змінними, які я хотів би скоротити. Що я хочу зробити, це використовувати CV для пошуку найбільш корисних змінних у наступний спосіб. 1) Випадково виберіть скажімо 20 змінних. 2) Використовуйте stepwise/ LASSO/ lars/ тощо, щоб вибрати найбільш важливі змінні. 3) Повторіть ~ 50x …

2
Інтервал довіри для chi-квадрата
Я намагаюсь знайти рішення, щоб порівняти два тести на користь чі-квадрат. Точніше, я хочу порівняти результати двох незалежних експериментів. У цих експериментах автори застосували чи-квадрат придатності для порівняння випадкових здогадок (очікуваних частот) із спостережуваними частотами. Два експерименти отримали однакову кількість учасників і експериментальні процедури ідентичні, змінилися лише подразники. У двох …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.