Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Формула закритої форми для функції розподілу, включаючи перекос і куртоз?
Чи існує така формула? Враховуючи набір даних, для яких середнє значення, дисперсія, косисть і куртоз відомі, або їх можна виміряти, чи існує єдина формула, яка може бути використана для обчислення щільності ймовірності значення, що передбачається, що походить від вищезазначених даних?

7
Яке значення має золотий стандарт?
Читаючи кілька паперів, я натрапив на термін «золотий набір» або «золотий стандарт». Що я не розумію - це те, що робить золотим стандартом набір даних? Прийняття однолітків, кількість цитувань і якщо це свобода дослідника та відповідність проблемі, яку він атакує?

1
Інтерпретація смуг діапазону в R's plot.stl?
У мене виникають проблеми з розумінням того, що plot.stlсаме означає смуги діапазону . Я знайшов пост Гевіна в цьому питанні і також прочитав документацію, я розумію, що вони говорять про відносну величину розкладених компонентів, але все ж я не зовсім впевнений, як вони працюють. Наприклад: дані: крихітний брусок, без масштабних …
13 r  time-series 

1
Як ви обираєте одиницю аналізу (рівень агрегації) у часових рядах?
Якщо ви можете виміряти часовий ряд спостережень на будь-якому рівні точності в часі, і ваша мета дослідження - виявити взаємозв'язок між X і Y, чи є емпіричне обґрунтування вибору конкретного рівня агрегації над іншим, чи слід вибір слід приймати просто на основі теорії та / або практичних обмежень? Я маю …

2
Чи достатньо обґрунтування візуалізації для трансформації даних?
Проблема Я б хотів побудувати дисперсію, пояснювану кожним із 30 параметрів, наприклад, як барплот з різною смугою для кожного параметра та дисперсією по осі y: Однак відхилення сильно перекошені до малих значень, включаючи 0, як видно з гістограми нижче: Якщо я перетворять їх за допомогою , буде легше побачити відмінності …

2
Міжбірна надійність подій у часовій серії із невизначеністю часу події
У мене є кілька незалежних кодерів, які намагаються ідентифікувати події у часовій серії - в цьому випадку дивляться відео бесіди віч-на-віч і шукають особливості невербальної поведінки (наприклад, головні кивки) та кодують час і категорію кожного. подія. Ці дані можна обґрунтувати як дискретний часовий ряд із високою швидкістю вибірки (30 кадрів …

3
Перевірка нелінійності в логістичній регресії (або інших формах регресії)
Одним із припущень логістичної регресії є лінійність у логіті. Отож, коли я почав працювати і працюю, я перевіряю нелінійність за допомогою тесту Box-Tidwell. Один з моїх безперервних прогнозів (X) випробував позитивність на нелінійність. Що я повинен зробити далі? Оскільки це порушення припущень, я повинен позбутися передбачувача (X) або включити нелінійне …


4
Що таке розподіл АБО (коефіцієнт шансів)?
У мене є маса статей, що представляють "АБО" з -95% ІС (довірчі інтервали). Я хочу оцінити з статей значення Р для спостережуваного АБО. Для цього мені потрібно припущення щодо розподілу АБО. Який дистрибутив можна безпечно припустити / використовувати?


4
Найкращі способи агрегації та аналізу даних
Нещодавно почавши навчати себе машинного навчання та аналізу даних, я потрапляю в цегляну стіну щодо необхідності створення та запиту великих наборів даних. Я хотів би взяти дані, які я зібрав у своєму професійному та особистому житті, та проаналізувати їх, але я не впевнений у найкращому способі зробити наступне: Як я …


1
Чи можна підтримувати векторну машину підтримки у великих даних?
З обмеженими знаннями, які я маю про SVM, це добре для короткої та жирної матриці даних (безліч функцій і не надто багато примірників), але не для великих даних.XXX Я розумію, одна з причин - матриця ядра - це матриця де є кількість екземплярів даних. Якщо у нас є 10000 даних, …

3
Як запустити лінійну регресію паралельно / розподіленим способом для встановлення великих даних?
Я працюю над дуже великою лінійною проблемою регресії, розмір даних настільки великий, що їх потрібно зберігати на кластері машин. Це буде занадто великим, щоб об'єднати всі зразки в одну пам'ять однієї машини (навіть диск) Щоб зробити регресію цих даних, я думаю про паралельний підхід, тобто запустити регресію в кожному окремому …


Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.