Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Структура даних та функції виклику для даних про періодичні події із залежними від часу змінними
Я намагаюся оцінити вплив 2 препаратів ( drug1, drug2) на ймовірність падіння пацієнта ( event). Пацієнти можуть впасти не один раз, і їх можна в будь-який момент надіти або зняти. Моє запитання полягає в тому, як слід структурувати дані щодо періоду часу (днів), зокрема, чи потрібно перетинатись між днями. Є …
9 r  survival  cox-model 

3
Логістична регресія: максимізація справжніх позитивних результатів - помилкових позитивних результатів
У мене є логістична регресійна модель (підходить через glmnet в R з регулюванням пружної сітки), і я хотів би максимально розрізнити між справжніми позитивними та помилковими позитивами. Для цього було придумано наступну процедуру: Підходить стандартна модель логістичної регресії Використовуючи поріг прогнозування як 0,5, визначте всі позитивні прогнози Призначте вагу 1 …

6
Як оцінити функцію векторної авторегресії та імпульсної реакції за допомогою даних панелі
Я працюю над оцінкою векторної автоматичної регресії (VAR) та функції імпульсного реагування (IRF) на основі даних панелі з 33 індивідами протягом 77 кварталів. Як слід аналізувати такий тип ситуації? Який алгоритм існує для цієї мети? Я вважаю за краще провести ці аналізи в R, тому якщо хтось знайомий з кодом …

1
Прихована модель Маркова для прогнозування подій
Запитання : Чи встановлена ​​нижче схема розумної реалізації моделі прихованого Маркова? У мене є набір даних 108,000спостережень (за 100 днів) і приблизно 2000подій протягом усього періоду спостереження. Дані виглядають як на малюнку нижче, де спостерігається змінна може приймати 3 дискретні значення[ 1 , 2 , 3 ][1,2,3][1,2,3]і червоні стовпці виділяють …

3
Розуміння байесівських прогнозних розподілів
Я проходжу курс «Вступ до Байєса» і мені виникають труднощі в розумінні прогнозних розподілів. Я розумію, чому вони корисні, і я знайомий з визначенням, але є деякі речі, які я не зовсім розумію. 1) Як отримати правильний прогнозний розподіл для вектора нових спостережень Припустимо, що ми побудували модель вибірки для …

4
Моделювання футбольних результатів
У Dixon, Coles ( 1997 ), вони використали максимальну оцінку ймовірності для двох модифікованих незалежних моделей Пуассона в (4.3) для моделювання балів у футболі. Я намагаюся використовувати R для того, щоб "відтворити" альфа та бета, а також параметри домашнього ефекту (стор. 274, таблиця 4), не використовуючи жодних пакетів (також використовуються …

2
Моделювання даних для відповідності моделі посередництва
Мені цікаво знайти процедуру моделювання даних, що відповідають заданій моделі посередництва. Відповідно до загальної структури лінійних структурних рівнянь для тестування моделей посередництва, вперше викладених Барроном та Кенні (1986) та описаних у інших місцях, таких як Judd, Yzerbyt, & Muller (2013) , моделі посередництва для результатівYYY, посередник , і предиктор , …

1
Оцінка ефективності прогнозування часових рядів
У мене є динамічна модель наївних баєсів, що навчається на кількох часових змінних. Результатом моделі є прогнозування P(Event) @ t+1, оцінене на кожній t. Діаграма P(Event)порівняння timeнаведена на малюнку нижче. На цій фігурі чорна лінія відображається так, P(Event)як передбачила моя модель; горизонтальна червона лінія представляє собою попереднє ймовірність того, що …

1
Узагальнена модель добавок: Що є ref.df у виведенні R?
Привіт, я намагаюся зрозуміти Ref.df на екрані виводу в R: Approximate significance of smooth terms: edf Ref.df F p-value s(meangrain) 1.779 2.209 3.193 0.0451 * s(depth) 2.108 2.697 3.538 0.0254 * Що це означає і чи потрібно включати цей термін для представлення результатів GAM в документі? Чи дає нам інформацію, …

3
Чому теорема Байєса працює графічно?
З математичної точки зору теорема Байєса має для мене ідеальний сенс (тобто виведення та доведення), але те, що я не знаю, є чи немає приємного геометричного чи графічного аргументу, який може бути показаний для пояснення теореми Байєса. Я спробував Гуглінг навколо, щоб відповісти на це, і на диво, я не …

1
Перевірка гіпотези на рівність пропорцій з 3-ма зразками
У мене є набір даних даних про клієнтів мобільного телефону з двома стовпцями. Перший стовпець містить певну категорію, до якої потрапляє обліковий запис (або А, В, або С), а другий стовпець містить двійкове значення за тим, чи скасовано цей рахунок. напр A | cancelled C | active B | active …

1
Використання аналізу основних компонентів та відповідності
Я аналізую набір даних, що стосуються міжміських спільнот. Дані є відсотковим покриттям (морські водорості, канали, мідії тощо) у квадратах. Я звик думати про аналіз листування (CA) з точки зору кількості видів , і принцип компонентного аналізу (РСА) , як - то більш корисне для лінійних навколишнього середовища (НЕ видів) тенденцій. …

1
Інтерпретація оцінки помилки сумки для RandomForestRegressor
Я використовую регрессор RandomForest за моїми даними, і я міг бачити, що показник oob був 0,83. Я не впевнений, як це вийшло таким. Я маю на увазі мої цілі - високі значення в межах 10 ^ 7. Так що якщо це MSE, то він повинен був бути набагато вище. Я …

2
Розрахунок інтервалу прогнозування
У мене є такі дані, які знаходяться тут . Я намагаюся обчислити 95% довірчий інтервал середньої чистоти, коли відсоток вуглеводнів дорівнює 1,0. В R я ввожу наступне. > predict(purity.lm, newdata=list(hydro=1.0), interval="confidence", level=.95) fit lwr upr 1 89.66431 87.51017 91.81845 Однак як я можу отримати цей результат сам? Я намагався використати …

6
Які алгоритми машинного навчання можна масштабувати за допомогою hadoop / map-reduct
Масштабовані алгоритми машинного навчання, схоже, гудуть сьогодні. Кожна компанія не обробляє великих даних . Чи є підручник, в якому йдеться про те, які алгоритми машинного навчання можна масштабувати, використовуючи паралельні архітектури, такі як Map-Reduce, а які не можуть? Або якісь відповідні папери?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.