Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Прогнозування реакції з нових кривих за допомогою пакета fda в R
В основному все, що я хочу зробити, це передбачити скалярну реакцію за допомогою деяких кривих. У мене є регрес (з використанням fRegress з пакета fda), але не маю уявлення, як застосувати результати до НОВОГО набору кривих (для прогнозування). У мене N = 536 кривих і 536 скалярних відповідей. Ось що …

3
Як кластеризувати поздовжні змінні?
У мене є купа змінних, які містять поздовжні дані від 0 до 7 дня. Я шукаю відповідний підхід кластеризації, який може класифікувати ці поздовжні змінні (а не випадки) у різні групи. Я спробував проаналізувати цей набір даних окремо за часом, але результат був досить важко пояснити. Я досліджував наявність процедури …
10 clustering 

1
То як би ви включили баєсовські оцінки в метааналіз?
Натхненний цим питанням, зокрема "Проблемою 3": Задні розподіли дещо складніше включити в метааналіз, якщо тільки не наводиться частотистський параметричний опис розподілу. Нещодавно я багато думав над тим, як включити метааналіз в байєсівську модель - насамперед як джерело пріорів - але як рухатись до цього іншого напрямку? Якщо байєсівський аналіз справді …

1
Як я можу знайти кореляції між збоями та системними середовищами?
У вільний час я працюю над невеликою веб-системою, яка збирає звіти про збої (але не інші звіти про помилки, що не збиваються), що надсилаються з програм Delphi Windows. Для усунення несправностей користувачі хочуть мати функцію обміну даними для пошуку зв’язків між апаратними версіями або версіями операційної системи та конкретною помилкою …

2
Як зробити ROC-аналіз у R за допомогою моделі Кокса
Я створив кілька регресійних моделей Кокса, і я хотів би побачити, наскільки добре працюють ці моделі, і я подумав, що, можливо, крива ROC або c-статистика можуть бути корисні аналогічно використанню цих статей: JN Armitage och JH van der Meulen, "Виявлення супутньої захворюваності у хірургічних пацієнтів за допомогою адміністративних даних з …
10 r  survival  roc 

8
Який алгоритм може бути використаний для прогнозування використання витратних матеріалів за даними минулих покупок?
Думаючи про нібито просту, але цікаву проблему, я хотів би написати якийсь код, щоб прогнозувати витратні матеріали, які мені знадобляться найближчим часом, враховуючи повну історію попередніх закупівель. Я впевнений, що ця проблема має дещо більш загальне та добре вивчене визначення (хтось припускав, що це пов'язане з деякими поняттями в ERP-системах …

1
Гарні практики при прогнозуванні часових рядів
Я працював місяцями над короткостроковим прогнозуванням навантаження та використанням даних про клімат / погоду для підвищення точності. У мене є інформація з інформатики, і тому я намагаюся не робити великих помилок і несправедливих порівнянь, працюючи з інструментами статистики, такими як моделі ARIMA. Мені хотілося б дізнатися вашу думку про пару …

2
Хороша книга з рівним наголосом на теорію та математику
У мене було достатньо курсів зі статистики в шкільні роки та в університеті. Я добре розумію такі поняття, як, CI, p-значення, інтерпретація статистичної значущості, багаторазове тестування, кореляція, проста лінійна регресія (з найменшими квадратами) (загальні лінійні моделі) та всі тести гіпотези. Мене знайомили з цим більшу частину ранніх часів здебільшого математично. …

2
Тестування гіпотез та загальна відстань варіації проти дивергенції Кульбека-Лейблера
У своєму дослідженні я зіткнувся з такою загальною проблемою: у мене є два розподіли і по одному домену і велика (але кінцева) кількість вибірок з цих розподілів. Зразки незалежно та однаково розподіляються з одного з цих двох розподілів (хоча розподіли можуть бути пов’язані між собою: наприклад, може бути сумішшю та …

2
Потужність для двох зразків t випробування
Я намагаюся зрозуміти розрахунок потужності для випадку двох незалежних пробних тестів (не передбачаючи рівних дисперсій, тому я використовував Satterthwaite). Ось діаграма, яку я знайшов, щоб допомогти зрозуміти процес: Тож я припустив, що враховуючи наступне про дві популяції та розміри вибірки: mu1<-5 mu2<-6 sd1<-3 sd2<-2 n1<-20 n2<-20 Я міг обчислити критичне …


1
Чи є середня вибірка «найкращою» оцінкою середнього розподілу в якомусь сенсі?
За (слабким / сильним) законом великих чисел, з огляду на деякі iid-вибіркові точки розподілу, їх вибірка означає сходиться до середнього значення розподілу як вірогідно, так і як розмір вибірки іде до нескінченності.{xi∈Rn,i=1,…,N}{xi∈Rn,i=1,…,N}\{x_i \in \mathbb{R}^n, i=1,\ldots,N\}f∗({xi,i=1,…,N}):=1N∑Ni=1xif∗({xi,i=1,…,N}):=1N∑i=1Nxif^*(\{x_i, i=1,\ldots,N\}):=\frac{1}{N} \sum_{i=1}^N x_i NNN Коли розмір вибірки фіксований, мені цікаво, чи оцінювач LLN є оптимізатором, …

2
Як порівняти дві чи більше матриць кореляції?
Я маю кореляційні матриці обчислені з множинами даних (спостерігається) за допомогою функції MATLAB .PPP(n×n)(n×n)(n \times n)PPP(m×n)(m×n)(m \times n)corrcoef Як я порівнюю та проаналізую ці матриці кореляції відносно один одного?PPP Що таке випробування, методи та / або контрольні пункти?

3
Як оцінити корисність відповідності певної нелінійної моделі? [зачинено]
Важко сказати, про що тут питають. Це питання є неоднозначним, розпливчастим, неповним, надто широким або риторичним і не може бути обґрунтованим відповіді в його теперішній формі. Для уточнення цього питання, щоб його можна було знову відкрити, відвідайте довідковий центр . Закрито 7 років тому . У мене є нелінійна модель …

2
Сильно нерегулярний часовий ряд
У мене є дані про популяцію декількох різних риб, відібраних за період від 5 років, але за дуже нерегулярною схемою. Іноді між зразками бувають місяці, іноді є кілька проб за один місяць. Також багато 0 підрахунків Як поводитися з такими даними? Я можу досить легко зобразити його в R, але …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.