Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Захист, що залежить від розподілу, у випадковій регресії лісу
Я використовую пакет randomForest в R (R версія 2.13.1, randomForest версія 4.6-2) для регресії і помітив у своїх результатах значну зміщення: помилка прогнозування залежить від значення змінної відповіді. Високі значення занижені, а низькі - завищені. Спочатку я підозрював, що це є наслідком моїх даних, але наступний простий приклад говорить про …

1
Як виміряти кореляцію між категоріальною змінною? [дублікат]
На це питання вже є відповідь тут : співвідношення між категоричними змінними (1 відповідь) Закрито 6 місяців тому . Я знаю, що ми можемо використовувати Spearman rho для вимірювання кореляції між числовими змінними. Але як виміряти кореляцію між категоричними змінними?

3
Очікувана найкраща ефективність на наборі даних
Скажіть, у мене є така проста проблема машинного навчання, як класифікація. Маючи деякі орієнтири у баченні чи розпізнаванні звуку, я, як людина, дуже хороший класифікатор. Тому я маю інтуїцію щодо того, наскільки хороший класифікатор може отримати. Але з великою кількістю даних один момент полягає в тому, що я не знаю, …

2
Встановлення змішаної моделі Poisson GLM зі випадковим нахилом та перехопленням
В даний час я працюю над серією моделей часових рядів Пуассона, намагаючись оцінити ефект зміни того, як були отримані підрахунки (перехід від одного діагностичного тесту до іншого), контролюючи інші тенденції з часом (скажімо, загальне збільшення рівня захворюваність). У мене є дані для кількох різних сайтів. Хоча я також займався GAM, …

1
Яка модель складного набору даних? (сотні часових рядів з великою кількістю вкладених)
У мене є досить складний набір даних для аналізу, і я не можу знайти гарне рішення для цього. Ось річ: 1. необроблені дані - це фактично записи пісень комах. Кожна пісня зроблена з декількох поривів, а кожен сплеск зроблений з підрозділів. Усі особи фіксувались протягом 5 хвилин. Кількість вибухів та …

1
Логістична регресія: згруповані та негруповані змінні (з використанням R)
Я читаю A. Agresti (2007), Вступ до категоричного аналізу даних , 2-е. видання, і я не впевнений, чи правильно я розумію цей параграф (с.106, 4.2.1) (хоча це має бути легко): У таблиці 3.1 про хропіння та захворювання серця в попередній главі 254 суб'єкти повідомляли про хропіння щовечора, з них 30 …

3
Вибір сплайну df в загальній задачі про модель Пуассона
Я вкладав деякі дані часових рядів за допомогою загальної моделі добавок Пуассона за допомогою SAS PROC GAM. Взагалі кажучи, у мене вбудована узагальнена процедура перехресної перевірки генерує принаймні гідну "вихідну точку" для мого єдиного сплайна, що є нелінійною функцією часу разом з одним параметричним терміном (один я мене насправді цікавить). …

3
Як RMSE нормалізується середнім спостережуваним значенням, що називається?
Я використовував Root Mean Squared Error(RMSE) для вимірювання точності значень, передбачених за допомогою моделі. Я розумію, що повернене значення використовує одиниці моїх мір (а не відсоток). Однак я хотів би навести свої значення у відсотках. Я прийняв такий підхід - нормалізувати RMSEсереднє значення моїх спостережень. Чи є термін для RMSE/mean?

1
Як підібрати модель Бредлі – Террі – Люсі в R, без складної формули?
Модель Бредлі – Террі – Люсі (BTL) зазначає, що , де - ймовірність того, що об'єкт вважається "кращим", важчі тощо, ніж об'єкт , і , і - параметри.pj i= л о гiт- 1(δj-δi)pji=логiт-1(δj-δi)p_{ji} = logit^{-1}(\delta_j - \delta_i)pi jpijp_{ij}jjjiiiδiδi\delta_iδjδj\delta_j Це, здається, є кандидатом на функцію glm, з сімейством = двочлен. Однак …

2
Використовуючи регресійну модель для прогнозування: Коли зупинитись?
Я розрахував просту модель лінійної регресії з моїх експериментальних заходів, щоб зробити прогнози. Я прочитав, що не слід обчислювати прогнози для балів, які занадто далеко відходять від доступних даних. Однак я не зміг знайти жодного керівництва, яке допоможе мені зрозуміти, наскільки я можу екстраполювати. Наприклад, якщо я обчислюю швидкість читання …

1
Прогнозуйте GLM poisson зі зміщенням
Я знаю, що це, мабуть, основне питання ... Але я, здається, не знаходжу відповіді. Я підходив до ГМ з родиною Пуассона, а потім намагався ознайомитись з прогнозами, однак зміщення, здається, враховується: model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003), offset=(log(population)), data=data, subset=28:36, family=poisson()) predict (model_glm, type="response") Я отримую випадки не ставки ... Я також спробував model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003)+ offset(log(population)), …

3
auto.arima попереджає NaN, що створюються на std-помилці
Мої дані - це часовий ряд зайнятого населення, L та часовий проміжок, рік. n.auto=auto.arima(log(L),xreg=year) summary(n.auto) Series: log(L) ARIMA(2,0,2) with non-zero mean Coefficients: ar1 ar2 ma1 ma2 intercept year 1.9122 -0.9567 -0.3082 0.0254 -3.5904 0.0074 s.e. NaN NaN NaN NaN 1.6058 0.0008 sigma^2 estimated as 1.503e-06: log likelihood=107.55 AIC=-201.1 AICc=-192.49 BIC=-193.79 …
9 r  regression  arima 

2
Як моделювати багаторазові результати в R?
@whuber продемонстрував, як імітувати багатоваріантні результати ( , та ) за один момент часу.у1y1y_1у2y2y_2у3y3y_3 Як ми знаємо, поздовжні дані часто зустрічаються в медичних дослідженнях. Моє запитання - як імітувати багаторазові результати в R? Наприклад, ми неодноразово вимірюємо , і у 5 різних часових точках для двох різних груп лікування.у1y1y_1у2y2y_2у3y3y_3

1
Як отримати межі рішення з лінійного SVM в R?
Мені потрібен пакет, який може дати мені рівняння для лінійної моделі SVM. В даний час я використовую e1071 так: library(e1071) m = svm(data, labels, type='C', kernel='linear', cost=cost, probability=FALSE, scale=scale) w = t(m$coefs) %*% data[m$index,] #Weight vector b = -model$rho #Offset Однак я не впевнений, як e1071::svm()вибирають позитивні та негативні класи, …
9 r  svm  e1071 

3
Часті міркування та обумовлення спостережень (приклад Wagenmakers et al.)
Я не є експертом у галузі статистики, але, на мою думку, існує розбіжність, чи "правильне" тлумачення ймовірності "часто" чи "баєса". Від Wagenmakers et. al p. 183: Розглянемо рівномірний розподіл із середнім та шириною . Намалюйте два значення випадковим чином з цього розподілу, мітка наімалейшего один і найбільшого один , і …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.