Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Концептуальне розуміння кореневої середньої помилки у квадраті та середнього відхилення зміщення
Я хотів би отримати концептуальне розуміння помилки кореневого середнього квадрату (RMSE) та середнього відхилення зміщення (MBD). Підрахувавши ці заходи для власного зіставлення даних, я часто здивований, виявивши, що RMSE є високим (наприклад, 100 кг), тоді як MBD низький (наприклад, менше 1%). Більш конкретно, я шукаю посилання (не в Інтернеті), яке …

2
Як перетворити порядкові дані з анкети в належні інтервальні дані?
Чи існують якісь прямі методи перетворення даних порядкового рівня в інтервальний рівень (так само, як це можна зробити і навпаки)? І performable в Excel або SPSS? Маючи дані, скажімо: 10 питань на порядковому рівні (скажімо, шкала 0-5, де 0 = "зовсім не", 5 = "весь час"), я хочу перетворити їх, …

3
Двовимірний Колмогоров-Смірнов
Я хотів би запустити кілька двовимірних тестів Колмогорова-Сміронова, щоб визначити, чи відповідає двовимірний розподіл посиланням. Чи є якийсь пакет або додаток, який я міг би використати відносно прямо? Або є інший алгоритм, який є кращим? У мене є лише базові статистичні знання.

2
Що таке тести на шматки?
Відповідаючи на запитання щодо вибору моделі за наявності мультиколінеарності , Френк Харрелл запропонував : Помістіть усі змінні в модель, але не перевіряйте ефект однієї змінної, скоригованої на ефекти конкуруючих змінних ... Тести блоку конкуруючих змінних є потужними, оскільки колінеарні змінні об'єднують сили в загальний тест на асоціацію множинного ступеня свободи, …


3
Рубі як робочий стіл статистики
Це також питання, яке дуже стосується Python як верстата для статистики та excel як робочого місця зі статистикою . Я знаю, що про Рубі проти Python ведеться велика дискусія, але це питання не в цьому. Я думав, що Рубі швидше, ніж Python і має дуже природний синтаксис, може принести користь …
13 r  python  software  ruby 

2
Результати оцінок Монте-Карло, отримані шляхом вибірки важливості
Я працював над вибіркою важливості досить близько протягом останнього року і маю декілька відкритих питань, з якими я сподівався отримати допомогу. Мій практичний досвід щодо важливих схем відбору проб полягав у тому, що вони можуть періодично давати фантастичні оцінки з низькою дисперсією та низькою ухилом. Однак частіше вони схильні давати …


3
Чи є формула або правило для визначення правильного sampSize для randomForest?
Я граю з randomForest і виявив, що загалом збільшення sampSize призводить до кращої продуктивності. Чи існує правило / формула / тощо, яке підказує, яким повинен бути оптимальний sampSize або це річ проб і помилок? Я здогадуюсь іншого способу її фразування; які мої ризики занадто малого розміру sampSize або занадто великого …
13 r  random-forest 

2
Проаналізуйте пропорції
У мене є набір даних, що містить декілька пропорцій, які складають до 1. Мене цікавить зміна цих пропорцій уздовж градієнта (див. Нижче, наприклад, дані). gradient <- 1:99 A1 <- gradient * 0.005 A2 <- gradient * 0.004 A3 <- 1 - (A1 + A2) df <- data.frame(gradient = gradient, A1 …
13 r  multinomial 

3
АР (1) є процесом Маркова?
Чи є процес AR (1), такий як процес Маркова?ут= ρ уt - 1+ εтyt=ρyt−1+εty_t=\rho y_{t-1}+\varepsilon_t Якщо це так, то VAR (1) є векторною версією процесу Маркова?


6
Мультиколінеарність, коли індивідуальні регресії суттєві, але ВІФ низькі
У мене є 6 змінних ( ), які я використовую для прогнозування . Виконуючи аналіз даних, я спершу спробував багаторазову лінійну регресію. З цього значення мали лише дві змінні. Однак, коли я провів лінійну регресію, порівнюючи кожну змінну окремо з , всі, крім однієї, були значущими ( десь від менш …

3
Відмінність випадкового відсутнього (MAR) від відсутнього повністю випадково (MCAR)
Мені це було пояснено кілька разів. Вони продовжують готувати мій мозок. Відсутня не випадкова, має сенс бути, а відсутність повністю у випадковому випадку має сенс ... це відсутність у випадковій не стільки. Що породжує дані, які були б MAR, але не MCAR?


Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.