Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Розуміння та застосування аналізу настроїв
Мені щойно призначили проект проведення аналізу настроїв для деяких колекцій документів. За допомогою Googling з'явилося багато досліджень, пов'язаних з настроями. Мої запитання: Які основні методи / алгоритми аналізу настроїв у галузі машинного навчання та статистичного аналізу? Чи є чітко встановлені результати? Чи існує якесь програмне забезпечення з відкритим кодом, яке …

1
Класифікація з одним домінуючим предиктором
Я маю (ккk-класова) класифікаційна проблема з набором 100 реальних оцінок прогнозів, один з яких, здається, має набагато більше пояснювальної сили, ніж будь-який з інших. Я хотів би детальніше познайомитися з ефектами інших змінних. Однак, стандартні методи машинного навчання (випадкові ліси, SVM та ін.), Схоже, переповнюються одним сильним передбачувачем і не …

1
Питання про комбінацію / ймовірність на основі довжини рядка та можливих символів
Якщо припустити "повну випадковість" і надати рядок довжиною 20 символів, де кожен символ може бути одним з 62 можливих символів: Яка можлива загальна кількість комбінацій? (Вгадуючи 20 під силу 62.) Крім того, якщо нові рядки вибираються випадковим чином одна за одною і додаються до списку рядків, вибраних до цього часу, …

3
Кореляція між матрицями в R
У мене проблеми з використанням cor()і cor.test()функцій. У мене просто дві матриці (тільки числові значення, однакова кількість рядків і стовпців), і я хочу мати номер кореляції та відповідне p-значення. Під час використання cor(matrix1, matrix2)я отримую коефіцієнти кореляції для всіх комірок. Я просто хочу одне число в результаті кор. Крім того, …
9 r  correlation 

2
Імпутація для обліку систематичної помилки у відповідях опитування
У мене є велике опитування, в якому студенти запитували, серед іншого, рівень освіти їхньої матері. Деякі пропустили це, а деякі відповіли неправильно. Я це знаю, тому що там пізніше опитували підрозділ матері перших респондентів, і вони задали те саме питання. (Я впевнена, що існує якась менша кількість помилок, пов’язаних із …

1
Як зрозуміти стандартизований залишковий аналіз в регресійному аналізі?
Відповідно до регресійного аналізу за прикладом , залишковим є різниця між реакцією та передбачуваним значенням, тоді говорять, що кожен залишок має різну дисперсію, тому нам потрібно враховувати стандартизовані залишки. Але дисперсія призначена для групи значень, як може мати одне значення дисперсія?

1
Як я можу довести, що дані експерименту слідують за розподілом важких хвостів?
У мене є кілька результатів тесту затримки відповіді сервера. Згідно з нашим теоретичним аналізом, розподіл затримки (Функція розподілу ймовірності затримки відповіді) повинен мати велику хвостову поведінку. Але як я міг довести, що результат тестування відповідає розподілу важких хвостів?

3
Як застосувати коефіцієнт коефіцієнта для факторів та інтерактивних доданків у лінійному рівнянні?
Використовуючи R, я встановив лінійну модель для однієї змінної відгуку з суміші безперервних та дискретних предикторів. Це є базовим, але я маю труднощі зрозуміти, як працює коефіцієнт для дискретного коефіцієнта. Поняття: Очевидно, що коефіцієнт неперервної змінної 'x' застосовується у формі, y = coefx(varx) + interceptале як це працює для коефіцієнта …

2
Що таке аналіз даних у Франції?
Деякі статистичні методи - я не пам’ятаю, чи це основний компонентний аналіз чи щось подібне - іноді називають «французьким аналізом даних». Що це саме? А деякі кажуть, що це ім’я іронічне, це правда, і чому?

2
Як виконати вибір змінної генетичного алгоритму в R для вхідних змінних SVM?
Я використовую пакет kernlab в R, щоб створити SVM для класифікації деяких даних. SVM добре працює в тому, що забезпечує «передбачення» пристойної точності, проте мій список змінних вхідних даних більший, ніж я хотів би, і я не впевнений у відносній важливості різних змінних. Я хотів би реалізувати генетичний алгоритм для …

4
Як співвідношення очікуваного значення з середнім, середнім і т. Д. В ненормальному розподілі?
Яким чином очікуване значення безперервної випадкової величини пов'язане з середньою арифметичною, медіаною тощо у ненормальному розподілі (наприклад, перекос-нормаль)? Мене цікавлять будь-які поширені / цікаві дистрибуції (наприклад, log-normal, прості бі / мультимодальні дистрибутиви, все інше дивне та чудове). Я здебільшого шукаю якісні відповіді, але будь-які кількісні чи формульні відповіді також вітаються. …

2
Перехресне співвідношення та взаємна інформація
Яка різниця між перехресною кореляцією та взаємною інформацією. Які проблеми можна вирішити за допомогою цих заходів та коли доцільно використовувати одну над іншою. Дякуємо за коментарі. Для уточнення, питання викликає зацікавленість в аналізі йомажу, а не аналізі часових рядів, хоча будь-яке просвітлення в цій області також буде оцінено

2
Як виконати тест рангового підпису Вілкоксона на дані про виживання в R?
Скажімо, у вас є такі дані про виживання: obs <- data.frame( time = c(floor(runif(100) * 30), floor((runif(100)^2) * 30)), status = c(rbinom(100, 1, 0.2), rbinom(100, 1, 0.7)), group = gl(2,100) ) Для виконання стандартного тесту з ранжуванням журналу можна використовувати survdiff(Surv(time, status) ~ group, data = obs, rho = 0) …

4
Стандартні алгоритми для здійснення ієрархічної лінійної регресії?
Чи існують стандартні алгоритми (на відміну від програм) для ієрархічної лінійної регресії? Люди зазвичай просто роблять MCMC чи є більш спеціалізовані, можливо частково закриті форми, алгоритми?

2
Видаліть дублікати з навчального набору для класифікації
Скажімо, у мене є ряд рядків для проблеми класифікації: Х1, . . .ХN, YХ1,...ХN,YX_1, ... X_N, Y Де Х1, . . . ,ХNХ1,...,ХNX_1, ..., X_N є ознаками / провісниками та YYY - клас, до якого належить поєднання функцій рядка. Багато комбінацій функцій та їх класи повторюються в наборі даних, який …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.