Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Коли використовувати розподіл Стьюдента або Нормального в лінійній регресії?
Я дивлюся на деякі проблеми, а в деяких на тестування коефіцієнтів, іноді я бачу людей, які використовують розподіл Стьюдента, а іноді бачу нормальний розподіл. Яке правило?


4
Поліпшення класифікації SVM діабету
Я використовую SVM для прогнозу діабету. Для цього я використовую набір даних BRFSS . Набір даних має розміри і перекошений. Відсоток s у цільовій змінній становить тоді як s складають решта .432607 × 136432607×136432607 \times 136Y11 %11%11\%N89 %89%89\% Я використовую тільки 15з 136незалежних змінних з набору даних. Однією з причин …

3
Поріг для коефіцієнта кореляції для вказівки статистичної значущості кореляції у кореляційній матриці
Я обчислив кореляційну матрицю набору даних, що містить 455 точок даних, кожна точка даних містить 14 характеристик. Отже розмірність кореляційної матриці дорівнює 14 х 14. Мені було цікаво, чи існує поріг значення коефіцієнта кореляції, який вказує на наявність значної кореляції між двома цими характеристиками. Я маю значення від -0,2 до …

3
Поєднання двох часових рядів шляхом усереднення точок даних
Я хотів би поєднати прогнозовані та зворотні (тобто прогнозовані минулі значення) даних часового ряду, встановлені в один часовий ряд, мінімізуючи Помилку середнього квадратичного прогнозування. Скажімо, у мене є часові ряди 2001-2010 рр. З розривом на 2007 рік. Мені вдалося прогнозувати 2007 р., Використовуючи дані 2001-2007 рр. (Червона лінія - так …

6
Порівняйте R-квадрат у двох різних моделях Random Forest
Я використовую пакет randomForest в R, щоб розробити випадкову лісову модель, щоб спробувати пояснити безперервний результат у "широкому" наборі даних з більшою кількістю предикторів, ніж зразків. Зокрема, я підхоплюю одну модель РФ, яка дозволяє процедурі вибирати з набору змінних ~ 75 прогнозів, які я вважаю важливими. Я перевіряю, наскільки добре …

1
Чи існує поняття «достатньо» даних для навчання статистичних моделей?
Я працюю над досить великим статистичним моделюванням, наприклад, прихованими моделями Маркова та моделями суміші Гаусса. Я бачу, що для підготовки гарних моделей у кожному з цих випадків потрібен великий (> 20000 пропозицій для HMM) даних, які беруться з подібних середовищ, як остаточне використання. Моє запитання: Чи існує в літературі поняття …

2
Чи існує модель, яка відповідає статистиці (наприклад, AIC або BIC), яку можна використовувати для абсолютного замість просто порівняльного порівняння?
Я не такий знайомий з цією літературою, тож пробачте мене, якщо це очевидне питання. Оскільки AIC та BIC залежать від максимізації ймовірності, видається, що їх можна використовувати лише для порівняльного порівняння між набором моделей, що намагаються підходити до заданого набору даних. Наскільки я розумію, не було б сенсу обчислювати AIC …

5
Візуалізація 2-буквових комбінацій
Відповіді на це питання повернули набір приблизно 125 імен на одну букву: /programming/6979630/what-1-2-letter-object-names-conflict-with-existing -r-об’єкти [1] "Ad" "am" "ar" "as" "bc" "bd" "bp" "br" "BR" "bs" "by" "c" "C" [14] "cc" "cd" "ch" "ci" "CJ" "ck" "Cl" "cm" "cn" "cq" "cs" "Cs" "cv" [27] "d" "D" "dc" "dd" "de" "df" "dg" …

1
Як перетворити функцію в щільність ймовірності, зберігаючи форму функції?
У мене є ряд функцій, кожна з яких нібито представляє щільність випадкової величини між агентами. Кожна функція також має домен, який описує, які значення випадкової величини є дійсними. Тепер, якщо я правильно запам’ятав свої класи статистики, якщо я беру інтеграл однієї з функцій через значення, описані в домені функції, я …

1
Чи дозволено включати час як предиктор у змішані моделі?
Я завжди вважав, що час не повинен використовуватися як провісник у регресії (включаючи ігор), тому що тоді просто "описати" сам тренд. Якщо метою дослідження є знайти такі параметри навколишнього середовища, як температура тощо, які пояснюють різницю, скажімо так, активності тварини, то мені цікаво, яким чином час може бути корисний? як …

2
Порівняння наборів часових рядів
У мене є три набори даних часових рядів, які я хочу порівняти. Їх приймали на 3 окремих періоди приблизно 12 днів. Вони є середнім, максимальним та мінімальним числом головок, узятих у бібліотеці коледжу протягом фінальних тижнів. Мені довелося мати значення, max та min, оскільки погодинний підрахунок голови не був безперервним …

2
Умови М-оцінки, щоб перейти до справжньої середньої
Враховуючи iid-зразки з гауссового розподілу та M-оцінка, , які властивості на достатні, щоб гарантувати вірогідності? Є бути строго опуклою і строго зростає досить?μ m = argmin a ∑ ρ ( | X i - a | ) ρ μ m → μ ρX1,...,Xn∼N(μ,σ)X1,...,Xn∼N(μ,σ)X_1,...,X_n \sim N(\mu,\sigma) μm=argmina∑ρ(|Xi−a|)μm=argmina∑ρ(|Xi−a|)\mu_m = \underset{a}{\operatorname{argmin}} \sum\rho(|X_i-a|)ρρ\rhoμm→μμm→μ\mu_m \rightarrow …
10 estimation 

4
Виявлення в Інтернеті
Я хочу обробити автоматично сегментовані мікроскопічні зображення для виявлення несправних зображень та / або несправних сегментацій у складі високопропускної трубопровідної обробки зображень. Існує безліч параметрів, які можна обчислити для кожного неочищеного зображення та сегментації, і вони стають "крайніми", коли зображення несправне. Наприклад, бульбашка на зображенні призведе до таких аномалій, як …
10 outliers  online 

4
Чому демографи дають ставки на 100 000 людей?
Універсальним видається, що демографічна статистика надається у перерахунку на 100 000 населення на рік. Наприклад, рівень самогубств, рівень вбивств, рік життя з урахуванням інвалідності, цей список продовжується. Чому? Якщо ми говорили про хімію, часто на мільйон (проміле) часто. Чому акт підрахунку людей дивився принципово інакше. Чисельність 100 000 не має …
10 demography  units 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.