Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Випадковий ліс: що, якщо я знаю, що змінна важлива
Я розумію, що випадковий ліс вибирає випадковим чином mtry змінних для побудови кожного дерева рішень. Отже, якщо mtry = ncol / 3, то кожна змінна буде використовуватися в середньому на 1/3 дерев. І 2/3 дерев ними не користуватимуться. Але що робити, якщо я знаю, що одна змінна, ймовірно, дуже важлива, …

1
AIC для вкладених моделей: нормалізація константа
AIC визначається як , де - оцінювач максимальної ймовірності, а - розмірність простору параметрів. Для оцінки зазвичай нехтують постійним коефіцієнтом щільності. Це фактор, який не залежить від параметрів, щоб спростити ймовірність. З іншого боку, цей фактор є дуже важливим для розрахунку АПК, враховуючи, що при порівнянні невкладених моделей цей коефіцієнт …

6
Які алгоритми машинного навчання корисні для оцінки, які функції є більш важливими?
У мене є дані з мінімальною кількістю функцій, які не змінюються, і декілька додаткових функцій, які можуть змінюватися і мають великий вплив на результат. Мій набір даних виглядає приблизно так: Особливості: A, B, C (завжди присутній) та D, E, F, G, H (іноді присутній) A = 10, B = 10, …

6
Надійний (непараметричний) захід, наприклад, коефіцієнт варіації - IQR / медіана чи альтернатива?
Для заданого набору даних розкид часто обчислюється або як стандартне відхилення або як IQR (міжквартильний діапазон). Тоді як a standard deviationнормалізується (z-бали тощо) і тому може використовуватися для порівняння спредів між двома різними популяціями, це не стосується IQR, оскільки вибірки з двох різних сукупностей можуть мати значення у двох досить …

3
Чи існує версія зразка чи альтернатива тесту Колмогорова-Смірнова?
Я порівнюю розподіл дерев за розмірами на шість пар ділянок, де одна ділянка отримала обробку, а інша - контроль. Використовуючи тест Колмогорова-Смірнова на кожній парі ділянок, я знаходжу, що коливається від до . Чи існують відповідні методи спільної роботи з усіма репліками, наприклад, багатопробне розширення тесту KS, чи є відповідний …

2
Яка відстань між кінцевою гауссовою сумішшю і гауссовою?
Припустимо, у мене є суміш кінцево багатьох гасівців із відомими вагами, засобами та стандартними відхиленнями. Засоби не рівні. Середнє та стандартне відхилення суміші можна зрозуміти, звичайно, оскільки моменти є середньозваженими середніми моментами компонентів. Суміш не є нормальним розподілом, але наскільки це далеко від нормального? Наведене вище зображення показує щільність ймовірності …

4
Чи можна передбачувану ймовірність логістичної регресії трактувати як впевненість у класифікації
Чи можемо ми інтерпретувати задню ймовірність, отриману від класифікатора, який видає передбачуване значення класу та ймовірність (наприклад, логістична регресія або Naive Bayes), як якусь оцінку довіри, яка присвоюється цьому прогнозованому значенню класу?

3
STL у часових рядах із відсутніми значеннями для виявлення аномалії
Я намагаюсь виявити аномальні значення у часовій серії кліматичних даних з деякими відсутніми спостереженнями. Шукаючи в Інтернеті, я знайшов багато доступних підходів. З них, розкладання stl здається привабливим, у сенсі вилучення тренду та сезонних компонентів та вивчення решти. Читання STL: Процедура декомпозиції сезонного тренду, що базується на Лоссі , stlвидається …

2
Як оцінити третій квартал бінних даних?
Чи є якийсь технічний трюк для визначення третього кварталу, якщо він належить до відкритого інтервалу, який містить більше чверті населення (тому я не можу закрити інтервал і використовувати стандартну формулу)? Редагувати У випадку, якщо я щось неправильно зрозумів, я надам більш-менш повний контекст. У мене дані розташовані в таблиці з …

2
randomForest вибирає регресію замість класифікації
Я використовую пакет randomForest в R і використовую дані райдужки, випадковий ліс, що генерується, є класифікацією, але коли я використовую набір даних, що містить близько 700 функцій (функції мають кожен піксель у зображенні розміром 28x28 пікселів), і стовпець мітки називається label, randomForestгенерується регресія. Я використовую наступний рядок: rf <- randomForest(label …
12 r  random-forest 

3
Математична база для алгоритмів видобутку даних та штучного інтелекту
Не могли б ви дати мені уточнення щодо алгоритмів видобутку даних та штучного інтелекту? Яку базу математики вони використовували? Не могли б ви дати мені вихідну точку з математики для розуміння цих типів алгоритмів?

1
Чому власні та svd декомпозиції матриці коваріації на основі розріджених даних дають різні результати?
Я намагаюся розкласти коваріаційну матрицю, засновану на наборі даних з обмеженою / гаптованою формою. Я зауважую, що сума лямбда (пояснена дисперсія), розрахована з svd, посилюється все більш неохайними даними. Без прогалин, svdі eigenотримуйте однакові результати. Здається, це не відбувається при eigenрозкладанні. Я схилявся до використання, svdоскільки значення лямбда завжди позитивні, …
12 r  svd  eigenvalues 

1
Лінійна регресія з повторними заходами в R
Я не зміг зрозуміти, як виконати лінійну регресію в R для повторного проекту вимірювання. У попередньому запитанні (все ще без відповіді) мені було запропоновано не використовувати, lmа скоріше використовувати змішані моделі. Я використовував lmнаступним чином: lm.velocity_vs_Velocity_response <- lm(Velocity_response~Velocity*Subject, data=mydata) (більш детальну інформацію про набір даних можна знайти за посиланням вище) …

1
ієрархічні баєсові моделі проти емпіричних Баєса
Чи вважаєте ви, що HBM проти EB є двома альтернативами, в яких гіперпараметри "в грі" відбираються / оцінюються / тощо? Між цими двома чітко існує зв'язок. Чи вважаєте ви, що НВМ більше "повністю байєсівський", ніж ЕБ? Чи є якесь місце, де я можу побачити, які відмінності між "повністю байєсівською" та …

2
Позитивна кореляція і знак негативного регресора
Чи можливо отримати позитивну кореляцію між регресором та відповіддю ( +0,43), а після цього отримати від'ємний коефіцієнт у пристосованій регресійній моделі для цього регресора? Я не говорю про зміни в знаку регресора серед деяких моделей. Знак коефіцієнта завжди залишається. Чи можуть інші змінні примірної моделі впливати на зміну знака?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.