Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Навіщо використовувати SVM, чому мені потрібно масштабувати функції?
Відповідно до документації об'єкта StandardScaler в scikit-learn: Наприклад, багато елементів, які використовуються в об'єктивній функції алгоритму навчання (наприклад, ядро ​​RBF в підтримці векторних машин або регуляризатори L1 і L2 лінійних моделей), припускають, що всі функції зосереджені навколо 0 і мають відмінність в одному порядку. Якщо функція має дисперсію, яка на …

1
Чому усунення відсталого виправдано при багаторазовій регресії?
Чи це не призводить до надмірної підгонки? Чи були б мої результати більш надійними, якби я додав процедуру підключення ножа або завантажувальну машину до складу аналізу?

1
Як використовувати anova для порівняння двох моделей?
Як слід зрозуміти anovaрезультат при порівнянні двох моделей? Приклад: Res.Df RSS Df Sum of Sq F Pr(>F) 1 9 54.032 2 7 4.632 2 49.4 37.329 0.0001844 *** На сторінці сторінки зазначено: "Обчислити аналіз дисперсійних (або відхильних) таблиць для одного або декількох пристосованих об'єктів моделі." Однак професор зазначив, що це …
9 r  regression  anova 

1
Повторне прискорення регресійних дерев (BRT), узагальнених моделей з підсиленням (GBM) та машини для підвищення градієнта (GBM)
Запитання: Яка різниця між деревами з посиленою регресією (BRT) та узагальненими прискореними моделями (GBM)? Чи можна їх взаємозамінно використовувати? Чи одна конкретна форма іншої? Чому Ріджвей використав фразу "Узагальнені прискорені регресійні моделі" (ГБМ), щоб описати те, що раніше Фрідман запропонував як "Градієнт-підсилювальна машина" (ГБМ)? Ці два абревіатури однакові, описують одне …

1
З огляду на два поглинаючі ланцюги Маркова, яка ймовірність того, що один припиниться перед іншим?
У мене є дві різні ланцюги Маркова, кожна з яких має один поглинаючий стан і відоме вихідне положення. Я хочу визначити ймовірність того, що ланцюг 1 досягне поглинаючого стану за менше кроків, ніж ланцюг 2. Я думаю, що я можу обчислити ймовірність досягнення поглинаючого стану у певній ланцюжку після n …

2
Зворотне тестування або перехресне підтвердження, коли процес побудови моделі був інтерактивним
У мене є кілька прогнозних моделей, продуктивність яких я хотів би зробити тест зворотним (тобто взяти мій набір даних, "перемотати" його до попереднього моменту часу і побачити, як модель могла б працювати в перспективі). Проблема полягає в тому, що деякі мої моделі були побудовані за допомогою інтерактивного процесу. Наприклад, слідуючи …

2
Оцінка помилки, що не входить у сумку, для підвищення?
У випадковому лісі кожне дерево вирощується паралельно на унікальній вибірці даних для завантаження. Оскільки, як очікується, кожен зразок завантаження може містити близько 63% унікальних спостережень, це залишає приблизно 37% спостережень, які можна використовувати для тестування дерева. Тепер, здається, що в Stohastic Gradient також існує аналогічна оцінці в РФ:О ОБe r …

2
Як знайти ваги для міри дисиміліарності
Я хочу дізнатися (вивести) ваги атрибутів для міри невідповідності, яку я можу використовувати для кластеризації. У мене є кілька прикладів пар об'єктів, які є "подібними" (повинні бути в одному кластері), а також деякі приклади пар об'єктів, які "не схожі" (не повинні бути в одному кластері). Кожен об’єкт має ряд атрибутів: …

1
Як знайти та оцінити оптимальну дискретизацію для безперервної змінної з
У мене є набір даних з безперервною змінною та бінарною змінною цілі (0 і 1). Мені потрібно дискретизувати постійні змінні (для логістичної регресії) стосовно цільової змінної та з обмеженням, що частота спостереження в кожному інтервалі повинна бути врівноваженою. Я спробував алгоритми машинного навчання, такі як Chi Merge, дерева рішень. Чи …

2
Чи фіксують дерева CART взаємодії між передбачувачами?
У цьому документі стверджується, що в CART, оскільки бінарний розкол виконується по одному коваріату на кожному кроці, всі розщеплення є ортогональними, тому взаємодії між коваріатами не враховуються. Однак багато дуже серйозних посилань стверджують, навпаки, що ієрархічна структура дерева гарантує, що взаємодія між предикторами буде автоматично змодельована (наприклад, цей документ , …

4
Точний тест Фішера на парних даних
Подано випадків раку легені та відповідних контрольних груп (без раку легенів) (відповідність за віком, статтю тощо). Щоб спробувати знайти докази між впливом куріння на рак легенів, я використав точний тест Фішера на таблиці непередбачених ситуацій. Це, однак, не враховувало, що органи управління та справи відповідали збігу. 404040404040 Тож я задумався, …

2
Як я можу використовувати ці дані для калібрування маркерів з різним рівнем щедрості при оцінці студентських робіт?
12 викладачів навчають 600 учнів. 12 когорт, яких викладали ці викладачі, становлять від 40 до 90 учнів, і ми очікуємо систематичних відмінностей між когортами, оскільки аспіранти були непропорційно розподілені до певних груп, а попередній досвід показав, що аспіранти в середньому на бал значно вищі, ніж студенти магістратури. Викладачі оцінили всі …

2
Лінійне поєднання двох випадкових ненормальних, що все ще є членом однієї сім'ї
Добре відомо, що лінійна комбінація двох випадкових нормальних змінних також є випадковою нормальною змінною. Чи є спільні ненормальні сім'ї розподілу (наприклад, Weibull), які також поділяють цю власність? Здається, існує багато зустрічних прикладів. Наприклад, лінійна комбінація уніформи зазвичай не є рівномірною. Зокрема, чи існують сім'ї ненормативного розподілу, у яких істинне наступне: …

2
Як представити використання кВт · год за роком проти середньої температури?
Просто заради задоволення, я хочу скласти графік споживання електроенергії щомісяця в році за рік. Однак я хочу включити деяку посилання на щомісячну температуру, щоб я міг визначити, чи покращується, погіршується чи погіршується мій дім чи погіршується стан споживання кВт / год. Дані, з якими я працюю: +----------+--------+-----------+----------------+----------+-----------+------------+ | Month | …

4
Очікувана кількість рулонів з кістки вимагає, щоб сума була більшою або дорівнює K?
Шестигранна штамповка згортається ітераційно. Яка очікувана кількість рулонів, необхідна для отримання суми, більшої або дорівнює K? Перед редагуванням P(Sum>=1 in exactly 1 roll)=1 P(Sum>=2 in exactly 1 roll)=5/6 P(Sum>=2 in exactly 2 rolls)=1/6 P(Sum>=3 in exactly 1 roll)=5/6 P(Sum>=3 in exactly 2 rolls)=2/6 P(Sum>=3 in exactly 3 rolls)=1/36 P(Sum>=4 in …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.