Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних


2
Чи потрібні випадкові ліси для введення змінних або масштабування вхідних змінних?
Мої вхідні змінні мають різні розміри. Деякі змінні десяткові, а деякі сотні. Чи важливо централізувати (віднімати середнє значення) або масштабувати (поділити на стандартне відхилення) ці вхідні змінні, щоб зробити дані безрозмірними при використанні випадкових лісів?

2
Матричне позначення для логістичної регресії
У лінійній регресії (квадратичні втрати), використовуючи матрицю, ми маємо дуже стисле позначення цілі minimize ∥Ax−b∥2minimize ‖Ax−b‖2\text{minimize}~~ \|Ax-b\|^2 Де - матриця даних, - коефіцієнти, а - відповідь.x bAAAxxxbbb Чи є подібні матричні позначення для цілі логістичної регресії? Усі помічені нами позначення не можуть позбутися суми за всіма точками даних (щось на …

1
Яке значення має кількість фільтрів згортки у згортковій мережі?
Що означає кількість фільтрів у шарі згортки? Як це число впливає на ефективність або якість архітектури? Я маю на увазі, чи слід завжди обирати більшу кількість фільтрів? що з них добре? і як люди призначають різну кількість фільтрів для різних шарів? Я маю на увазі перегляд цього питання: як визначити …

2
Яку міру помилки в навчанні повідомити про випадкові ліси?
Наразі я підганяю випадкові ліси для проблеми класифікації, використовуючи randomForestпакунок на R, і не знаю, як повідомити про помилку навчання для цих моделей. Моя помилка тренінгу близька до 0%, коли я обчислюю її за допомогою передбачень, які я отримую за допомогою команди: predict(model, data=X_train) де X_trainдані про навчання. Відповідаючи на …

2
Інтерпретація довірчого інтервалу
Примітка: заздалегідь вибачте, якщо це дублікат, я не знайшов подібного запитання у своєму пошуку Скажімо, у нас справжній параметр p. Довірчий інтервал C (X) - це RV, що містить p, скажімо, 95% часу. Тепер припустимо, що ми спостерігаємо X і обчислюємо C (X). Поширеною відповіддю здається, що неправильно трактувати це …

3
Як вибрати оптимальну кількість прихованих факторів при негативній матричній факторизації?
З огляду на матрицю Vm×nVm×n\mathbf V^{m \times n} , Негативна факторизація матриць (NMF) знаходить дві негативні матриці та (тобто з усіма елементами ) представити розкладену матрицю як:H k × n ≥0Wm×kWm×k\mathbf W^{m \times k}Hk×nHk×n\mathbf H^{k \times n}≥0≥0\ge 0 V≈WH,V≈WH,\mathbf V \approx \mathbf W\mathbf H, WW\mathbf WHH\mathbf H∥V−WH∥2.‖V−WH‖2.\|\mathbf V-\mathbf W\mathbf H\|^2. …

2
Які позначення і чому: , ,
Це просто стилістичні конвенції (курсив чи не курсив), чи існують істотні відмінності в значеннях цих позначень? Чи є інші позначення, що означають " ймовірність ", що слід враховувати в цьому питанні?

3
Коли можна говорити про колінеарність
У лінійних моделях нам потрібно перевірити, чи існує взаємозв'язок між пояснювальними змінними. Якщо вони співвідносяться занадто сильно, то виникає колінеарність (тобто змінні частково пояснюють одна одну). На даний момент я просто розглядаю парне співвідношення між кожною з пояснювальних змінних. Питання 1: Що класифікується як занадто велика кореляція? Наприклад, чи є …

3
Чому для вибору серед вкладених моделей var-covar потрібно використовувати REML (замість ML)?
Різні описи вибору моделі щодо випадкових ефектів лінійних змішаних моделей дають інструкцію використовувати REML. Я знаю різницю між REML та ML на якомусь рівні, але я не розумію, чому REML слід використовувати, оскільки ML є упередженою. Наприклад, чи неправильно проводити LRT за параметром дисперсії звичайної моделі розподілу за допомогою ML …

1
Як розрахувати чистоту?
Як аналізуємо кластер, як ми обчислюємо чистоту? Яке рівняння? Я не шукаю коду, щоб зробити це за мене. Нехай - кластер k, а - клас j.ωkωk\omega_kcjcjc_j Тож чистота практично точність? схоже, підсумовували кількість справді класифікованого класу за кластером за розміром вибірки. Джерело рівняння Питання в тому, яка взаємозв'язок між виходом …
16 clustering 


1
Мінімальна кількість балів за лінійну регресію
Яка була б "розумна" мінімальна кількість спостережень, щоб шукати тенденцію в часі з лінійною регресією? як щодо підгонки квадратичної моделі? Я працюю із складовими показниками нерівності в здоров’ї (SII, RII) і маю лише 4 хвилі обстеження, тобто 4 бали (1997,2001,2004,2008). Я не статистик, але в мене інтуїтивне враження 4 балів …
16 regression 

2
Які існують методи вибірки двох корельованих випадкових величин?
Назвіть деякі методи вибірки двох корельованих випадкових змінних: якщо їх параметри розподілу ймовірностей параметризовані (наприклад, log-normal) якщо вони мають непараметричні розподіли. Дані - це два часові ряди, для яких ми можемо обчислити ненульові коефіцієнти кореляції. Ми хочемо моделювати ці дані в майбутньому, вважаючи, що історична кореляція та часовий ряд CDF …

2
Як побудувати межу рішення в R для логістичної регресійної моделі?
Я зробив логістичну регресійну модель, використовуючи glm в R. У мене є дві незалежні змінні. Як я зможу побудувати межу рішення моєї моделі в діаграмі розкидання двох змінних. Наприклад, як можна побудувати фігуру на зразок: http://onlinecourses.science.psu.edu/stat557/node/55 Спасибі.
16 r  logistic 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.