Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
RandomForest і вагові класи
Запитання в одному реченні: Хтось знає, як визначити хороші ваги класів для випадкового лісу? Пояснення: Я граю з незбалансованими наборами даних. Я хочу використовувати Rпакет randomForestдля того, щоб навчити модель на дуже перекошеному наборі даних з лише невеликими позитивними прикладами та багатьма негативними прикладами. Я знаю, є й інші методи, …
11 r  random-forest 

2
Чи слід повідомляти про незначні результати?
Я провів тест Крускала Уолліса, і для деяких питань значення р не має великого значення. Я б повідомив про це так само, як якщо б це було суттєво, зазначаючи df, статистику тесту та p-значення? Тож було б щось подібне до цього було проведено тест Крускала Уолліса, але виявлено, що результати …

2
Геометричне середнє - це неупереджений оцінювач середнього значення, який має постійний розподіл?
Чи існує якийсь безперервний розподіл, виражений у закритому вигляді, середнє значення якого таке, що геометричне середнє для зразків є неупередженим оцінником для цього середнього? Оновлення: я щойно зрозумів, що мої зразки повинні бути позитивними (інакше геометричне середнє може не існувати), тому, можливо, безперервне не є правильним словом. Як щодо розподілу, …

1
Як інтерпретувати результати, коли і гребінець, і ласо окремо працюють добре, але дають різні коефіцієнти
Я запускаю регресійну модель як з Лассо, так і з Ріджем (для прогнозу дискретної змінної результату в межах від 0 до 5). Перш ніж запустити модель, я використовую SelectKBestметод scikit-learnзменшення набору функцій з 250 до 25 . Без початкового вибору особливостей і Лассо, і Рідж поступаються нижчим показникам точності [що …

1
Варіативні умовиводи простою англійською мовою
Переглянувши відео на YouTube, я відчуваю, що я не можу реально визначити, що таке варіативні умовиводи. Я можу дотримуватися процедур під час перегляду відео-лекцій про це. Але важко визначити, що насправді є. Сподіваюсь почути про це.

2
Читання сюжетів із коробкою і вусами: чи можна помітити суттєві відмінності між групами?
Припустимо, ми дивимося на цей сюжет про бокси й вуса: Між четвергом і п’ятницею, я думаю, більшість погодиться, мабуть, є значна різниця у спаному часі. Це, однак, статистично достовірна думка? Чи можемо ми помітити суттєві відмінності через те, що жоден внутрішній квартальний діапазон не перетинається між четвергом та п’ятницею? А …

2
Представлення космічного простору ARMA (p, q) від Гамільтона
Я читав розділ 13 Гамільтона, і він має таке представлення простору стану для ARMA (p, q). Нехай Тоді процес ARMA (p, q) такий: \ початок {вирівняний} y_t - \ mu & = \ phi_1 (y_ {t-1} - \ mu) + \ phi_2 (y_ {t-2} - \ mu) + ... + …

2
Якщо усадка застосовується розумно, чи завжди це працює краще для більш ефективних оцінювачів?
Припустимо, у мене є два оцінювачі та які є послідовними оцінками того самого параметра і такими, що з в сенсі psd. Таким чином, асимптотика є більш ефективною, ніж . Ці два оцінювачі засновані на різних функціях втрат.βˆ1β^1\widehat{\beta}_1βˆ2β^2\widehat{\beta}_2β0β0\beta_0n−−√(βˆ1−β0)→dN(0,V1),n−−√(βˆ2−β0)→dN(0,V2)n(β^1−β0)→dN(0,V1),n(β^2−β0)→dN(0,V2)\sqrt{n}(\widehat{\beta}_1 -\beta_0) \stackrel{d}\rightarrow \mathcal{N}(0, V_1), \quad \sqrt{n}(\widehat{\beta}_2 -\beta_0) \stackrel{d}\rightarrow \mathcal{N}(0, V_2)V1≤V2V1≤V2V_1 \leq V_2βˆ1β^1\widehat{\beta}_1βˆ2β^2\widehat{\beta}_2 Тепер …

2
Якщо ви не можете зробити це ортогонально, зробіть це сирим (поліноміальна регресія)
Виконуючи поліноміальну регресію для на , люди іноді використовують неочищені многочлени, іноді ортогональні многочлени. Але коли вони використовують те, що здається абсолютно довільним.XYYYXXX Тут і тут використовуються сирі многочлени. Але тут і тут ортогональні многочлени, здається, дають правильні результати. Що, як, чому ?! На відміну від цього, коли ви дізнаєтесь …

1
Межі узагальнення на SVM
Мене цікавлять теоретичні результати щодо узагальнення здатності підтримуючих векторних машин, наприклад, межі щодо ймовірності помилки класифікації та розмірності Вапніка-Червоненкіса (ВК) цих машин. Однак, читаючи літературу, у мене склалося враження, що деякі подібні повторювані результати, як правило, незначно відрізняються від автора до автора, особливо щодо технічних умов, необхідних для певного виконання. …

6
Основні посилання на MCMC для Bayesian Statistics
Я шукаю статті чи книги з практичними та теоретичними прикладами про основні MCMC для Bayesian Statistics (With R). Я ніколи не займався симуляцією, і тому шукаю "базову" інформацію. Чи можете ви дати мені якісь рекомендації чи поради?

2
Контрольоване навчання з невизначеними даними?
Чи існує існуюча методологія застосування наглядової моделі навчання до непевного набору даних? Наприклад, скажімо, у нас є набір даних з класами A і B: +----------+----------+-------+-----------+ | FeatureA | FeatureB | Label | Certainty | +----------+----------+-------+-----------+ | 2 | 3 | A | 50% | | 3 | 1 | B …

1
Зворотна проблема з днем ​​народження: жодна пара з 1 мільйона прибульців не ділиться з днем ​​народження; яка їх тривалість року?
Припустимо планету з дуже дуже довгим днів. На вечірці в кімнаті 1 мільйон прибульців, і ніхто взагалі не ділиться на день народження. Що можна зробити про розмір ?NNNNNN (Це більш компактне питання замінює це погано сформульоване. )

1
Логістична регресія для даних розподілу Пуассона
З деяких записок машинного навчання, що розповідають про деякі дискримінаційні методи класифікації, зокрема логістичну регресію, де y - мітка класу (0 або 1), а x - дані, сказано, що: якщо , і x | y = 1 \ sim \ mathrm {Poisson} (λ_1) , то p (y | x) буде …

2
Що відбувається зі співвідношенням ймовірності, коли збирається все більше даних?
Нехай fff , гgg і годhh бути щільність і припустимо, що хi∼ годxi∼hx_i \sim h , i ∈ Ni∈Ni \in \mathbb{N} . Що відбувається зі співвідношенням ймовірності ∏i = 1нf( хi)г( хi)∏i=1nf(xi)g(xi) \prod_{i=1}^n \frac{f(x_i)}{g(x_i)} якn → ∞n→∞n \rightarrow \infty? (Чи сходяться вони? До чого?) Наприклад, ми можемо припустити h = …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.