Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Чи регресія x на y в цьому випадку явно краща, ніж y на x?
Прилад, який використовується для вимірювання рівня глюкози в крові людини, відстежується на випадковій вибірці з 10 осіб. Рівні вимірюються також за допомогою дуже точної лабораторної процедури. Міра приладу позначається x. Міра лабораторних процедур позначається y. Я особисто вважаю, що y на x є більш правильним, оскільки намір полягає у використанні …

1
Чому статистики не використовують взаємну інформацію як міру асоціації?
Я бачив пару переговорів нестатистів, де, здається, винаходити кореляційні заходи, використовуючи взаємну інформацію, а не регресію (або еквівалентні / тісно пов'язані статистичні тести). Я вважаю, що є вагомі причини, що статистики не застосовують такого підходу. Я розумію, що оцінювачі ентропії / взаємної інформації, як правило, є проблематичними та нестабільними. Я …

3
Плутанина, пов’язана з еластичною сіткою
Я читав цю статтю, пов’язану з еластичною сіткою. Вони кажуть, що вони використовують еластичну сітку, тому що якщо ми просто використовуємо Лассо, вона, як правило, вибирає лише один предиктор серед сильних кореляторів. Але чи не це ми хочемо? Я маю на увазі, що це рятує нас від неприємностей мультиколінеарності, чи …

3
Взважена узагальнена регресія в BUGS, JAGS
В Rми можемо «до» ваги в glmрегресії через вагу параметр. Наприклад: glm.D93 <- glm(counts ~ outcome + treatment, family = poisson(), weights=w) Як це можна досягти в JAGSабоBUGS моделі моделі? Я знайшов якийсь документ, який обговорював це, але жоден з них не дає прикладу. Мене цікавлять переважно приклади Пуассона та …

2
Чому важко включити невизначеність у випадкові ефекти, роблячи прогнози зі змішаних моделей?
На R-sig-ME є кілька ниток про отримання довірчих інтервалів для прогнозування з використанням lme4та nlmeв Р. Наприклад, тут і тут у 2010 році, включаючи деякі коментарі Дугласа Бейтса, одного з авторів обох пакетів. Я вагаюся, щоб його цитувати дослівно, боюсь, щоб їх не вивели з контексту, але все одно, один …

2
Дослідження матриці розсіювання графіків для багатьох змінних
Я аналізую набір даних з багатьма параметрами (скажімо, 50-200) і мені цікаво розглянути співвідношення між змінними (наприклад, з точки зору 2-змінних графіків розсіювання або 2-х гістограм). Однак для такої кількості параметрів видається нездійсненним намалювати масив ділянок розміром 200x200 (якщо тільки я не надрукую його і не повішу на стіну). З …

3
Чи повинен вибір функції проводитися лише на даних про навчання (або на всіх даних)?
Чи повинен підбір функції проводитись лише на даних про навчання (або всіх даних)? Я пройшов деякі дискусії та документи, такі як Гайон (2003) та Сінгхі та Лю (2006) , але все ще не впевнений у правильній відповіді. Моя установка експерименту така: Набір даних: 50 здорових груп контролю та 50 пацієнтів …

4
Зближення ваг нейронної мережі
Я потрапив у ситуацію, коли ваги моєї Нейронної мережі не збігаються навіть після 500 ітерацій. Моя нейронна мережа містить 1 вхідний шар, 1 прихований шар та 1 вихідний шар. Вони містять близько 230 вузлів у вхідному шарі, 9 вузлів у прихованому шарі та 1 вихідний вузол у вихідному шарі. Мені …

2
Додавання випадкових ефектів впливає на оцінки коефіцієнта
Мене завжди вчили, що випадкові ефекти впливають лише на дисперсію (помилку), а фіксовані ефекти впливають лише на середню. Але я знайшов приклад, коли випадкові ефекти впливають також на середнє значення - оцінку коефіцієнта: require(nlme) set.seed(128) n <- 100 k <- 5 cat <- as.factor(rep(1:k, each = n)) cat_i <- 1:k …

1
Порівняння розподілів продуктивності узагальнення
Скажіть, що у мене є два методи навчання проблеми класифікації , і , і я оцінюю їх узагальнюючу ефективність чимось на зразок повторної перехресної перевірки або завантаження. З цього процесу я отримую розподіл балів та для кожного методу через ці повтори (наприклад, розподіл значень AUC ROC для кожної моделі).Б П …

3
Чи зменшення розмірів завжди втрачає деяку інформацію?
Як говорить заголовок, чи зменшення розмірності завжди втрачає деяку інформацію? Розглянемо для прикладу PCA. Якщо дані, які я маю, дуже рідкісні, я б припустив, що «краще кодування» вдасться знайти (це якимось чином пов'язане з рангом даних?), І нічого не буде втрачено.

1
коригування значення p для статистики I Лорану (LISA)
Я працюю з дослідницьким просторовим аналізом в R за допомогою пакету spdep. Я натрапив на варіант коригування p- значень локальних показників просторової асоціації (LISA), обчислених за допомогою localmoranфункції. Відповідно до документів він спрямований на: ... коригування значення ймовірності для декількох тестів. Далі в документах p.adjustSPпрочитав, що доступні варіанти: Методи коригування …

1
Що робить нерівність Гоффдінга важливою статистичною концепцією?
У своєму блозі Ларрі Вассерман розмістив пост про те, що він планував висвітлити у ході минулої осені. Він зазначає, що відмовився від деяких класичних тем на користь більш сучасних питань. Однією з тем, яку він згадує, є нерівність Гоффдінга. Що робить цей результат особливо важливим для студентів та практиків?

1
Дослідження стійкості логістичного регресу проти порушення лінійності logit
Я веду логістичну регресію з бінарним результатом (початок і не запуск). Моя сукупність предикторів - це або безперервні, або дихотомічні змінні. Використовуючи підхід Box-Tidwell, один із моїх постійних прогнозів потенційно порушує припущення про лінійність logit. Немає вказівки зі статистики про пристосованість, яка підходить, є проблематичною. Згодом я знову запустив регресійну …

3
Які статистичні причини визначають індекс ІМТ як вага / зріст ?
Можливо, це питання має відповідь у медицині, але чи є якісь статистичні причини, чому індекс ІМТ обчислюється як ? Чому б, наприклад, не просто ? Моя перша ідея полягає в тому, що це має щось спільне з квадратичною регресією. вага / зріствага / зріст2вага/висота2\text{weight}/\text{height}^2вага / зріствага/висота\text{weight}/\text{height} Зразок реальних даних (200 …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.