Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Оцінка чисельності популяції за частотою вибіркових дублікатів та унікальних даних
Є веб-служба, де я можу запитати інформацію про випадковий предмет. Для кожного запиту кожен товар має рівний шанс повернути його. Я можу продовжувати запитувати предмети та записувати кількість дублікатів та унікальних. Як я можу використовувати ці дані для оцінки загальної кількості позицій?

1
Виведення загальної (в межах класу + між класом) матриці розсіювання
Я спішився з методами PCA та LDA, і я застряг у певній точці, у мене таке відчуття, що це так просто, що я не бачу цього. Матриці розсіювання в межах класу ( ) та між класом ( S B ) визначаються як:SWSWS_WSБSBS_B SW= ∑i = 1С∑t = 1N( хiт- мкi) …


3
Яка різниця між використанням aov () та lme () при аналізі поздовжнього набору даних?
Чи може хто-небудь сказати мені різницю між використанням aov()та lme()аналізом поздовжніх даних та як інтерпретувати результати цих двох методів? Нижче я аналізую той же набір даних , використовуючи aov()і lme()та отримав 2 різні результати. З aov(), я отримав вагомий результат за час взаємодії з лікуванням, але, якщо підходити до лінійної …

2
Модель оцінки щільності населення
База даних (населення, площа, форма) може бути використана для відображення щільності населення шляхом призначення постійної величини населення / площі для кожної форми (що є полігоном, таким як блок перепису, урочище, округ, штат тощо). Однак населення, як правило, не розподілено рівномірно у межах своїх полігонів. Дасиметричне відображення - це процес уточнення …

2
Поясніть коригування моделі простою англійською мовою
Читаючи про методи та результати статистичного аналізу, особливо в епідеміології, я дуже часто чую про коригування або контроль моделей. Як би ви пояснили нестатистці мету цього? Як ви інтерпретуєте результати після контролю певної змінної? Невелике проходження в Stata або R або вказівник на один Інтернет - справжня дорогоцінний камінь.

1
Як визначити розмір вибірки, необхідний для повторного вимірювання ANOVA?
Мені потрібна допомога щодо повторного вимірювання ANOVA. Ми досліджуємо вплив деяких втручань на зниження частоти зараження кровотоком (BSI) в деяких палатах. Ми плануємо фіксувати інформацію про рівень BSI щомісяця, спочатку 12 місяців без втручання, потім 12 місяців з інтервенцією. Ми думаємо провести або часовий ряд, або повторне вимірювання ANOVA, я …


1
Як ентропія залежить від місця розташування та масштабу?
Ентропії безперервного розподілу з функцією щільності визначається як негативне в очікуванні і , отже , дорівнюєffflog(f),log⁡(f),\log(f), Hf=−∫∞−∞log(f(x))f(x)dx.Hf=−∫−∞∞log⁡(f(x))f(x)dx.H_f = -\int_{-\infty}^{\infty} \log(f(x)) f(x)\mathrm{d}x. Ми також говоримо, що будь-яка випадкова величина , розподіл якої має щільність має ентропію (Цей інтеграл добре визначений, навіть якщо має нулі, тому що може бути прийнято рівним нулю …

5
Випадковий алгоритм лісу та дерева рішень
Випадковий ліс - це сукупність дерев рішень, що дотримуються концепції сміття. Коли ми переходимо від одного дерева рішень до наступного дерева рішень, то як інформація, отримана за останнім деревом рішення, рухається вперед до наступного? Тому що, наскільки я розумію, немає нічого подібного до навченої моделі, яка створюється для кожного дерева …

3
Де бомба: як оцінити ймовірність за даними підсумків рядків і стовпців?
Це питання натхнене міні-грою від Pokemon Soulsilver: Уявіть, що на цій 5х6 області приховано 15 бомб (EDIT: максимум 1 бомба / осередок): Тепер, як би ви оцінили ймовірність знайти бомбу на певному полі, враховуючи підсумки рядка / стовпця? Якщо ви подивитеся на колонку 5 (загальна кількість бомб = 5), то …

1
Чи існує байєсівська інтерпретація для REML?
Чи доступна байєсівська інтерпретація REML? На мою інтуїцію, REML має велику схожість з так званими емпіричними процедурами оцінки Байєса , і мені цікаво, чи не було продемонстровано якесь асимптотичне еквівалентність (під якийсь відповідний клас пріорів). І емпіричний Байєс, і REML здаються "компрометованими" підходами до оцінки, наприклад, в умовах неприємних параметрів …

3
Як я можу прилаштувати сплайн до даних, що містять значення та 1/2 похідні?
У мене є набір даних, який містить, скажімо, деякі вимірювання положення, швидкості та прискорення. Усі походять із одного і того ж «бігу». Я міг би побудувати лінійну систему і помістити поліном на всі ці вимірювання. Але чи можу я те ж саме зробити зі сплайнами? Який "R" спосіб зробити це? …

1
Чому нас не хвилює, якщо процес MA не є зворотним?
У мене виникають труднощі з розумінням того, чому нас хвилює, чи є процес МА перевернутим чи ні. Будь ласка, виправте мене, якщо я помиляюся, але я можу зрозуміти, чому нас хвилює, чи причиною є процес AR, тобто якщо ми можемо "переписати його", так би мовити, як сума якогось параметра і …

3
Статистична значимість (p-значення) для порівняння двох класифікаторів щодо (середнього) ROC AUC, чутливості та специфічності
У мене є тестовий набір із 100 випадків та два класифікатори. Я генерував прогнози та обчислював RUC AUC, чутливість та специфічність для обох класифікаторів. Питання 1: Як я можу обчислити p-значення, щоб перевірити, чи є одна значно краща за іншу стосовно всіх балів (ROC AUC, чутливість, специфічність)? Тепер для одного …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.