Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Як інтерпретувати коефіцієнти від бета-регресії?
У мене є деякі дані, які обмежені між 0 і 1. Я використав betaregпакет в R, щоб відповідати регресійній моделі з обмеженими даними як залежною змінною. Моє запитання: як я інтерпретую коефіцієнти від регресії?

1
Чи можна використовувати завантажувальну стрічку для заміни непараметричних тестів?
Я досить новачок у статистиці. Концепція завантажувальної програми мене бентежить. Я знаю, що для використання певних тестів, таких як t-тест, потрібна нормальність розподілу вибірки. У тих випадках, коли дані зазвичай не поширюються, запитуючи "завантажувальну передачу" в t-тестах у SPSS, це обходило б проблему ненормативності? Якщо так, чи базується t-статистика, яка …


5
Що саме будує статистичну модель?
Що саме будує статистичну модель? У ці дні, коли я подаю заявку на науково-дослідницькі роботи або на консультаційні роботи, часто з'являється термін "побудова моделі" або "моделювання". Термін звучить круто, але що саме вони мають на увазі? Як ви будуєте свою модель? Я роздивився прогностичне моделювання , яке включає k-nn та …
15 modeling 

5
Створення нормально розподілених випадкових чисел з матрицею коваріації, яка не є позитивно визначеною
Я оцінив зразок ковариационной матриці ССC зразка і отримати симетричну матрицю. З ССC , я хотів би створити ннn -мірного нормальний розподілений гп , але тому мені потрібно розкладання Холецкого ССC . Що робити, якщо ССC не є позитивним?

3
Чи може лемма Неймана-Пірсона застосувати до випадку, коли прості нульові та альтернативні не належать до одного сімейства розподілів?
Чи може лемма Неймана-Пірсона застосувати до випадку, коли проста нуль та проста альтернатива не належать до одного сімейства розподілів? З його доказів я не бачу, чому він не може. Наприклад, коли простий нуль є нормальним розподілом, а проста альтернатива - експоненціальним розподілом. Чи є тест коефіцієнта ймовірності хорошим способом перевірити …

1
Прогнозування часових рядів із щоденними даними: ARIMA з регресором
Я використовую щоденний часовий ряд даних про продажі, який містить приблизно 2 роки щоденних точок даних. На основі деяких онлайн-підручників / прикладів я намагався визначити сезонність даних. Здається, що існує щотижнева, щомісячна і, ймовірно, щорічна періодичність / сезонність. Наприклад, існують день оплати праці, особливо в перший день оплати місяця, який …

1
Продукт двох незалежних випадкових величин
У мене є зразок приблизно 1000 значень. Ці дані отримані з добутку двох незалежних випадкових величин ξ∗ ψξ∗ψ\xi \ast \psi . Перша випадкова величина має рівномірний розподіл ξ∼ U( 0 , 1 )ξ∼U(0,1)\xi \sim U(0,1) . Розподіл другої випадкової величини не відомий. Як я можу оцінити розподіл другої ( ψψ …

1
Чи можна перевести коефіцієнт небезпеки у співвідношення медіанів часу виживання?
В одному документі, що описує результати аналізу виживання, я прочитав твердження, з якого випливає, що коефіцієнт небезпеки (HR) можна перевести у співвідношення середнього часу виживання ( та ) за допомогою формули:M 2M1M1M_1M2M2M_2 HR=M1M2HR=M1M2HR = \frac{M_1}{M_2} Я впевнений, що це не вдається, коли не можна прийняти пропорційну модель небезпеки (оскільки нічого …
15 survival  hazard 

1
Різниця між тестом на рандомізацію та перестановковим тестом
У літературі терміни Рандомізація та Перестановка вживаються взаємозамінно. Багато авторів заявляють про "перестановку (також рандомізацію) тестів", або навпаки. У кращому випадку я вважаю, що різниця є тонкою, і вона полягає в їх припущеннях щодо даних та потенційних висновків, які можна зробити. Мені просто потрібно перевірити, чи моє розуміння правильне, чи …

3
Чому коригується R-квадрат менше, ніж R-квадрат, якщо відрегульований R-квадрат прогнозує модель краще?
Наскільки я розумію, пояснює, наскільки добре модель прогнозує спостереження. Налагоджений - це той, який враховує більше спостережень (або ступенів свободи). Отже, скоригований прогнозує модель краще? Тоді чому це менше ? Здається, часто повинно бути більше.R2R2R^2R2R2R^2R2R2R^2R2R2R^2

1
Які статистичні методи є архаїчними і їх слід опустити з підручників? [зачинено]
Наразі це запитання не підходить для нашого формату запитань. Ми очікуємо, що відповіді будуть підкріплені фактами, посиланнями або експертними знаннями, але це питання, ймовірно, вимагатиме дискусій, аргументів, опитувань чи розширеної дискусії. Якщо ви вважаєте, що це питання можна вдосконалити та, можливо, знову відкрити, відвідайте довідковий центр для ознайомлення . Закрито …

2
Канонічний кореляційний аналіз із ранговою кореляцією
Канонічний кореляційний аналіз (CCA) має на меті максимізувати звичайну кореляцію Пірсона між продуктом і моментом (тобто коефіцієнт лінійної кореляції) лінійних комбінацій двох наборів даних. Тепер розглянемо той факт , що цей коефіцієнт кореляції тільки вимірює лінійні асоціацій - це причина того, чому ми використовуємо, наприклад, Spearman- ρρ\rho або Кендал з'єднання …

3
Модель Кокса проти логістичної регресії
Скажімо, нам задається наступна проблема: Прогнозуйте, які клієнти, швидше за все, припинять купувати в нашому магазині протягом наступних 3 місяців. Для кожного клієнта ми знаємо місяць, коли його почали купувати в нашому магазині, а також ми маємо багато поведінкових особливостей у щомісячних агрегатах. "Старший" клієнт купує вже п'ятдесят місяців; позначимо …

1
Як ggplot обчислює довірчі інтервали для регресії?
Пакет R-графіки ggplot2 має дивовижну функцію під назвою stat_smooth для побудови лінії регресії (або кривої) з пов'язаною смугою довіри. Однак мені важко зрозуміти, як саме формується ця смуга довіри для кожного періоду регресії (або "методу"). Як я можу знайти цю інформацію?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.