Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Бета-версія розподілу в Scipy
Згідно з Вікіпедією, бета-розподіл ймовірностей має два параметри форми: і β .αα\alphaββ\beta Коли я дзвоню scipy.stats.beta.fit(x)в Python, де xзнаходиться купа чисел у діапазоні , повертаються 4 значення. Це вражає мене дивним.[0,1][0,1][0,1] Після googling я знайшов, що одне з повернених значень має бути "location", оскільки третя змінна - 0, якщо я …

4
Якими є тематичні дослідження в дослідженнях політики охорони здоров’я, коли ненадійні / збентежені / недійсні дослідження чи моделі були неправомірно використані?
Я готую огляд літератури щодо актуального питання охорони здоров’я, де дані заплутані: Які загальні історичні приклади, які використовуються в освіті з питань охорони здоров'я / епідеміології, коли неправомірні або заплутані стосунки чи умовиводи були навмисно чи помилково використані в політиці та законодавстві про охорону здоров'я? Автомобільний сплеск фатальності 1960-х років …

2
Як можна згрупувати числові дані в природно утворюючі «дужки»? (наприклад, дохід)
Далі описано те, що я намагаюся досягти, але можливо, альтернативне вирішення проблеми може описати мою мету: я хочу поділіть наступні числа на групи, де дисперсії чисел у кожній групі не надто великі, а відмінності між середніми групами не надто малі порівняйте отриманий розподіл зрештою з «ідеальними» та побачите, наскільки він …

1
Справа з відсутніми даними в експоненціальній моделі згладжування
Здається, не існує стандартного способу поводження з відсутніми даними в контексті експоненціального згладжування сімейства моделей. Зокрема, реалізація R, що називається ets в пакеті прогнозу, здається, просто займає найдовшу послідовність без пропущених даних, а книга "Прогнозування з експоненціальним згладжуванням" Hyndman et al. схоже, зовсім не говорить про відсутні дані. Я хотів …

1
Нелінійна регресія змішаних ефектів в R
Дивно, але мені не вдалося знайти відповідь на таке запитання за допомогою Google: У мене є деякі біологічні дані від кількох людей, які показують приблизно сигмоподібну поведінку росту в часі. Таким чином, я хочу моделювати його за допомогою стандартного логістичного зростання P(t) = k*p0*exp(r*t) / (k+p0*(exp(r*t)-1)) при цьому p0 є …

1
Чи мінімізований неупереджений оцінювач мінімізує середнє абсолютне відхилення?
Це подальше, але також інше питання мого попереднього . Я читав у Вікіпедії, що " Осередник-неупереджений оцінка мінімізує ризик щодо функції втрат абсолютного відхилення, як спостерігав Лаплас ". Однак мої результати моделювання в Монте-Карло не підтверджують цей аргумент. Я припускаю , що зразок з логнормального населення, , де µ і …

4
Практичний приклад для MCMC
Я переглядав деякі лекції, пов'язані з MCMC. Однак я не знаходжу хорошого прикладу того, як це використовується. Хтось може дати мені конкретний приклад. Я бачу лише те, що вони керують ланцюгом Маркова і кажуть, що його стаціонарний розподіл - це бажаний розподіл. Я хочу хороший приклад, коли бажаного розподілу важко …

3
Утворіть пари випадкових чисел, рівномірно розподілених і співвіднесених
Я хотів би генерувати пари випадкових чисел з певною кореляцією. Однак звичайний підхід використання лінійної комбінації двох нормальних змінних тут недійсний, оскільки лінійна комбінація рівномірних змінних вже не є рівномірно розподіленою змінною. Мені потрібні дві змінні, щоб вони були рівномірними. Будь-яка ідея про те, як генерувати пари однорідних змінних із …

2
Оптимізація: корінь всього зла в статистиці?
Я чув таке вираз раніше: "Оптимізація - корінь усього зла в статистиці". Наприклад, головна відповідь у цій темі робить це твердження з посиланням на небезпеку занадто агресивної оптимізації під час вибору моделі. Перше моє запитання наступне: Чи цитата може бути приписана комусь зокрема? (наприклад, у статистичній літературі) Як я розумію, …

1
Це прийнятний спосіб аналізу моделей змішаного ефекту з lme4 в R?
У мене є незбалансований набір даних повторних заходів для аналізу, і я читав, що спосіб більшості статистичних пакетів обробляє це за допомогою ANOVA (тобто сума третього типу) неправильна. Тому я хотів би використовувати модель змішаних ефектів для аналізу цих даних. Я багато читав про змішані моделі R, але я все …

4
Висновок для скептичного (але не проти математичного) читача
Я щойно переглянув лекцію про статистичний висновок ("порівняння пропорцій та засобів"), частину вступу до статистики онлайн-курсу. Матеріал мав менший сенс для мене, як це завжди (до цього часу я, мабуть, бачив цей матеріал десятки разів, розповсюджений протягом останніх трьох десятиліть). Я шукаю книгу "Основні статистики-101" (оцінка балів, оцінка оцінки, статистичний …

2
Зв'язок між тестом Макнемара та умовною логістичною регресією
Мене цікавить моделювання даних бінарних відповідей у ​​парних спостереженнях. Ми прагнемо зробити висновок про ефективність попереднього втручання в групі, потенційно коригуючи кілька коваріатів та визначивши, чи є модифікація ефекту групою, яка отримала особливо різну підготовку в рамках втручання. Дані даних такої форми: id phase resp 1 pre 1 1 post …

5
Метод генерації корельованих ненормальних даних
Мені цікаво дізнатись спосіб генерації корельованих, ненормальних даних. Тому в ідеалі якийсь розподіл, який приймає коваріаційну (або кореляційну) матрицю як параметр і генерує дані, які її наближають. Але ось ось у чому: метод, який я намагаюся знайти, повинен мати гнучкість також контролювати його багатоваріантність косості та / або куртозу. Мені …

2
Чи поступова регресія забезпечує упереджену оцінку r-квадрата населення?
У психології та інших сферах часто застосовується форма ступінчастої регресії, яка передбачає наступне: Подивіться на провідники, що залишилися (спочатку їх у моделі немає) та визначте предиктор, що призводить до найбільшої зміни r-квадрата; Якщо p-значення зміни r-квадрата менше альфа (зазвичай .05), тоді включіть цей предиктор і поверніться до кроку 1, інакше …

6
Як розділити набір даних, щоб зробити 10-кратну перехресну перевірку
Заблокований . Це запитання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Тепер у мене є Rкадр даних (навчання), хтось може мені сказати, як довільно розділити цей набір даних, щоб зробити 10-кратну перехресну перевірку?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.