Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Причини нормального поширення даних
Які деякі теореми можуть пояснити (тобто генеративно) чому можна очікувати нормального поширення реальних даних? Я знаю два: Центральна гранична теорема (звичайно), яка говорить нам, що сума декількох незалежних випадкових величин із середнім значенням та дисперсією (навіть коли вони не однаково розподілені) має тенденцію до нормального розподілу Нехай X і Y …

2
Як вибрати структуру випадкових та фіксованих ефектів у лінійних змішаних моделях?
Розглянемо наступні дані з двостороннього проектування предметів: df <- "http://personality-project.org/r/datasets/R.appendix4.data" df <- read.table(df,header=T) head(df) Observation Subject Task Valence Recall 1 1 Jim Free Neg 8 2 2 Jim Free Neu 9 3 3 Jim Free Pos 5 4 4 Jim Cued Neg 7 5 5 Jim Cued Neu 9 6 …

2
Як інтерпретувати PCA за даними часових рядів?
Я намагаюся зрозуміти використання PCA в останній статті журналу під назвою "Зображення мозкової активності в масштабі з кластерними обчисленнями" Freeman et al., 2014 (безкоштовний pdf доступний на веб-сайті лабораторії ). Вони використовують PCA за даними часових рядів і використовують ваги PCA для створення карти мозку. Дані - це дані середнього …

4
Чи означає, що середня = медіана означає, що унімодальний розподіл симетричний?
Для унімодального розподілу, якщо середнє = медіана, то чи достатньо сказати, що розподіл симетричний? Вікіпедія говорить про співвідношення між середнім та середнім: "Якщо розподіл симетричний, то середнє значення дорівнює медіані, і розподіл матиме нульовий нахил. Якщо, крім того, розподіл є немодальним, то середнє = медіана = режим. Це стосується кидання …

4
Може означати плюс одне стандартне відхилення перевищити максимальне значення?
Я маю середнє значення 74,10 та стандартне відхилення 33,44 для вибірки, яка має мінімум 0 та максимум 94,33. Професор запитує мене, як може означати, що плюс одне стандартне відхилення перевищує максимум. Я показав їй багато прикладів з цього приводу, але вона не розуміє. Мені потрібна деяка довідка, щоб показати її. …

4
Які саме моменти? Як вони отримані?
Ми, як правило, знайомимося з методом оцінювачів моментів, "прирівнюючи моменти населення до їх вибіркового аналога", поки ми не оцінимо всі параметри сукупності; так що у випадку нормального розподілу нам знадобляться лише перший та другий моменти, оскільки вони повністю описують цей розподіл. Е( X) = μ⟹∑нi = 1Хi/ n= X¯Е(Х)=мк⟹∑i=1нХi/н=Х¯E(X) = …

2
Узагальнені моделі добавок - хто займається дослідженнями, крім Саймона Вуда?
Я все більше і більше використовую GAM. Коли я збираюся надати посилання на різні їх компоненти (вибір параметрів згладжування, різні основи сплайну, p-значення гладких термінів), вони все від одного дослідника - Саймона Вуда, в університеті Бат, Англія. Він також є обслуговувачем компанії mgcvR, яка здійснює свою роботу. mgcvнадзвичайно складний, але …

2
Що означає назва "Логістична регресія"?
Я перевіряю реалізацію логістичної регресії звідси . Після того, як я прочитав цю статтю, здається, що важливою частиною є пошук найкращих коефіцієнтів для визначення сигмоподібної функції. Тож мені просто цікаво, чому цей метод називається "Логістична регресія". Це пов’язано з логарифмічною функцією? Можливо, мені потрібна інформація про історичну інформацію, щоб краще …


4
Добрий приклад даних, необхідний при коваріаті, ураженому лікуванням
Я переглянув безліч наборів даних R, публікацій в DASL та інших місцях, і не знаходжу дуже багато хороших прикладів цікавих наборів даних, що ілюструють аналіз коваріації експериментальних даних. У підручниках зі статистикою є численні набори "іграшкових" даних із надуманими даними. Я хотів би мати приклад, де: Дані справжні, з цікавою …

2
Обчислення стандартної помилки після log-перетворення
Розглянемо випадковий набір чисел, які зазвичай розподіляються: x <- rnorm(n=1000, mean=10) Ми хотіли б знати середню та стандартну помилки середньої величини, тому робимо наступне: se <- function(x) { sd(x)/sqrt(length(x)) } mean(x) # something near 10.0 units se(x) # something near 0.03 units Чудово! Однак припустимо, що ми не обов'язково знаємо, …

1
Як я можу "ухилитися" від позиції geom_point у ggplot2?
Заблокований . Це питання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Я використовую ggplot2 в R, щоб зробити такі сюжети: Панелі помилок перетинаються між собою, які виглядають справді безладними. Як можна розділити смуги помилок для різних індексів? …

1
Не нормалізація даних до PCA дає краще пояснене співвідношення дисперсії
Я нормалізував мій набір даних, потім запустив 3-х компонентний PCA, щоб отримати невеликі пояснені коефіцієнти дисперсії ([0,50, 0,1, 0,05]). Коли я не нормалізував, а побілив мій набір даних, то побіг 3-компонентний PCA, я отримав високі пояснені коефіцієнти дисперсії ([0.86, 0.06,0.01]). Оскільки я хочу зберегти якомога більше даних у 3-х компонентах, …
19 pca 

2
Як застосувати теорему Байєса до пошуку рибалки, загубленого в морі
Стаття «Коефіцієнти, які постійно оновлюються» згадується історія рибалки на Лонг-Айленді, який буквально завдячує своїм життям Байєсовій статистиці. Ось коротка версія: На човні посеред ночі стоять два рибалки. Поки один спить, інший падає в океан. Човен продовжує тролею на автопілоті всю ніч, поки перший хлопець нарешті не прокинеться і не сповістить …

2
Чи має значення зважений
Я оцінив надійну лінійну модель у Rвазі MM, використовуючи rlm()пакет MASS. `R`` не дає значення моделі для моделі, але я хотів би мати його, якщо це значуща кількість. Мені також цікаво дізнатися, чи є сенс мати значення R 2, яке зважує загальну та залишкову дисперсію так само, як спостереження зважувались …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.