Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Вивчення статистичних понять за допомогою вправ щодо аналізу даних
Я вважаю, що прості вправи з аналізу даних часто можуть допомогти проілюструвати та уточнити статистичні поняття. Які вправи для аналізу даних ви використовуєте для навчання статистичних понять?
18 teaching 

5
R пакет для багаторівневого моделювання структурних рівнянь?
Я хочу перевірити багатоступеневу модель шляху (наприклад, A прогнозує B, B прогнозує C, C прогнозує D), де всі мої змінні є індивідуальними спостереженнями, вкладеними в групи. Поки що я робив це через багаторазовий унікальний багаторівневий аналіз у Р. Я вважаю за краще використовувати таку методику, як SEM, яка дозволяє мені …

1
Бонферроні або Тукі? Коли кількість порівнянь стає великою?
Статистика виявлення поля читання за допомогою SPSS (3-е видання) мене трохи вразили пост-спеціальні тести в ANOVA. Тим, хто хоче контролювати рівень помилок типу I, він пропонує Бонферроні або Тукі і каже (стор. 374): Bonferroni має більше потужності, коли кількість порівнянь невелика, тоді як Tukey є більш потужним при тестуванні великої …

1
Побудова іскрових ліній в R
Заблокований . Це питання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Я хотів би використати R, щоб побудувати щось подібне: Здавалося б, можливо, але дуже складно слідкувати за координатами, шириною, висотою тощо. Чи є спосіб це зробити …

3
Ресурси для користувача R, який повинен вивчити SAS
Я використовую Р. щодня. Я думаю, що з точки зору data.frames, сімейство функцій apply (), об'єктно-орієнтоване програмування, векторизація та ggplot2 geoms / естетика. Я тільки почав працювати в організації, яка в першу чергу використовує SAS. Я знаю, що є книга про вивчення R для користувачів SAS , але які хороші …
18 r  sas 

4
Визначення найкращої функції підгонки кривої з лінійних, експоненціальних та логарифмічних функцій
Контекст: З питання про обмін стеком з математики (чи можу я створити програму) , хтось має набір точок , і хоче приєднати до нього криву, лінійну, експоненціальну чи логарифмічну. Звичайний метод полягає в тому, щоб почати з вибору одного з них (який визначає модель), а потім зробити статистичні розрахунки.x−yx−yx-y Але …

4
Зміна нульової гіпотези в лінійній регресії
У мене є деякі дані, які дуже корелюються. Якщо я запускаю лінійну регресію, я отримую лінію регресії з нахилом, близьким до одиниці (= 0,93). Я хотів би зробити тест, якщо цей нахил значно відрізняється від 1,0. Моє сподівання - це не так. Іншими словами, я хотів би змінити нульову гіпотезу …

8
Об'єднані пакети для R
Заблокований . Це питання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Не могли б ви порекомендувати простий у використанні або комплексний пакет сумісного аналізу для R?

2
Настанови щодо забезпечення якості та контролю якості (QA / QC) для бази даних
Фон Я контролюю введення даних з первинної літератури в базу даних . Процес введення даних схильний до помилок, особливо тому, що користувачі повинні інтерпретувати експериментальний дизайн, витягувати дані з графіки та таблиць та трансформувати результати в стандартизовані одиниці. Дані вводяться в базу даних MySQL через веб-інтерфейс. Поки що було включено …


3
Отримання формули меж прогнозування у лінійній моделі (тобто: інтервали прогнозування)
Візьмемо такий приклад: set.seed(342) x1 <- runif(100) x2 <- runif(100) y <- x1+x2 + 2*x1*x2 + rnorm(100) fit <- lm(y~x1*x2) Це створює модель y на основі x1 та x2, використовуючи регресію OLS. Якщо ми хочемо передбачити y для даного x_vec, ми можемо просто використати формулу, отриману з summary(fit). Однак що …

3
Підводні камені лінійних змішаних моделей
Які основні підводні камені використання лінійних моделей зі змішаними ефектами? Які найважливіші речі, на які слід перевірити / слідкувати, оцінюючи відповідність вашої моделі? Порівнюючи моделі одного і того ж набору даних, які найважливіші речі потрібно шукати?


10
Набори даних у соціальних мережах
Заблокований . Це питання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Я шукаю набори даних у соціальній мережі (twitter, friendfeed, facebook, lastfm тощо) для завдань класифікації, бажано у форматі arff. Мої пошуки через UCI та Google досі …

4
Чи можу я просто видалити одну з двох змінних предиктора, які сильно лінійно корелюються?
Використовуючи коефіцієнт кореляції Пірсона, у мене є кілька змінних, які сильно корелюються ( і для двох пар змінних, які є в моїй моделі).ρ = 0,989ρ = 0,978ρ=0.978\rho = 0.978ρ = 0,989ρ=0.989\rho = 0.989 Причина , деякі з змінних мають високу кореляцію тому , що одна змінна використовується в обчисленні для …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.