Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Очікуване значення медіани вибірки з урахуванням середньої вибірки
Нехай YYY позначає медіану, а ˉ XX¯\bar{X} позначає середнє значення випадкової вибірки розміром n = 2 k + 1n=2k+1n=2k+1 з розподілу, який дорівнює N ( μ , σ 2 )N(μ,σ2)N(\mu,\sigma^2) . Як я можу обчислити ? E ( Y | ˉ X = ˉ x )E(Y|X¯=x¯)E(Y|\bar{X}=\bar{x}) Інтуїтивно, через припущення про …

4
Кому вірити: тест Колмогорова-Смірнова або сюжет QQ?
Я намагаюся визначити, чи відповідає мій набір даних безперервних даних за розподілом гами з параметрами форма 1,7 та швидкість = 0,000063.====== Проблема полягає в тому, що коли я використовую R для створення графіку QQ мого набору даних проти теоретичної гамми розподілу (1,7, 0,000063), я отримую графік, який показує, що емпіричні …

1
Достатня статистика, специфіка / проблеми з інтуїцією
Я викладаю собі якусь статистику для розваги і в мене є певна плутанина щодо достатньої статистики . Я випишу свої плутанини у форматі списку: Якщо розподіл має параметрів, то чи матиме він достатньо статистичних даних?nннnннn Чи існує якась пряма відповідність між достатньою статистикою та параметрами? Або достатня статистика просто служить …

1
Проблема з визначенням порядку ARIMA
Це довгий пост, тому я сподіваюся, що ви можете перенести зі мною, і, будь ласка, виправте мене там, де я помиляюся. Моя мета - складати щоденний прогноз на основі 3 або 4 тижнів історичних даних. Дані - це 15-хвилинні дані локального навантаження однієї з трансформаторних ліній. У мене виникають проблеми …

2
Показ просторової та часової кореляції на картах
У мене є дані для мережі метеостанцій по всій території США. Це дає мені кадр даних, який містить дату, широту, довготу та деяке вимірюване значення. Припустимо, що дані збираються раз на день та керуються регіональною погодою (ні, ми не збираємось вступати в цю дискусію). Я хотів би показати графічно, як …

1
Розуміння дисперсії випадкових ефектів у lmer () моделях
У мене виникають проблеми з розумінням виходу моєї lmer()моделі. Це проста модель змінної результату (підтримка) з різними перехопленнями стану / випадковими ефектами стану: mlm1 <- lmer(Support ~ (1 | State)) Результати summary(mlm1): Linear mixed model fit by REML Formula: Support ~ (1 | State) AIC BIC logLik deviance REMLdev 12088 …

2
За яких умов машини для підвищення градієнта перевершують випадкові ліси?
Чи може градієнтний прискорювач Фрідмана досягти кращих показників, ніж з випадковим лісом Бреймана ? Якщо так, то в яких умовах або який набір даних може покращити gbm?

4
Чи існує закон, який говорить, що якщо ви зробите достатньо випробувань, трапляються рідкісні речі?
Я намагаюся зробити відео про завантажені кістки, і в один момент в ролику ми розкачаємо близько 200 кубиків, беремо всі шістдесят, згорнемо їх ще раз, і візьмемо всі шістдесят і згорнемо їх втретє. У нас був один гибель, який виходив 6 разів три рази поспіль, що, очевидно, не є незвичним, …

2
Однокласний SVM проти зразкового SVM
Я розумію, що однокласні SVM (OSVM) були запропоновані з урахуванням відсутності негативних даних, і вони прагнуть знайти межі рішення, які відокремлюють позитивний набір і якусь негативну опорну точку, скажімо, походження. Робота в 2011 році пропонує екземплярні SVM (ESVM), які готують "єдиний класифікатор на категорію", який стверджує, що відрізняється від OSVM, …

3
Холеський проти ейгендекомпозиції для малювання зразків з багатовимірного нормального розподілу
Я б хотів намалювати зразок . Вікіпедія пропонує або використовувати склад Холеського, або Ейгенде , тобто або Σ = D 1 D T 1x∼N(0,Σ)x∼N(0,Σ)\mathbf{x} \sim N\left(\mathbf{0}, \mathbf{\Sigma} \right)Σ=D1DT1Σ=D1D1T \mathbf{\Sigma} = \mathbf{D}_1\mathbf{D}_1^T Σ=QΛQTΣ=QΛQT \mathbf{\Sigma} = \mathbf{Q}\mathbf{\Lambda}\mathbf{Q}^T Отже, зразок можна скласти через: або де \ mathbf {v} \ sim N \ зліва …

3
Як розділити r-квадрат між змінними предиктора в множинній регресії?
Я щойно прочитав статтю, в якій автори провели багаторазову регресію з двома прогнозами. Загальне значення r-квадрата становило 0,65. Вони надали таблицю, яка розділила r-квадрат між двома прогнозами. Таблиця виглядала так: rsquared beta df pvalue whole model 0.65 NA 2, 9 0.008 predictor 1 0.38 1.01 1, 10 0.002 predictor 2 …

1
Чому контроль FDR менш жорсткий, ніж контроль FWER?
Я читав, що керування FDR менш жорстке, ніж контроль над FWER, як, наприклад, у Вікіпедії : Процедури контролю FDR здійснюють менш жорсткий контроль над помилковим виявленням порівняно з процедурами помилок у сімейному режимі (FWER) (наприклад, виправлення Бонферроні). Це збільшує потужність за рахунок збільшення швидкості помилок типу I, тобто відкидання нульової …

2
Плутанина з тестом Augmented Dickey Fuller
Я працюю над набором даних electricityдоступні в R пакеті TSA. Моя мета - з'ясувати, чи буде arimaмодель відповідна цим даним, і, врешті-решт, їх відповідати. Тож я поступив так: 1-е: Накресліть часовий ряд, у результаті якого з'явився наступний графік: 2-й: Я хотів увійти в систему, electricityщоб стабілізувати дисперсію, а потім розмежував …

3
Перевірте, чи змінюються змінні однакового розподілу
Якщо ви хочете перевірити, чи дві змінні дотримуються одного і того ж розподілу, чи було б хорошим тестом просто сортувати обидві змінні, а потім перевірити їх співвідношення? Якщо він високий (щонайменше 0,9?), То змінні, швидше за все, походять з одного розподілу. Під поширенням тут я маю на увазі «нормальний», «чі-квадрат», …

2
Мова R, яка різниця між rnorm і runif [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 6 років тому . Яка різниця між функціями rnormі runifв R?
16 r 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.