Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Пошук пристосованих та прогнозованих значень для статистичної моделі
Скажімо, у мене є такі дані та я використовую регресійну модель: df=data.frame(income=c(5,3,47,8,6,5), won=c(0,0,1,1,1,0), age=c(18,18,23,50,19,39), home=c(0,0,1,0,0,1)) З одного боку, я використовую лінійну модель для прогнозування доходу: md1 = lm(income ~ age + home + home, data=df) По-друге, я запускаю модель logit, щоб передбачити виграну змінну: md2 = glm(factor(won) ~ age + …
12 r 

4
Чи може хтось проілюструвати, як може бути залежність і нульова коваріація?
Чи може хтось проілюструвати, як це робить Грег, але більш детально, як випадкові змінні можуть залежати, але мають нульову коваріацію? Грег, тут плакат, наводить приклад, використовуючи тут коло . Чи може хтось пояснити цей процес більш детально, використовуючи послідовність етапів, які ілюструють процес на декількох етапах? Крім того, якщо ви …

6
Інтерпретація результатів ur.df R (кореневий тест одиниці Dickey-Fuller)
Я виконую наступний тест кореневого модуля (Dickey-Fuller) у часовому ряду, використовуючи ur.df()функцію в urcaпакеті. Команда така: summary(ur.df(d.Aus, type = "drift", 6)) Вихід: ############################################### # Augmented Dickey-Fuller Test Unit Root Test # ############################################### Test regression drift Call: lm(formula = z.diff ~ z.lag.1 + 1 + z.diff.lag) Residuals: Min 1Q Median 3Q …

1
Розрахунок канонічної функції зв'язку в GLM
Я думав, що канонічна функція зв'язку походить від природного параметра родини експонентів. Скажімо, розглянемо сімейство тоді - це функція канонічного зв'язку. Візьмемо для прикладу розподіл Бернуллі , маємо Отже, канонічна функція зв'язкуg(⋅)g(⋅)g(\cdot)f(y,θ,ψ)=exp{yθ−b(θ)a(ψ)−c(y,ψ)}f(y,θ,ψ)=exp⁡{yθ−b(θ)a(ψ)−c(y,ψ)} f(y,\theta,\psi)=\exp\left\{\frac{y\theta-b(\theta)}{a(\psi)}-c(y,\psi)\right\} θ=θ(μ)θ=θ(μ)\theta=\theta(\mu)P(Y=y)=μy(1−μ)1−y=exp{ylogμ1−μ+log(1−μ)}P(Y=y)=μy(1−μ)1−y=exp⁡{ylog⁡μ1−μ+log⁡(1−μ)} P(Y=y)=\mu^{y}(1-\mu)^{1-y}=\exp\left\{y\log\frac{\mu}{1-\mu}+\log{(1-\mu)}\right\} g(μ)=logμ1−μg(μ)=log⁡μ1−μg(\mu)=\log\frac{\mu}{1-\mu} Але коли я бачу цей слайд , він стверджує, що Хоча його можна легко …

1
Як визначити розподіл таким, що черпає з нього кореляцію з виведенням з іншого заздалегідь заданого розподілу?
Як я можу визначити розподіл випадкової величини таким, що витяг з Y має кореляцію ρ з x 1 , де x 1 - це одиночне виведення з розподілу з кумулятивною функцією розподілу F X ( x ) ? YYYYYYρρ\rhoх1x1x_1х1x1x_1ЖХ( х )FX(x)F_{X}(x)

1
Альтернатива блокувати завантажувальну систему для багатоваріантних часових рядів
В даний час я використовую наступний процес для завантаження багатовимірного часового ряду в R: Визначення розмірів блоків - запустіть функцію b.starв npпакеті, який створює розмір блоку для кожної серії Виберіть максимальний розмір блоку Запустити tsbootбудь-яку серію, використовуючи вибраний розмір блоку Використовуйте індекс від вихідного завантажувального інструменту для реконструкції багатовимірного часового …

5
Як виміряти «всебічність» учасників ІП?
Як ми всі знаємо, обмін стеками - це колекція сайтів із запитаннями та питаннями з різноманітною тематикою. Якщо припустити, що кожен сайт незалежний один від одного, враховуючи статистику, яку має користувач, як обчислити його «добре округленість» у порівнянні з наступним хлопцем? Який статистичний інструмент я повинен використовувати? Якщо чесно, я …




2
Коли методи Монте-Карло віддають перевагу тимчасовим різницям?
Останнім часом я багато займався дослідженнями в навчанні зміцнення. Я слідував за навчанням зміцнення Саттона і Барто : Вступ до більшості цього. Я знаю, що таке процеси прийняття рішень Маркова та як навчання динамічного програмування (DP), Монте-Карло та часової різниці (DP) можна їх вирішити. Проблема у мене в тому , …

1
Різниця між регресією PLS та моделюванням шляху PLS. Критика ПЛС
Це питання було задано тут, але ніхто не дав гарної відповіді. Тому я думаю, що це гарна ідея підняти її ще раз, а також я хотів би додати ще кілька коментарів / питань. Перше питання - в чому різниця між "моделюванням шляху ПЛС" та "регресією ПЛС"? Щоб зробити його більш …


1
Чому LKJcorr є гарним пріоритетом для кореляційної матриці?
Я читаю розділ 13 "Пригоди в коваріації" у ( чудовій ) книзі " Статистичне переосмислення " Річарда МакЛарета, де він подає таку ієрархічну модель: ( Rє кореляційною матрицею) Автор пояснює, що LKJcorrце слабоінформативний характер, який працює як регуляризуючий попередній для кореляційної матриці. Але чому це так? Які характеристики LKJcorrмає розподіл, …

2
Тест Колмогорова – Смірнова: p-значення та ks-тест зменшуються зі збільшенням кількості вибірки
Чому р-значення та ks-тест-статистика зменшуються зі збільшенням розміру вибірки? Візьмемо цей приклад Python як приклад: import numpy as np from scipy.stats import norm, ks_2samp np.random.seed(0) for n in [10, 100, 1000, 10000, 100000, 1000000]: x = norm(0, 4).rvs(n) y = norm(0, 4.1).rvs(n) print ks_2samp(x, y) Результати: Ks_2sampResult(statistic=0.30000000000000004, pvalue=0.67507815371659508) Ks_2sampResult(statistic=0.080000000000000071, pvalue=0.89375155241057247) …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.