Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Чому введення випадкового ефекту нахилу збільшило SE схилу?
Я намагаюся проаналізувати вплив року на змінний logInd для певної групи осіб (у мене є 3 групи). Найпростіша модель: > fix1 = lm(logInd ~ 0 + Group + Year:Group, data = mydata) > summary(fix1) Call: lm(formula = logInd ~ 0 + Group + Year:Group, data = mydata) Residuals: Min 1Q …

1
Чи має значення те, як ви відбираєте населення?
У мене добре змішаний чан, що містить нескінченну кількість мармуру. У чані є нескінченна кількість мармуру, але вони надходять лише у невідомій, але кінцевій кількості різновидів : невідомо, і для , малювання мармуру типу може бути скоріше, ніж малювання мармуру типу .V= {v1,v2,v3, . . . ,vк}V={v1,v2,v3,...,vк}\mathcal{V} = \{v_{1},v_{2},v_{3},...,v_{k}\} ккki …

3
Як перевірити / довести, що дані завищені на нулі?
У мене є проблема, яка, на мою, повинна бути простою, але я не можу її цілком зрозуміти. Я дивлюсь на запилення насіння, у мене є рослини (n = 36), які цвітуть в гронах, я вибираю по 3 квіткових скупчення з кожної рослини і 6 насіннєвих стручків з кожного кластеру (18 …

1
Як отримати стандартні помилки від регресії даних з нульовим рівнем R? [зачинено]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 2 роки тому . Наступний код PredictNew <- predict (glm.fit, newdata = Predict, X1 =X1, Y1= Y1, type = "response", se.fit = TRUE) створює 3-стовпець data.frame--PredictNew, …

2
Як я можу оцінити 95% довірчі інтервали, використовуючи профілювання для параметрів, оцінених шляхом максимізації функції вірогідності журналу, використовуючи оптимальну величину R?
Як я можу оцінити 95% довірчі інтервали, використовуючи профілювання для параметрів, оцінених шляхом максимізації функції вірогідності журналу, використовуючи оптимальну величину R? Я знаю, що я можу асимптотично оцінити матрицю коваріації шляхом інвертування гессіана , але я стурбований тим, що мої дані не відповідають припущенням, необхідним для цього методу. Я вважаю …

1
Очікуване логічне значення нецентрального експоненціального розподілу
Припустимо, нецентральний експоненціально розподілений з розташуванням та швидкістю . Потім, що таке .XXXkkkλλ\lambdaE(log(X))E(log⁡(X))E(\log(X)) Я знаю, що при відповідь де - константа Ейлера-Машероні. Що робити, коли ?k=0k=0k=0−log(λ)−γ−log⁡(λ)−γ-\log(\lambda) - \gammaγγ\gammak>0k>0k > 0

1
Моделювання розподілів
Я працюю над завданням з планування потенціалу і прочитав деякі книги. Мова йде саме про дистрибуції. Я використовую Р. Який рекомендований підхід визначити, що таке мій розподіл даних? Чи є статистичні методи її ідентифікації? У мене є ця діаграма. Які підходи до моделювання доступні за допомогою R? Тут я хочу …

2
Кореляція суттєва у кожній групі, але неістотна для всіх?
Припустимо , ми тестуємо кореляції Пірсона між змінної і в групах і . Чи можливо, щоб кореляція була значущою в кожному з і , але несуттєвою, коли дані обох груп поєднуються? У цьому випадку ви можете, будь ласка, надати пояснення цьому.хxxуyyАAAБBB( х , у)(x,y)(x,y)АAAБBB

2
Плутанина щодо кригінгу
Я читав цю статтю у Вікіпедії, пов’язану з кригінгом. Я не розумів тієї частини, коли це говорить Крігінг обчислює найкращий лінійний неупереджений оцінювач , таким чином, що відхилення кригинга мінімізується при умові неупередженості. Я не отримав деривацію, а також як зменшення дисперсії. Будь-які пропозиції?Z^(x0)Z^(x0)\hat Z (x_0)Z(x0)Z(x0)Z(x_0) Спеціально, я не отримав …

1
Чи існує метод оцінювання параметрів розподілу, заданих лише квантовими елементами?
чи є спосіб встановити вказаний розподіл, якщо вам дано лише кілька квантилів? Наприклад, якщо я вам сказав, у мене є гамма-розподілений набір даних, а емпіричні 20%, 30%, 50% і 90% - це відповідно: 20% 30% 50% 90% 0.3936833 0.4890963 0.6751703 1.3404074 Як би я пішов і оцінив параметри? Є кілька …

1
Розрахунковий розподіл власних значень для iid (рівномірного або нормального) даних
Припустимо, що у мене є набір даних гdd розміри (напр г= 20d=20d=20), щоб кожен вимір був ідентичним Хi∼ U[ 0 ; 1 ]Xi∼U[0;1]X_i \sim U[0;1] (як альтернатива, кожен вимір Хi∼ N[0 ; 1 ]Xi∼N[0;1]X_i \sim \mathcal N[0;1]) і незалежні один від одного. Тепер я малюю випадковий об'єкт із цього набору …

3
Як перевірити, чи відрізняється середнє значення підгрупи від загальної групи, що включає підгрупу?
Як я можу перевірити, чи середнє значення (наприклад, артеріальний тиск) підгрупи (наприклад, тих, хто помер) відрізняється від цілої групи (наприклад, у всіх, хто переніс захворювання, включаючи померлих)? Ясна річ, що перша - це підгрупа другої. Який тест гіпотези я повинен використовувати?

1
Як кількісно оцінити статистичну незначущість?
Я відносно новачок статистики і розумію, що моє запитання може бути повністю неправильним. Я тестую власний алгоритм проти іншого. Хоча результати не є однаковими, я хочу показати, що відмінності "статистично незначні". Як я можу це кількісно оцінити, щоб зробити свою думку?

2
Параметричне, напівпараметричне та непараметричне завантаження для змішаних моделей
Наступні трансплантати взяті з цієї статті . Я новачок у завантажувальній програмі та намагаюся реалізувати параметричне, напівпараметричне та непараметричне завантажувальне завантаження для лінійної змішаної моделі з R bootпакетом. R код Ось мій Rкод: library(SASmixed) library(lme4) library(boot) fm1Cult <- lmer(drywt ~ Inoc + Cult + (1|Block) + (1|Cult), data=Cultivation) fixef(fm1Cult) boot.fn …
9 r  mixed-model  bootstrap  central-limit-theorem  stable-distribution  time-series  hypothesis-testing  markov-process  r  correlation  categorical-data  association-measure  meta-analysis  r  anova  confidence-interval  lm  r  bayesian  multilevel-analysis  logit  regression  logistic  least-squares  eda  regression  notation  distributions  random-variable  expected-value  distributions  markov-process  hidden-markov-model  r  variance  group-differences  microarray  r  descriptive-statistics  machine-learning  references  r  regression  r  categorical-data  random-forest  data-transformation  data-visualization  interactive-visualization  binomial  beta-distribution  time-series  forecasting  logistic  arima  beta-regression  r  time-series  seasonality  large-data  unevenly-spaced-time-series  correlation  statistical-significance  normalization  population  group-differences  demography 

1
Множинна регресія з відсутньою змінною предиктора
Припустимо, нам надають набір даних форми (y,x1,x2,⋯,xn)(y,x1,x2,⋯,xn)(y,x_{1},x_{2},\cdots, x_{n}) і (y,x1,x2,⋯,xn−1)(y,x1,x2,⋯,xn−1)(y,x_{1},x_{2},\cdots, x_{n-1}). Нам дається завдання передбачитиyyy на основі значень xxx. Ми оцінюємо дві регресії, де: yy=f1(x1,⋯,xn−1,xn)=f2(x1,⋯,xn−1)(1)(2)(1)y=f1(x1,⋯,xn−1,xn)(2)y=f2(x1,⋯,xn−1) \begin{align} y &=f_{1}(x_{1},\cdots, x_{n-1}, x_{n}) \tag{1} \\ y &=f_{2}(x_{1},\cdots, x_{n-1}) \tag{2} \end{align} Ми також оцінюємо регресію, яка прогнозує значення xnxnx_{n} на основі значень (x1,⋯,xn−1)(x1,⋯,xn−1)(x_{1},\cdots, x_{n-1}), …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.