Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Чи кореляція коваріації стандартизованих змінних?
У мене основне питання. Скажімо , у мене є дві випадкові величини, і Y . Я можу їх стандартизувати, віднімаючи середнє значення і діливши на стандартне відхилення, тобто X_ {стандартизований} = \ frac {(X - E (X))} {(SD (X))} .XXXYYYXstandardized=(X−E(X))(SD(X))Xstandardized=(X−E(X))(SD(X))X_{standardized} = \frac{(X - E(X))}{(SD(X))} Чи співвідношення XXX і YYY , …

1
Що повідомляє lsmeans для узагальненої лінійної моделі, такої як змішана модель Пуассона (підходить до glmer)?
Я аналізую дані відстеження очей із розробленого експерименту. Спрощена версія моїх даних виглядає приблизно так (дані dput () можна отримати тут ), head(lookDATA) participant fixationImage fixationCount 1 9 Automobile 81 2 9 Bird 63 3 9 Chair 82 4 9 Dog 64 5 9 Face 90 6 9 Plant 75 …

2
Хороші приклади розділів статистики у прикладних статтях академічного журналу
Я біостатист, що працюю в прикладній галузі, і відповідальний за написання розділу про методи статистики для робіт, над якими співпрацюю. Читаючи багато наукових праць, я натрапив на безліч прикладів погано написаних розділів статистики (в основному вони нудні, неінформативні і не мають точності, деталізації та розуміння використовуваної методології). Незалежно від теми …

2
Оцініть задній прогнозний розподіл за лінійною регресією Байєса
Мене збентежує те, як оцінити задній прогнозний розподіл за лінійною регресією Байєса, минулий основний випадок, описаний тут на сторінці 3, і скопійований нижче. р (у~∣ у) = ∫р (у~∣ β,σ2) p ( β,σ2∣ у)p(y~∣y)=∫p(y~∣β,σ2)p(β,σ2∣y) p(\tilde y \mid y) = \int p(\tilde y \mid \beta, \sigma^2) p(\beta, \sigma^2 \mid y) Основний …

2
Чи можете ви обчислити потужність тесту Колмогорова-Смірнова в R?
Чи можливо зробити аналіз потужності для двостороннього тесту Колмогорова Смірнова в R? Я перевіряю, чи відрізняються два емпіричні розподіли за допомогою ks.test (), і хочу додати аналіз потужності. Я не зміг знайти вбудований аналіз потужності для тестів на KS в Р. Будь-які пропозиції? Редагувати : це випадкові згенеровані розподіли, які …

1
Майже впевнене, що конвергенція не означає повного зближення
Ми говоримо, що повністю сходяться до якщо для кожного .Х1,Х2, …X1,X2,…X_1, X_2, \ldotsХXXϵ &gt; 0ϵ&gt;0\epsilon>0 ∑∞n = 1Р ( |Хн- X| &gt;ϵ)&lt;∞∑н=1∞П(|Хн-Х|&gt;ϵ)&lt;∞\sum_{n=1}^\infty \text{P}\left(|X_n-X|>\epsilon\right) <\infty З лемою Бореля Кантеллі прямо вперед, щоб довести, що повна конвергенція передбачає майже впевнену конвергенцію. Я шукаю приклад, були майже впевнені, що конвергенцію неможливо довести з …

1
Формула для байєсівського тестування A / B не має сенсу
Я використовую формулу баєсівського тестування ab для того, щоб обчислити результати тесту АВ за методологією Байєса. Pr(pB&gt;pA)=∑i=0αB−1B(αA+i,βB+βA)(βB+i)B(1+i,βB)B(αA,βA)Pr(pB&gt;pA)=∑i=0αB−1B(αA+i,βB+βA)(βB+i)B(1+i,βB)B(αA,βA) \Pr(p_B > p_A) = \sum^{\alpha_B-1}_{i=0} \frac{B(\alpha_A+i,\beta_B+\beta_A)}{(\beta_B+i)B(1+i,\beta_B)B(\alpha_A, \beta_A)} де αAαA\alpha_A в одному плюс кількість успіхів для A βAβA\beta_A в один плюс кількість відмов для A αBαB\alpha_B в один плюс кількість успіхів для B βBβB\beta_B …
10 r  bayesian  ab-test 

2
Реалізація вкладеної перехресної перевірки
Я намагаюся зрозуміти, чи правильно я розумію вкладені перехресні перевірки, тому я написав цей приклад іграшки, щоб побачити, чи маю рацію: import operator import numpy as np from sklearn import cross_validation from sklearn import ensemble from sklearn.datasets import load_boston # set random state state = 1 # load boston dataset …

3
Як класифікувати незбалансований набір даних за допомогою конволюційних нейронних мереж (CNN)?
У мене є незбалансований набір даних у задачі бінарної класифікації, де сума позитивів проти негативів становить 0,3% проти 99,7%. Розрив між позитивом і негативом величезний. Коли я треную CNN зі структурою, що використовується в проблемі MNIST, результат тестування показує високий показник помилкових негативних значень. Також крива помилок тренінгу швидко спадає …

1
Що таке асимптотична матриця коваріації?
Чи правда, що асимптотична матриця коваріації дорівнює матриці коваріації оцінок параметрів? Якщо ні, то що це? І яка різниця між коваріаційною матрицею і асимптотичною матрицею коваріації в цьому випадку? Спасибі заздалегідь!

2
Чи відбір проб на основі Маркова є "найкращим" для відбору проб Монте-Карло? Чи є альтернативні схеми?
Ланцюг Маркова Монте-Карло - це метод, заснований на ланцюгах Маркова, який дозволяє отримувати зразки (в умовах Монте-Карло) з нестандартних розподілів, з яких ми не можемо безпосередньо брати зразки. Моє запитання, чому ланцюжок Маркова є "найсучаснішим" для відбору проб Монте-Карло. Альтернативним питанням може бути, чи існують інші способи, як ланцюги Маркова, …

1
Достатність або недостатність
Розглянемо випадковий зразок де - iid випадкові величини, де . Перевірте, чи є достатньою статистикою для .{X1,X2,X3}{X1,X2,X3}\{X_1,X_2,X_3\}XiXiX_iBernoulli(p)Bernoulli(p)Bernoulli(p)p∈(0,1)p∈(0,1)p\in(0,1)T(X)=X1+2X2+X3T(X)=X1+2X2+X3T(X)=X_1+2X_2+X_3ppp По-перше, як ми можемо знайти розподіл для ? Або його слід розбити на і тоді це буде слідувати за ? Я думаю, що не тому, що зауважте, що всі змінні тут не є …

2
Визначник матриці інформаційної матриці Фішера для надпараметризованої моделі
Розглянемо випадкову змінну Бернуллі з параметром (ймовірність успіху). Функція ймовірності та інформація Фішера ( матриця ):Х∈ { 0 , 1 }Х∈{0,1}X\in\{0,1\}θθ\theta1 × 11×11 \times 1 L1( θ ; X)Я1( θ )= p (Х| θ ) =θХ( 1 - θ)1 - X= detЯ1( θ ) =1θ ( 1 - θ )L1(θ;Х)=p(Х|θ)=θХ(1-θ)1-ХЯ1(θ)=detЯ1(θ)=1θ(1-θ) …

1
Узагальнені лінійні моделі проти моделей Timseries для прогнозування
У чому полягають відмінності у використанні узагальнених лінійних моделей, таких як автоматичне визначення відповідності (ARD) та регресія хребта, порівняно з моделями часових рядів, як Box-Jenkins (ARIMA) або експоненціальне згладжування для прогнозування? Чи є якісь правила щодо того, коли використовувати GLM та коли використовувати часовий ряд?

1
Чи є закритою, встановивши умову в тестуванні гіпотез?
Під час тестування статистичної гіпотези нульова гіпотеза часто приймає форму (принаймні, у прочитаних книгах): або H0H0H_0H0:H0:θ=θ0θ≤θ0H0:θ=θ0H0:θ≤θ0 \begin{align*} H_0:&\theta=\theta_0\\ H_0:&\theta\le\theta_0 \end{align*} H0:θ1≤θ≤θ2H0:θ1≤θ≤θ2 H_0:\theta_1\le\theta\le\theta_2 Чи є лише умовою, що множини в закриті? Або є якісь інші причини?H0H0H_0

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.