Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Трансформація статистики замовлень
Припустимо, випадкові величини і незалежні, а -розподілені. Покажіть, що має \ Розподіл тексту {Exp} (1) .X1,...,XnX1,...,XnX_1, ... , X_nY1,...,YnY1,...,YnY_1, ..., Y_nU(0,a)U(0,a)U(0,a)Zn=nlogmax(Y(n),X(n))min(Y(n),X(n))Zn=nlog⁡max(Y(n),X(n))min(Y(n),X(n))Z_n= n\log\frac{\max(Y_{(n)},X_{(n)})}{\min(Y_{(n)},X_{(n)})}Exp(1)Exp(1)\text{Exp}(1) Я розпочав цю проблему, встановивши {X1,...,Xn,Y1,...Yn}={Z1,...,Zn}{X1,...,Xn,Y1,...Yn}={Z1,...,Zn}\{X_1,...,X_n,Y_1,...Y_n\} = \{Z_1,...,Z_n\} Тоді max(Yn,Xn)=Z(2n)max(Yn,Xn)=Z(2n)\max(Y_n,X_n)= Z_{(2n)} поширюватиметься як (za)2n(za)2n(\frac{z}{a})^{2n} а min(Yn,Xn)=Z(1)min(Yn,Xn)=Z(1)\min(Y_n,X_n)= Z_{(1)} поширюватиметься як 1−(1−za)2n1−(1−za)2n1 - (1 - \frac{z}{a})^{2n} Щільності можна легко знайти …

1
Асимптотична нормальність статистики порядку важких хвостових розподілів
Передумови: У мене є зразок, який я хочу моделювати з великим хвостиком. У мене є деякі крайні значення, такі, що поширення спостережень порівняно велике. Моя ідея полягала в тому, щоб моделювати це з узагальненим розподілом Парето, і так я зробив. Тепер, 0,975 квантил моїх емпіричних даних (близько 100 точок даних) …

2
Малювання зразків з багатоваріантного нормального розподілу з урахуванням квадратичних обмежень
Я хотів би ефективно намалювати зразки з урахуванням обмеження, що .x∈Rdx∈Rdx \in \mathbb{R}^dN(μ,Σ)N(μ,Σ)\mathcal{N}(\mu, \Sigma)||x||2=1||x||2=1||x||_2 = 1

2
Яка наукова галузь вивчає, як люди інтерпретують кількісні підсумки та візуалізації?
Існує велика кількість відомих ресурсів, які пропонують поради щодо візуалізації даних. (Напр. Туфте, Стівен Фьюв та ін. , Натан Яу .) Але до яких напрямів можна звернутися, щоб відповісти на такі питання: Чи актуальна критика пиріжкового діаграму на практиці? Невже люди набагато краще інтерпретують лінійну довжину шкали, ніж довжину дуги? …

1
Є контури
Я припускаю загальну настройку регресії, тобто безперервну функцію hθ:X→Rnhθ:X→Rnh_\theta:X\to \mathbb R^n вибирається з родини {hθ}θ{hθ}θ\{h_\theta\}_\theta відповідно до заданих даних (xi,yi)∈X×Rn,i=1,…,k(xi,yi)∈X×Rn,i=1,…,k(x_i,y_i)\in X\times \mathbb R^n, i=1,\ldots, k (XXX може бути будь-який простір, наприклад куб [0,1]m[0,1]m[0,1]^m або насправді будь-який розумний топологічний простір) за деякими природними критеріями. Чи є додатки регресії, де хтось цікавиться …

1
Що має охоплювати аспірантура з експериментального дизайну?
Мене попросили запропонувати курс експериментального проектування для аспірантів з агрономії та екології. Я ніколи не брав такого курсу, і з подивом виявив, що цей курс може бути більш влучно названий "Поза односторонньою ANOVA", і що він охоплює матеріал, який я дізнався під час випускної аспірантури зі статистики для сільськогосподарських польових …

1
інваріантність кореляції з лінійним перетворенням:
Це фактично одна з проблем у 4-му виданні «Основна економетрія Гуджараті» (Q3.11) і говорить про те, що коефіцієнт кореляції інваріантний щодо зміни походження та масштабу, тобтоcorr ( a X+ b , c Y+ д) = corr ( X, Y)корр(аХ+б,cY+г)=корр(Х,Y)\text{corr}(aX+b, cY+d) = \text{corr}(X,Y) де ааa,ббb,ccc,ггd є довільними константами. Але моє головне …

1
Чому проксимальний градієнтний спуск замість простих субградієнтних методів для Лассо?
Я думав вирішити Лассо за допомогою градієнтних методів ванілі. Але я читав людей, які пропонують використовувати проксимальний градієнтний спуск. Чи може хтось виділити, чому для Лассо застосовують проксимальний ГД замість методів градієнта ванілі?

1
Чи розподіляються якісь процеси в природі абсолютно нормально?
Про важливість нормальних розподілів у природі було сказано багато. Багато вимірювань, як висота чи вага, розподіляються приблизно нормально. Але жодна з них не є абсолютно нормальною, наскільки я розумію. Вважаючи, що нормальний розподіл є одним із максимальних розподілів ентропії , здається правдоподібним, що природа повинна "сподобатися". Але подумавши, я не …

2
Вибір функцій для проблем кластеризації
Я намагаюся згрупувати різні набори даних, використовуючи непідтримувані алгоритми (кластеризація). Проблема полягає в тому, що у мене багато особливостей (~ 500) і невелика кількість справ (200-300). Поки що я займався лише проблемами з класифікацією, для яких я завжди мав дані як навчальні набори. Там я використав деякий критерій (тобто випадковий.форест.важливість …

3
Половина дискретної випадкової величини?
Нехай - дискретна випадкова величина, що приймає її значення в . Я хотів би вдвічі зменшити цю змінну, тобто знайти випадкову змінну таку як:XXXNN\mathbb{N}YYY X=Y+Y∗X=Y+Y∗X = Y + Y^* де є незалежною копією .Y∗Y∗Y^*YYY Я ставлюсь до цього процесу як удвічі ; це складена термінологія. Чи є в літературі відповідний …

3
Оберніть компоненти PCA, щоб вирівняти дисперсію в кожному компоненті
Я намагаюся зменшити розмірність і шум набору даних, виконуючи PCA на наборі даних і викидаючи останні кілька ПК. Після цього я хочу використовувати деякі алгоритми машинного навчання на решті ПК, і тому хочу нормалізувати дані, вирівнюючи дисперсію ПК, щоб алгоритми працювали краще. Один простий спосіб - просто нормалізувати дисперсію до …

3
Набір некорельованих, але лінійно залежних змінних
Чи можливо мати набір змінних, які не співвідносяться, але лінійно залежать?KKK тобто іcor(xi,xj)=0cor(xi,xj)=0cor(x_i, x_j)=0∑Ki=1aixi=0∑i=1Kaixi=0 \sum_{i=1}^K a_ix_i=0 Якщо так, чи можете ви написати приклад? EDIT: З відповідей випливає, що це неможливо. Принаймні, можливо, що де - розрахунковий коефіцієнт кореляції, обчислений від вибірок змінних, а - змінна, некорельована з .P(|ρ^xi,xj−ρ^xi,v|<ϵ)P(|ρ^xi,xj−ρ^xi,v|<ϵ)\mathbb{P}(|\hat \rho_{x_i, x_j}-\hat …

1
Вибір оригінальної (?) Моделі з кратним CV
Використовуючи ревізію k-кратного для вибору серед регресійних моделей, я зазвичай обчислюю похибку CV окремо для кожної моделі разом із її стандартною помилкою SE, і я вибираю найпростішу модель в межах 1 SE від моделі з найнижчою помилкою CV (1 стандартне правило помилок, див. наприклад тут ). Однак мені нещодавно сказали, …

1
Чому стовпець перехоплення в model.matrix замінює перший фактор?
Я намагаюся перетворити свій факторний стовпчик на фіктивні змінні: str(cards$pointsBin) # Factor w/ 5 levels ".lte100",".lte150",..: 3 2 3 1 4 4 2 2 4 4 ... labels <- model.matrix(~ pointsBin, data=cards) head(labels) # (Intercept) pointsBin.lte150 pointsBin.lte200 pointsBin.lte250 pointsBin.lte300 # 741 1 0 0 0 0 # 407 1 1 …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.