Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Що вище, або
Тож у мене був імовірний тест, і я не міг реально відповісти на це питання. Він просто запитав щось подібне: "Враховуючи, що - випадкова величина, 0 , використовуйте правильну нерівність, щоб довести те, що вище або рівне, E (X ^ 2) ^ 3 або E (X ^ 3) ^ 2 …

1
Чи
Чи означають незалежність і ?Cov(f(X),Y)=0∀f(.)Cov(f(X),Y)=0∀f(.)\mathbb{Cov} \left(f(X),Y\right) = 0 \; \forall \; f(.)XXXYYY Я знайомий тільки з наступним визначенням незалежності між і .XXXYYY fx,y(x,y)=fx(x)fy(y)fx,y(x,y)=fx(x)fy(y) f_{x,y}(x,y) = f_x(x)f_y(y)

2
Очікування квадратного кореня суми незалежних квадратних рівномірних випадкових величин
Нехай є незалежними та однаково розподіленими стандартними однорідними випадковими змінними.X1,…,Xn∼U(0,1)X1,…,Xn∼U(0,1)X_1,\dots,X_n \sim U(0,1) Let Yn=∑inX2iI seek: E[Yn−−√]Let Yn=∑inXi2I seek: E[Yn]\text{Let }\quad Y_n=\sum_i^nX_i^2 \quad \quad \text{I seek: } \quad \mathbb{E}\big[\sqrt{Y_n } \big] Очікування легко:YnYnY_n E[X2]E[Yn]=∫10y2y√=13=E[∑inX2i]=∑inE[X2i]=n3E[X2]=∫01y2y=13E[Yn]=E[∑inXi2]=∑inE[Xi2]=n3\begin{align} \mathbb{E}\left[X^2\right] &=\int_0^1\frac{y}{2\sqrt{y}}=\frac{1}{3}\\ \mathbb{E}\left[Y_n\right] &=\mathbb{E}\left[\sum_i^nX_i^2\right] = \sum_i^n\mathbb{E}\left[X_i^2\right]=\frac{n}{3} \end{align} Тепер про нудну частину. Щоб застосувати LOTUS, мені знадобиться pdf …

2
Чи є властивість інваріантності оцінювача ML безглуздою з байєсівської точки зору?
Казелла та Бергер констатують властивість інваріантності оцінювача ML таким чином: Однак мені здається, що вони визначають "ймовірність" ηη\eta повністю ad ​​hoc та безглуздо: Якщо я застосую основні правила теорії ймовірностей до простого випадку η=τ(θ)=θ2η=τ(θ)=θ2\eta=\tau(\theta)=\theta^2, Я натомість отримую наступне: L ( η| x)=p(x |θ2= η) = p ( x | θ …

1
Варіантний термін у зміщенно-дисперсійному розкладі лінійної регресії
У "Елементах статистичного навчання" вираз для розкладання дисперсійної дисперсії лінійної моделі дається як де - фактична цільова функція, - дисперсія випадкової помилки в моделі і - лінійний оцінювач .Err(x0)=σ2ϵ+E[f(x0)−Ef^(x0)]2+||h(x0)||2σ2ϵ,Err(x0)=σϵ2+E[f(x0)−Ef^(x0)]2+||h(x0)||2σϵ2,Err(x_0)=\sigma_\epsilon^2+E[f(x_0)-E\hat f(x_0)]^2+||h(x_0)||^2\sigma_\epsilon^2,f(x0)f(x0)f(x_0)σ2ϵσϵ2 \sigma_\epsilon^2y=f(x)+ϵy=f(x)+ϵy=f(x)+\epsilonf^(x)f^(x)\hat f(x)f(x)f(x)f(x) Термін дисперсії мене тут хвилює, оскільки з рівняння випливає, що дисперсія буде нульовою, якщо цілі безшумні, тобтоАле для …

1
Виявлені високомірні, співвідносні дані та основні характеристики / коваріати; тестування множинних гіпотез?
У мене є набір даних з близько 5000 часто співвідносних функцій / коваріатів та двійкової відповіді. Дані мені дали, я не збирав їх. Я використовую Lasso і градієнтний прискорення для створення моделей. Я використовую ітераційну, вкладену перехресну перевірку. Я повідомляю про найбільші (абсолютні) коефіцієнти 40 Лассо та 40 найважливіших особливостей …

2
Підсилення навчання в нестаціонарному середовищі [закрито]
Закрито . Це питання має бути більш зосередженим . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно зосередило увагу на одній проблемі лише редагуючи цю публікацію . Закрито 22 дні тому . Q1: Чи існують загальноприйняті або прийняті методи поводження з нестаціонарним середовищем у навчанні підкріплення …


4
Чи можливо розкласти встановлені залишки на зміщення та дисперсію після встановлення лінійної моделі?
Я б хотів класифікувати точки даних як або потребують більш складної моделі, або не потребують більш складної моделі. Моє сучасне мислення полягає в тому, щоб підключити всі дані до простої лінійної моделі та дотримуватися розмір залишків, щоб зробити цю класифікацію. Потім я почитав про зміщення та вкладення дисперсії в помилку …

1
Допоможіть інтерпретувати дані підрахунку GLMM за допомогою lme4 glmer та glmer.nb - Від'ємний біном на проти Пуассона
У мене є деякі питання щодо специфікації та інтерпретації GLMM. 3 питання, безумовно, статистичні, а 2 - конкретніше про Р. Я публікую тут, оскільки, зрештою, я думаю, що це інтерпретація результатів ГЛМ. На даний момент я намагаюся вписатись в GLMM. Я використовую дані перепису США з Бази даних про поздовжні …

2
Якщо я хочу мати 95% шансів на те, що менше 1% об'єктів несправні, скільки зразків мені потрібно?
Мені потрібно переконатися, що моя карта XML містить менше ніж 1%1%1\%сміття (розірвані ланки). Список URL-адрес є сотнями тисяч, і навіть якщо це можливо, протестувати їх усі 1 на 1, я б краще, з багатьох причин: 1 - Saved bandwidth 2 - Faster traffic for real clients 3 - Less noise …

1
Чому достовірний інтервал Байєса в цій поліноміальній регресії зміщений, тоді як інтервал довіри правильний?
Розглянемо сюжет нижче, в якому я моделював дані наступним чином. Ми дивимось на двійковий результат для якого справжня ймовірність дорівнює 1 позначена чорною лінією. Функціональний взаємозв'язок між коваріатним і p (y_ {obs} = 1 | x) - поліном 3-го порядку з логістичним зв’язком (тому він є нелінійним у подвійному напрямку).уo …

1
Адаптивна GAM згладжує в мгц
Книга Саймона Вуда про GAM та пов'язаний з ним пакет Rc mgcv є дуже детальними та інформативними, коли мова йде про теорію GAM та пристосування моделі до реальних та імітованих даних. Що стосується 1D гладких, насправді не варто турбуватися, окрім того, як вирішити, чи реалізовувати циклічні та адаптивні основні функції, …
9 r  mgcv 

1
Чи можемо ми зробити висновок з
Ну, ми не можемо побачити, наприклад, https://en.wikipedia.org/wiki/Subindependence для цікавого контрприкладу. Але справжнє запитання: чи є якийсь спосіб посилити умову, щоб випливала незалежність? Наприклад, чи є якийсь набір функційg1,…,gng1,…,gng_1, \dotsc, g_n так що якщо Egi(X)gj(Y)=Egi(X)Egj(Y)E⁡gi(X)gj(Y)=E⁡gi(X)E⁡gj(Y)\E g_i(X) g_j(Y) =\E g_i(X) \E g_j(Y) для усіх i,ji,ji,jто незалежність слідує? І наскільки великим повинен бути …

2
GAMM з нульовими показниками
Чи можливо встановити GAMM (Узагальнену аддитивну змішану модель) для даних, що завищують нуль у R? Якщо ні, то чи можна встановити GAM (Узагальнену модель добавок) для нульових завищених даних з негативним біноміальним або квазі-розподілом Пуассона в R? (Я знайшов COZIGAM :: zigam і mgcv: ziP функції для розповсюдження Пуассона)

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.