Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
моделювання випадкових вибірок із заданим MLE
Це перехресне підтверджене запитання про моделювання вибірки, що обумовлює наявність фіксованої суми, нагадало мені проблему, яку поставив мені Джордж Казелла . f(x|θ)f(x|θ)f(x|\theta)(X1,…,Xn)(X1,…,Xn)(X_1,\ldots,X_n)θθ\thetaθ^(x1,…,xn)=argmin∑i=1nlogf(xi|θ)θ^(x1,…,xn)=arg⁡min∑i=1nlog⁡f(xi|θ)\hat{\theta}(x_1,\ldots,x_n)=\arg\min \sum_{i=1}^n \log f(x_i|\theta)θθ\theta(X1,…,Xn)(X1,…,Xn)(X_1,\ldots,X_n)θ^(X1,…,Xn)θ^(X1,…,Xn)\hat{\theta}(X_1,\ldots,X_n) Наприклад, візьміть розподіл з параметром розташування , щільність якого Якщо як ми можемо імітувати умовно на ? У цьому прикладі розподіл не має виразу закритої …

1
Що таке розмір VC дерева рішень?
Який розмір VC дерева рішень з k розбивається на два виміри? Скажімо, модель CART, і єдині дозволені розколи паралельні осям. Отже, за один розкол ми можемо замовити 3 бали в трикутнику, а потім для будь-якого маркування точок ми могли б отримати ідеальний прогноз (тобто: розбиті точки) А як щодо 2-х …


4
Чи існує "прокляття розмірності" насправді в реальних даних?
Я розумію, що таке "прокляття розмірності", і я зробив деякі проблеми з оптимізацією високих розмірів і знаю виклик експоненціальних можливостей. Однак я сумніваюся, чи існує "прокляття розмірності" у більшості даних реального світу (ну давайте на хвилину відкладемо зображення чи відео, я думаю про такі дані, як демографічні дані про клієнта …

3
Чому матрична норма за замовчуванням - це спектральна норма, а не норма Фробеніуса?
Для векторної норми норма L2 або "евклідова відстань" є широко використовуваним та інтуїтивним визначенням. Але чому для матриці "найбільш використовуваним" або "стандартним" визначенням норми є спектральна норма , але не норма Фробеніуса (яка аналогічна нормі L2 для векторів)? Чи має це щось спільне з ітераційними алгоритмами / матричними потужностями (якщо …

1
Як ставитись до категоричних прогнозів у LASSO
Я запускаю LASSO, який має деякі категоричні прогнози змінних і деякі безперервні. У мене питання щодо категоричних змінних. Перший крок, який я розумію, - це розбити кожного з них на манекени, стандартизувати їх для справедливої ​​штрафу, а потім регресувати. Існує кілька варіантів для обробки фіктивних змінних: Включіть усі, крім однієї, …

2
Яке відношення стоїть перед Джефріс Пріором та трансформацією, що стабілізує дисперсію?
Я читав про Джеффрі до Вікіпедії: Джефріс Пріор і бачив, що після кожного прикладу він описує, як трансформація, що стабілізує дисперсію, перетворює Джефріса до рівномірного. Як приклад для випадку Бернуллі, він стверджує, що для монети, яка є головами з ймовірністю γ∈[0,1]γ∈[0,1]\gamma \in [0,1] , випробувальна модель Бернуллі виводить, що до …

1
Чи BIC намагається знайти справжню модель?
Це питання - це подальше спостереження або спроба вияснити можливу плутанину щодо теми, яку я та багато інших вважають дещо складними щодо різниці між АПК та BIC. У дуже приємній відповіді на цю тему @Dave Kellen ( /stats//a/767/30589 ) ми читаємо: Ваше запитання означає, що AIC та BIC намагаються відповісти …

5
Розуміння, які особливості були найважливішими для логістичної регресії
Я створив класифікатор логістичної регресії, який є дуже точним для моїх даних. Тепер я хочу краще зрозуміти, чому це так добре працює. Зокрема, я хотів би оцінити, які функції роблять найбільший внесок (які функції є найважливішими) і, в ідеалі, кількісно оцінити, наскільки кожна функція сприяє точності загальної моделі (або чогось …

1
Оновлення розкладання SVD після додавання одного нового рядка до матриці
Припустимо, у мене щільна матриця розміром m × n , при розкладі SVD A = U S V ⊤ . У можна обчислити СВД наступним чином : .AA \textbf{A}m×nm×nm \times nA=USV⊤.A=USV⊤.\mathbf{A}=\mathbf{USV}^\top.Rsvd(A) Якщо до A додати новий -й ряд , чи можна обчислити нове розкладання SVD на основі старого (тобто, використовуючи …

3
Який алгоритм оптимізації використовується у функції glm в R?
Можна виконати логіт-регресію в R, використовуючи такий код: > library(MASS) > data(menarche) > glm.out = glm(cbind(Menarche, Total-Menarche) ~ Age, + family=binomial(logit), data=menarche) > coefficients(glm.out) (Intercept) Age -21.226395 1.631968 Схоже, алгоритм оптимізації зблизився - є інформація про номер кроків алгоритму оцінки рибалки: Call: glm(formula = cbind(Menarche, Total - Menarche) ~ Age, …

2
Неможлива проблема оцінки?
Питання Дисперсія негативного біноміального розподілу (NB) завжди більша за середню. Коли середнє значення вибірки більше, ніж його дисперсія, спроба пристосувати параметри НБ з максимальною вірогідністю або з моментом оцінки не вдасться (рішення з кінцевими параметрами не існує). Однак можливо, що вибірка, взята з розподілу НБ, має значення більше, ніж дисперсія. …

2
Кластеризація - інтуїція за теоремою неможливості Кляйнберга
Я думав над тим, щоб написати публікацію в блозі про цей цікавий аналіз Клейнберга (2002), який досліджує труднощі кластеризації. Кляйнберг окреслює три, здавалося б, інтуїтивні дезидерати для функції кластеризації, а потім доводить, що такої функції не існує. Існує багато алгоритмів кластеризації, які задовольняють два з трьох критеріїв; однак жодна функція …

2
Чому CDF зразка розподілено рівномірно
Я читав тут , що даний зразок X1,X2,...,XnX1,X2,...,Xn X_1,X_2,...,X_n від безперервного розподілу з cdf FXFX F_X , зразок, відповідний Ui=FX(Xi)Ui=FX(Xi) U_i = F_X(X_i) відповідає стандартному рівномірному розподілу. Я підтвердив це, використовуючи якісні симуляції в Python, і мені було легко переконатись у взаємозв'язку. import matplotlib.pyplot as plt import scipy.stats xs = …
17 pdf  uniform  cdf  intuition 

2
Різниця між LOESS та LOWESS
Яка різниця між БЕЗКОШТОВНИМИ ТА НИЗМИМИ? З Вікіпедії я можу лише бачити, що ЛОСС - це узагальнення НИСЬОГО. Чи мають вони трохи інші параметри?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.