Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Чи є випадкові лісові та підсилювальні параметричні чи непараметричні?
Читаючи чудове статистичне моделювання: Дві культури (Брейман 2001) , ми зможемо використати всю різницю між традиційними статистичними моделями (наприклад, лінійною регресією) та алгоритмами машинного навчання (наприклад, Baging, Random Forest, Boosted дерева ...). Брейман критикує моделі даних (параметричні), оскільки вони ґрунтуються на припущенні, що спостереження породжуються відомою формальною моделлю, призначеною статистиком, …

1
Питання, що стосується леми Бореля-Кантеллі
Примітка: Лорма Борель-Кантеллі говорить про це ∑n=1∞P(An)<∞⇒P(limsupAn)=0∑n=1∞P(An)<∞⇒P(limsupAn)=0\sum_{n=1}^\infty P(A_n) \lt \infty \Rightarrow P(\lim\sup A_n)=0 ∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1\sum_{n=1}^\infty P(A_n) =\infty \textrm{ and } A_n\textrm{'s are independent} \Rightarrow P(\lim\sup A_n)=1 Потім, якщо ∑n=1∞P(AnAcn+1)<∞∑n=1∞P(AnAn+1c)<∞\sum_{n=1}^\infty P(A_nA_{n+1}^c )\lt \infty за допомогою леми Бореля-Кантеллі Я хочу це показати по-перше, limn→∞P(An)limn→∞P(An)\lim_{n\to \infty}P(A_n) …

3
Взаємозв'язок між сумою гауссових RV та гауссової суміші
Я знаю, що сума гауссів - це гаусси. Отже, чим відрізняється суміш гауссів? Я маю на увазі, що суміш гауссів - це лише сума гауссів (де кожен гаусс множиться на відповідний коефіцієнт змішування) так?

1
Що це означає, якщо медіана або середня сума більша за суму доданих?
Я аналізую розподіл затримки в мережі. Середній час завантаження (U) становить 0,5 с. Середній час завантаження (D) - 2 секунди. Однак середній загальний час (для кожної точки даних T = U + D) становить 4s. Які висновки можна зробити, знаючи, що медіана суми набагато більша за суму медіани доданків? Щось …

1
Об'єктивний оцінювач регресії для досягнення кращих результатів, ніж неупереджений у Моді помилок змінних
Я працюю над деякими синтатичними даними для моделі Error In Variable для деяких досліджень. В даний час у мене є одна незалежна змінна, і я припускаю, що знаю дисперсію для справжнього значення залежної змінної. Отже, за допомогою цієї інформації я можу досягти неупередженого оцінки коефіцієнта залежної змінної. Модель: y=0,5x-10+e2x~=x+e1x~=x+e1\tilde{x} = …

1
Параметри проти прихованих змінних
Я раніше про це запитував і справді боровся з визначенням того, що робить параметр моделі, а що робить його прихованою змінною. Отож, дивлячись на різні теми на цій темі на цьому сайті, головна відмінність виглядає так: Латентні змінні не спостерігаються, але мають пов'язаний з ними розподіл ймовірностей, оскільки вони є …

3
Чому слід
У моделі ми могли б оцінити за допомогою звичайного рівняння:y=Xβ+ϵy=Xβ+ϵ{y} = X \beta + \epsilonββ\beta у =Х β .β^=(X′X)−1X′y,β^=(X′X)−1X′y,\hat{\beta} = (X'X)^{-1}X'y, і ми могли б отриматиy^=Xβ^.y^=Xβ^.\hat{y} = X \hat{\beta}. Вектор залишків оцінюється за ϵ^=y−Xβ^=(I−X(X′X)−1X′)y=Qy=Q(Xβ+ϵ)=Qϵ,ϵ^=y−Xβ^=(I−X(X′X)−1X′)y=Qy=Q(Xβ+ϵ)=Qϵ,\hat{\epsilon} = y - X \hat{\beta} = (I - X (X'X)^{-1} X') y = Q y = …

1
Аддитивна помилка або мультиплікативна помилка?
Я порівняно новачок у статистиці і буду вдячний допомогти зрозуміти це краще. У моєму полі є поширена модель форми: Pt=Po(Vt)αPt=Po(Vt)αP_t = P_o(V_t)^\alpha Коли люди підходять моделі до даних, вони зазвичай лінеаризують її та відповідають наступному log(Pt)=log(Po)+αlog(Vt)+ϵlog⁡(Pt)=log⁡(Po)+αlog⁡(Vt)+ϵ\log(P_t) = \log(P_o) + \alpha \log(V_t) + \epsilon Чи це добре? Я десь читав, що …


2
Чим відрізняється вибір функції та зменшення розмірності?
Я знаю, що і вибір функції, і зменшення розмірності спрямовані на зменшення кількості ознак у вихідному наборі функцій. Яка точна різниця між ними, якщо ми робимо те саме в обох?

2
Процедура та методи аналізу часових журналів з використанням R
Я працюю над невеликим проектом, де ми намагаємось передбачити ціни на товари (нафта, алюміній, олово тощо) на наступні 6 місяців. У мене є 12 таких змінних, які можна передбачити, і у мене є дані з квітня 2008 р. По травень 2013 р. Як слід робити прогнозування? Я зробив наступне: Імпортовані …

3
Який краще максимальна ймовірність чи гранична ймовірність і чому?
Виконуючи регресію, якщо йти за визначенням: Яка різниця між частковою ймовірністю, профільною ймовірністю та граничною ймовірністю? що, Максимальна ймовірність Знайти β і θ, що максимізує L (β, θ | дані). Тоді як гранична ймовірність ми інтегруємо θ з рівняння ймовірності, використовуючи той факт, що ми можемо ідентифікувати розподіл ймовірності θ, …

1
Чи зловживання машинним навчанням “обумовлено” та “параметризовано”?
Скажімо, залежить від . Суворо кажучи,ХXXαα\alpha якщо і - обидва випадкові величини, ми могли б написати ;α p ( X ∣ α )ХXXαα\alphaр ( X∣ α )p(X∣α)p(X\mid\alpha) однак, якщо є випадковою змінною і є параметром, ми повинні написати .α p ( X ; α )ХXXαα\alphaр ( X; α )p(X;α)p(X; \alpha) …

1
Випробування на коінтеграцію між двома часовими рядами за допомогою двотактного методу Енгл-Грейнджера
Я прагну перевірити коінтеграцію між двома часовими рядами. Обидві серії мають щотижневі дані тривалістю ~ 3 роки. Я намагаюсь зробити метод Енгл-Грейнджера в два кроки. Мій порядок операцій слідує. Тестуйте кожен часовий ряд на корінь одиниці за допомогою доповненого Dickey-Fuller. Якщо припустити, що обидва мають одиничне коріння, то знайдіть лінійне …

3
Чому порівняно з асимптотичною відносною ефективністю тесту Вілкоксона порівняно з t-тестом Стьюдента для нормально розподілених даних?
Добре відомо, що відносна асимптотична ефективність (ARE) тесту з рангом підписаного Вілкоксоном є порівняно з t- тестом Стьюдента , якщо дані отримані з нормально розподіленої сукупності. Це справедливо як для базового тесту на один зразок, так і для варіанта для двох незалежних зразків (Wilcoxon-Mann-Whitney U). Це також мають тест Круськала-Уолліса …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.