Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Чи дозволено використовувати середні показники на наборі даних для поліпшення співвідношення?
У мене є набір даних із залежною та незалежною змінною. Обидва - це не часовий ряд. У мене 120 спостережень. Коефіцієнт кореляції 0,43 Після цього розрахунку я додав стовпчик для обох змінних із середнім значенням на кожні 12 спостережень, у результаті чого з’явилися 2 нові колонки зі 108 спостереженнями (пари). …

2
Випадкові змінні, для яких нерівності Маркова, Чебишева є жорсткими
Мені цікаво побудувати випадкові величини, для яких нерівності Маркова чи Чебишева є жорсткими. Тривіальним прикладом є наступна випадкова величина. P(X=1)=P(X=−1)=0.5П(Х=1)=П(Х=-1)=0,5P(X=1)=P(X=-1) = 0.5. Його середнє значення дорівнює нулю, дисперсія - 1 іP(|X| ≥1)=1П(|Х|≥1)=1P(|X| \ge 1) = 1. Для цієї випадкової змінної чебишев є тісним (тримається з рівністю). P(|X|≥1)≤Var(X)12= 1П(|Х|≥1)≤Вар(Х)12=1P(|X|\ge 1) \le …

1
Лінійна модель, де дані мають невизначеність, використовуючи R
Скажімо, у мене є дані, які мають певну невизначеність. Наприклад: X Y 1 10±4 2 50±3 3 80±7 4 105±1 5 120±9 Характер невизначеності може бути, наприклад, повторними вимірюваннями або експериментами, або невизначеністю вимірювального приладу, наприклад. Я хотів би прилаштувати криву до неї, використовуючи R, те, що зазвичай я б …

2
Регресія на одиничному диску, починаючи з «рівномірно розташованих» зразків
Мені потрібно вирішити складну проблему регресії на одиничному диску. Оригінальне запитання привернуло кілька цікавих коментарів, але на жаль жодної відповіді. Тим часом я дізнався щось більше про цю проблему, тому спробую розділити початкову проблему на підпрограми та побачити, чи мені в цей час пощастить більше. У мене 40 датчиків температури …

1
Інтелектуальне виявлення точки зміни Байєса (граничний прогнозний розподіл)
Я читаю документ про виявлення змін Байєса в Інтернеті від Адама та Маккея ( посилання ). Автори починають із написання граничного прогнозного розподілу: деП(хt + 1|х1 : т) =∑rтП(хт+ 1|rт,х( r)т)П(rт|х1 : т)( 1 )P(xt+1|x1:t)=∑rtP(xt+1|rt,xt(r))P(rt|x1:t)(1) P(x_{t+1} | \textbf{x}_{1:t}) = \sum_{r_t} P(x_{t+1} | r_t, \textbf{x}_t^{(r)}) P(r_t | \textbf{x}_{1:t}) \qquad \qquad (1) …

1
Чи може хтось пояснити, як мені 5 років, цю проблему з ESL Book Hastie?
Я працюю над книгою ESL Hastie, і мені важко займатися питанням 2.3. Питання таке: Ми розглядаємо оцінку найближчого сусіда за початком, і середнє відстань від початку до найближчої точки даних задається цим рівнянням. Я не маю уявлення, з чого почати з точки зору спроб цього вивести. Я знаю, що більшість …

2
Чи вбудовані нуль-усічений Пуассон і базовий Пуассон, чи вкладені чи не вкладені?
Я бачив багато, що обговорює, чи є базовою пуассоновою регресією вкладена версія нульової завищеної пуассонової регресії. Наприклад, цей сайт стверджує, що він є, оскільки останній включає додаткові параметри для моделювання додаткових нулів, але в іншому випадку включає ті самі параметри регресії Пуассона, що і перший, хоча на цю сторінку входить …

1
Як оптимально розподілити нічиї при розрахунку декількох очікувань
Припустимо, ми хочемо обчислити деяке очікування: EYEX|Y[f(X,Y)]EYEX|Y[f(X,Y)]E_YE_{X|Y}[f(X,Y)] Припустимо, ми хочемо наблизити це за допомогою моделювання Монте-Карло. ЕYЕХ| Y[ ф( X, Y) ] ≈1R S∑r = 1R∑s = 1Sf(хr , s,уr)EYEX|Y[f(X,Y)]≈1RS∑r=1R∑s=1Sf(xr,s,yr)E_YE_{X|Y}[f(X,Y)] \approx \frac1{RS}\sum_{r=1}^R\sum_{s=1}^Sf(x^{r,s},y^r) Але припустимо , що це дорого брати проби з обох розподілів, так що ми тільки можемо собі дозволити …

6
Я хотів би дізнатися про теорію ймовірностей, теорію вимірювань та нарешті машинне навчання. З чого я починаю? [зачинено]
Закрито . Це питання має бути більш зосередженим . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно зосередило увагу на одній проблемі лише редагуючи цю публікацію . Закрито 3 роки тому . Я хотів би дізнатися про теорію ймовірностей, теорію вимірювань та нарешті машинне навчання. Моя …

1
Олімпіада - Угорщина має золото з двозначною цифрою? (Відносна кількість населення)
Я створив веб-сторінку, яка містить результати олімпійських медалей у реальному часі від Thompson Reuters та підрахунків населення у цілому від ЦРУ. Результати мені цікаві - Угорщина має двозначну лідируючу позицію у золотих медалях за рештою світу. Крім того, США та Китай майже у кожній категорії. Моє запитання - чи я …

1
Як працює лінійна база, яка навчається, у стимуляції? І як це працює в бібліотеці xgboost?
Я знаю, як реалізувати лінійну цільову функцію та лінійні прискорення в XGBoost. Моє конкретне питання: коли алгоритм підходить до залишкового (або від'ємного градієнта), це використання однієї функції на кожному кроці (тобто універсарна модель) або всіх функцій (багатоваріантна модель)? Будь-яке посилання на документацію про лінійні підсилення в XGBoost буде оцінено. EDIT: …

1
Найпростіший спосіб знайти
Розглянемо 3 зразки iid, отримані з рівномірного розподілу , де параметр . Я хочу знайти де є порядком статистики .u ( θ , 2 θ )u(θ,2θ)u(\theta, 2\theta)θθ\thetaE [Х( 2 )|Х( 1 ),Х( 3 )]E[X(2)|X(1),X(3)] \mathbb{E}\left[X_{(2)}| X_{(1)}, X_{(3)}\right] Х( i )X(i)X_{(i)}iii Я б очікував, що результат буде Але єдиний спосіб, коли …

3
Коли (і чому) баєси відкидають чинні байєсівські методи? [зачинено]
Закрито . Це питання потребує деталей або ясності . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Додайте деталі та уточніть проблему, відредагувавши цю публікацію . Закрито 3 роки тому . З того, що я прочитав, і з відповідей на інші запитання, які я тут задав, багато так званих частістських …

2
Моделювання крикетів для вигулу крикетів, що витягують летючих мит
У мене є набір даних, в якому детально описується велика кількість ігор з крикетом (кілька тисяч). У крикет "котелки" кілька разів кидають м'яч підряд "летючі миші". Купальник намагається витягнути летючого митця "назовні". У цьому відношенні він досить схожий на глечики та клярі в бейсболі. Якби я взяв цілий набір даних …

1
Розподіл квадратичної форми нормалей
Я намагаюся з’ясувати розподіл де , тобто я знаю, що, беручи кожен із членів окремо, і Але я не впевнений у розподілі (*)(n−1)∑i=1nZ2i−(∑i=1nZi)2(∗)(n−1)∑i=1nZi2−(∑i=1nZi)2(∗) (n-1) \sum_{i=1}^n Z_i^2 - \left( \sum_{i=1}^n Z_i \right)^2 \qquad (*) Zi∼N(0,1)Zi∼N(0,1)Z_i \sim \mathcal{N}(0,1)∑i=1nZ2i∼χ2(n)∑i=1nZi2∼χ2(n) \sum_{i=1}^n Z_i^2 \sim \chi^2(n) 1n(∑i=1nZi)2∼χ2(1).1n(∑i=1nZi)2∼χ2(1). \frac{1}{n}\left( \sum_{i=1}^n Z_i \right)^2 \sim \chi^2(1).

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.