Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Що можна сказати про моделі даних спостережень за відсутності інструментів?
У минулому мені було задано ряд питань, що стосуються опублікованих праць у ряді областей, де регресії (і пов'язані з ними моделі, такі як моделі панелей або GLM) використовуються для даних спостережень (тобто даних, не отриманих контрольованим експериментом , у багатьох випадках - але не завжди - дані, які спостерігаються з …

1
Розуміння використання логарифмів у логарифмі TF-IDF
Я читав: https://en.wikipedia.org/wiki/Tf%E2%80%93idf#Definition Але я не можу точно зрозуміти, чому формула була побудована такою, якою вона є. Що я розумію: iDF повинен на якомусь рівні вимірювати, як часто термін S з'являється в кожному з документів, зменшуючи значення, оскільки термін з'являється частіше. З цієї точки зору iDF(S)=# of Documents# of Documents …

1
Знайдіть унікальний MVUE
Це питання пов'язане із вступом Роберта Хогга до математичної статистики 6-ї версії проблеми 7.4.9 на сторінці 388. Нехай X1,...,XnX1,...,XnX_1,...,X_n бути IID з PDF - f(x;θ)=1/3θ,−θ<x<2θ,f(x;θ)=1/3θ,−θ<x<2θ,f(x;\theta)=1/3\theta,-\theta0 . (А) Знайти ОМП & thetas з & thetasθ^θ^\hat{\theta}θθ\theta (Б) є чи θ достатньою для статистики & thetas ? Чому?θ^θ^\hat{\theta}θθ\theta (С) (n+1)θ^/n(n+1)θ^/n(n+1)\hat{\theta}/n унікальний MVUE з …

4
Як називається ця схема
Хтось може мені сказати, як називається цей тип діаграм (якщо вони є)? Чи може хто-небудь запропонувати будь-які інструменти, як би просто не було, побудувати таку діаграму?

1
Управління високою автокореляцією в MCMC
Я будую досить складну ієрархічну байєсівську модель для мета-аналізу з використанням R та JAGS. Дещо спрощуючи, два ключових рівні моделі мають де - це е спостереження кінцева точка (в даному випадку ГМ проти врожайності генетично модифікованих культур) у дослідженні , - ефект для дослідження , s - ефекти для різних …

1
Чому прогнозування моделей ARMA виконується фільтром Kalman
Які переваги виражати модель ARMA як модель простору стану та робити прогнозування за допомогою фільтра Калмана? Ця методологія, наприклад, використовується в реалізації SARIMAX реалізації моделей python-stats: https://github.com/statsmodels/statsmodels/tree/master/statsmodels/tsa/statespace

1
Чому система рейтингу Elo використовує неправильне правило оновлення?
Система рейтингів Elo використовує алгоритм мінімізації градієнта спуску функції перехресної ентропії втрат між очікуваною та спостережуваною ймовірністю результату в парних порівняннях. Ми можемо записати загальні функції втрат як E=−∑n,ipiЛ о г( qi)E=−∑n,ipiLog(qi) E=-\sum_{n,i} p_i Log (q_i) де сума виконується за всіма результатами та всіма противниками n . p i - …


2
Коли наближаються наближення ряду Тейлора до очікувань (цілих) функцій?
Візьмемо очікування форми для деякої одновимірної випадкової величини і цілої функції (тобто інтервал конвергенції - це вся реальна лінія)E(f(X))E(f(X))E(f(X))XXXf(⋅)f(⋅)f(\cdot) У мене є функція, що генерує момент для і тому я можу легко обчислити цілі моменти. Скористайтеся рядом Тейлора навколо а потім застосуйте очікування у частині серії центральних моментів, = f …

1
Як я можу порівняти 2 засоби, які розподіляються Лапласом?
Я хочу порівняти 2 вибіркові засоби для повернення на 1 хвилину. Я припускаю, що вони розподілені Лапласом (вже перевірені), і я розділив прибутки на 2 групи. Як я можу перевірити, чи вони суттєво відрізняються? Я думаю, що я не можу ставитися до них як до нормального розподілу, оскільки, хоча вони …

1
Як працює криптоінтерполяція?
Я працюю над проблемою, в якій мені потрібно використовувати Кригінг для прогнозування значення деяких змінних на основі деяких оточуючих змінних. Я хочу сам реалізувати його код. Отже, я переглянув занадто багато документів, щоб зрозуміти, як це працює, але я так сильно розгубився. Як правило, я розумію, що його середньозважене значення, …

1
Чому всі компоненти PLS разом пояснюють лише частину дисперсії вихідних даних?
У мене є набір даних, що складається з 10 змінних. Я провів часткові найменші квадрати (PLS), щоб передбачити єдину змінну відповіді на цих 10 змінних, вилучив 10 компонентів PLS, а потім обчислив дисперсію кожного компонента. За вихідними даними я взяв суму дисперсій усіх змінних, яка дорівнює 702. Потім я розділив …

1
Чому вибіркова частка також не має біноміального розподілу
У двочленних умовах випадкова величина X, яка дає кількість успіхів, розподілена біноміально. Частка вибірки може бути обчислена як де - ваш розмір вибірки. Мій підручник говорить про цеXнXн\frac{X}{n}ннn Ця частка не має біноміального розподілу однак, оскільки є просто масштабованою версією біноміально розподіленої випадкової величини , чи не має вона також …

1
Модельні матриці для моделей змішаних ефектів
У lmerфункції всередині lme4в Rє виклик для побудови матричної моделі випадкових ефектів ZZZ , як пояснено тут , на сторінках 7 - 9. Обчислення ZZZ тягне за собою продукти ХатріРао та / або Кронекера з двох матриць, JiJiJ_i та ХiХiX_i . Матриця JiJiJ_i є виразною: "Показникова матриця групування факторних індексів", …

2
Чи вагома залежність від точності (тобто зворотної дисперсії) є невід'ємною частиною мета-аналізу?
Чи точне зважування є основним для мета-аналізу? Боренштейн та ін. (2009) пишуть, що для мета-аналізу можливим є все необхідне: Дослідження повідомляють про бальну оцінку, яка може бути виражена як одне число. Для цієї бальної оцінки може бути обчислена варіація. Мені не відразу зрозуміло, чому (2) суворо необхідний. Дійсно, всі широко …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.