Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Як оцінити параметри для усіченого розподілу Zipf з вибірки даних?
У мене проблема з параметром оцінки для Zipf. Моя ситуація така: У мене є вибірковий набір (вимірюється експериментом, який генерує дзвінки, які повинні слідувати розподілу Zipf). Я повинен продемонструвати, що цей генератор дійсно генерує дзвінки з розподілом zipf. Я вже читав це запитання і відповіді Як розрахувати коефіцієнт закону Зіпфа …

4
Як я можу оцінити щільність нульового завищеного параметра в R?
У мене є набір даних з великою кількістю нулів, який виглядає приблизно так: set.seed(1) x <- c(rlnorm(100),rep(0,50)) hist(x,probability=TRUE,breaks = 25) Я хотів би намалювати лінію за її щільністю, але density()функція використовує рухоме вікно, яке обчислює негативні значення x. lines(density(x), col = 'grey') Є density(... from, to)аргументи, але вони, здається, лише …
10 r  probability  kde 

2
Який метод ядра дає найкращі ймовірні результати?
Нещодавно я використовував Платт-масштабування SVM-виходів для оцінки ймовірностей подій за замовчуванням. Більше прямих альтернатив, здається, "логістична регресія ядра" (KLR) та пов'язана з цим "Імпортна векторна машина". Хто-небудь може сказати, який метод ядра, що дає ймовірні результати, є сучасним рівнем? Чи існує R-реалізація KLR? Велике спасибі за вашу допомогу!

3
Оцінка експоненціальної моделі
Експоненціальна модель - це модель, описана наступним рівнянням: yi^=β0⋅eβ1x1i+…+βkxkiyi^=β0⋅eβ1x1i+…+βkxki\hat{y_{i}}=\beta_{0}\cdot e^{\beta_{1}x_{1i}+\ldots+\beta_{k}x_{ki}} Найбільш розповсюджений підхід для оцінки такої моделі - лінеаризація, яку можна легко здійснити шляхом обчислення логарифмів обох сторін. Які інші підходи? Мене особливо цікавлять ті, з якими в деяких спостереженнях може працювати .yi=0yi=0y_{i}=0 Оновлення 31.01.2011 Мені відомо, що ця модель …

5
Створити випадкові багатовимірні значення з емпіричних даних
Я працюю над функцією Монте-Карло для оцінки кількох активів з частково корельованою віддачею. В даний час я просто генерую коваріаційну матрицю і подаю на rmvnorm()функцію в Р. (Створює корельовані випадкові значення.) Однак, дивлячись на розподіл прибутку активу, він зазвичай не розподіляється. Це дійсно питання з двох частин: 1) Як я …
10 mcmc  monte-carlo  pdf 

3
R пакет для комбінування рівнів факторів для обміну даними?
Цікаво, чи хтось перебігав пакет / функцію в R, який буде поєднувати рівні фактора, частка яких у всіх коефіцієнтах менша за деякий поріг? Зокрема, одним із перших етапів підготовки даних, який я веду, є згуртування рідких рівнів факторів разом (скажімо, на рівень, який називається "Інше"), які не складають принаймні 2% …

3
Ресурси для вивчення фальшивої регресії часових рядів
"Помилкова регресія" (в контексті часових рядів) і пов'язані з ними терміни, такі як одиничні кореневі тести - це те, про що я багато чув, але ніколи не розумів. Чому / коли інтуїтивно це відбувається? (Я вважаю, що це коли ваші два часові ряди спільно інтегруються, тобто деяка лінійна комбінація обох …

1
У R, чи відповідає "glmnet" перехоплення?
Мені підходить лінійна модель в R, використовуючи glmnet. Оригінальна (нерегульована) модель була пристосована з використанням lmі не мала постійного терміну (тобто вона була у формі lm(y~0+x1+x2,data)). glmnetприймає матрицю предикторів та вектор відповідей. Я читав glmnetдокументацію і не можу знайти згадки про постійний термін. Отже, чи є спосіб попросити glmnetпримусити лінійне …
10 r  regression  lasso 


4
Поради та рекомендації для початку статистичного моделювання?
Я працюю в галузі видобутку даних і мало офіційне навчання статистики. Останнім часом я читав багато робіт, присвячених байєсівським парадигмам для вивчення та видобутку, які мені здаються дуже цікавими. Моє запитання: (у кількох частинах), враховуючи проблему, чи існує загальна рамка, за якою можна побудувати статистичну модель? Які перші дії ви …

1
Різниця між GLS та SUR
Я читав дещо про узагальнені найменші квадрати (GLS) і намагався прив’язати його до мого основного економетричного фону. Я пригадую, як в середній школі використовували начебто непов'язану регресію (SUR), яка дещо схожа на GLS. Один документ, на який я натрапив, навіть назвав SUR «особливим випадком» GLS. Але я все ще не …

1
Перекласти R на C ++ (зрештою, за допомогою Rcpp) [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 2 роки тому . Я хотів би навчитися використовувати Rcpp . Я переглянув документи на веб-сайті CRAN пакету, але мені здається, що робота над практичним прикладом …
10 r  c++ 

2
Хі-квадратний тест на рівність розподілів: скільки нулів він переносить?
Я порівнюю дві групи мутантів, кожна з яких може мати лише один з 21 різних фенотипів. Я хотів би побачити, чи розподіл цих результатів подібний між двома групами. Я знайшов онлайн-тест, який розраховує "тест-квадрат на рівність розподілів" і дає мені певні результати. Однак у мене в цій таблиці досить багато …

1
Кластерний аналіз з подальшим дискримінантним аналізом
Яке обґрунтування, якщо воно є, використовувати дискримінантний аналіз (DA) за результатами алгоритму кластеризації, як k-засоби, як я час від часу бачу в літературі (фактично щодо клінічного підтипу психічних розладів)? Як правило, не рекомендується перевіряти групові відмінності на змінних, які використовувались під час побудови кластерів, оскільки вони підтримують максимізацію (мінімізацію відповідної) …

3
Як поводитися з небінарними категоричними змінними в логістичній регресії (SPSS)
Мені доводиться робити бінарну логістичну регресію з безліччю незалежних змінних. Більшість з них є бінарними, але деякі категоричні змінні мають більше двох рівнів. Який найкращий спосіб боротися з такими змінними? Наприклад, для змінної з трьома можливими значеннями я припускаю, що потрібно створити дві фіктивні змінні. Тоді, в процесі поетапної регресії, …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.