Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Квадратичне програмування та Лассо
Я намагаюся виконати регресію ласо, яка має таку форму: Мінімізуйте вwww(Y−Xw)′(Y−Xw)+λ|w|1(Y−Xw)′(Y−Xw)+λ|w|1(Y - Xw)'(Y - Xw) + \lambda \;|w|_1 З огляду на , мені порадили знайти оптимальне за допомогою квадратичного програмування, яке приймає таку форму:λλ\lambdawww Мінімізуйте in , відповідно доxxx12x′Qx+c′x12x′Qx+c′x\frac{1}{2} x'Qx + c'xAx≤b.Ax≤b.Ax \le b. Тепер я усвідомлюю, що термін повинен …

1
Оцінювач Джеймса-Штейна з неоднаковими варіаціями
Кожне твердження, що я знаходжу оцінника Джеймса-Штейна, передбачає, що випадкові змінні, що оцінюються, мають однакову (і одиничну) дисперсію. Але всі ці приклади також згадують, що оцінювач JS може бути використаний для оцінки величин, що не мають нічого спільного. Приклад вікіпедії - швидкість світла, споживання чаю на Тайвані та вага свиней …

1
Зворотні результати перетворення регресії під час моделювання журналу (y)
Я встановлюю регресію в . Чи справедливо зворотне оцінювання точок перетворення (та інтервалі впевненості / прогнозування) шляхом експоненції? Я не вірю в це, оскільки але хотів думки інших.E [ f ( X ) ] ≠ f ( E [ X ] )журнал( у)log⁡(y)\log(y)Е[ ф( X) ] ≠ f( Є[ X] …

2
Що таке еквівалент lme4 :: lmer тристоронньої повторної міри ANOVA?
Моє запитання засноване на цій відповіді, яка показала, яка lme4::lmerмодель відповідає двостороннім повторним заходам ANOVA: require(lme4) set.seed(1234) d <- data.frame( y = rnorm(96), subject = factor(rep(1:12, 4)), a = factor(rep(1:2, each=24)), b = factor(rep(rep(1:2, each=12))), c = factor(rep(rep(1:2, each=48)))) # standard two-way repeated measures ANOVA: summary(aov(y~a*b+Error(subject/(a*b)), d[d$c == "1",])) # …

1
Байєсське моделювання з використанням багатоваріантного нормального з коваріатом
Припустимо, у вас є пояснювальна змінна де s являє собою задану координату. Ви також маєте змінну відповіді Y = ( Y ( s 1 ) , … , Y ( s n ) ) . Тепер ми можемо поєднати обидві змінні як:X=(X(s1),…,X(sn))X=(X(s1),…,X(sn)){\bf{X}} = \left(X(s_{1}),\ldots,X(s_{n})\right)sssY=(Y(s1),…,Y(sn))Y=(Y(s1),…,Y(sn)){\bf{Y}} = \left(Y(s_{1}),\ldots,Y(s_{n})\right) W(s)=(X(s)Y(s))∼N(μ(s),T)W(s)=(X(s)Y(s))∼N(μ(s),T){\bf{W}}({\bf{s}}) = \left( \begin{array}{ccc}X(s) …

2
Очікування квадратичної гами
Якщо розподіл Gamma параметризовано з і β , то:αα\alphaββ\beta E( Γ ( α,β) ) =αβE(Γ(α,β))=αβ E(\Gamma(\alpha, \beta)) = \frac{\alpha}{\beta} Я хотів би порахувати очікування гамми в квадраті, тобто: Е( Γ ( α , β)2) = ?Е(Γ(α,β)2)=? E(\Gamma(\alpha, \beta)^2) = ? Я думаю, що це: Е( Γ ( α , β)2) …

1
Коли виправити значення p у кількох порівняннях?
Боюся, що відповідні запитання не відповіли на моє. Ми оцінюємо продуктивність> 2 класифікаторів (машинне навчання). Наша гіпотеза Нуля полягає в тому, що продуктивність не відрізняється. Для оцінки цієї гіпотези ми виконуємо параметричні (ANOVA) та непараметричні (Фрідман) тести. Якщо вони значущі, ми хочемо з’ясувати, які класифікатори розрізняються в ході квесту. Моє …

1
Чи підходить завантажувальна програма для цих постійних даних?
Я повний новачок :) Я роблю дослідження з розміром вибірки 10 000 від населення близько 745 000. Кожен зразок являє "відсоткову схожість". Переважна більшість зразків становить приблизно 97% -98%, але кілька - від 60% до 90%, тобто розподіл сильно негативно перекошений. Приблизно 0,6% результатів становлять 0%, але вони будуть розглянуті …

1
Багаторазове порівняння в непараметричному тесті
Я працюю з набором даних, який не є параметричним і має 12 процедур. Я провів тест Крускала-Уолліса і отримав значну значення, і тепер я хотів би провести процедуру численних порівнянь, щоб побачити, який із способів лікування суттєво відрізняється. Існує багато інформації щодо цієї теми, але я не знайшов нічого, що …

2
Як кількісно оцінити відносну змінну важливість логістичної регресії з точки зору p?
Припустимо, модель логістичної регресії використовується для прогнозування того, чи придбає інтернет-покупець товар (результат: покупка), після того, як він натиснув набір рекламних оголошень в Інтернеті (предиктори: Ad1, Ad2 та Ad3). Результатом є двійкова змінна: 1 (придбана) або 0 (не придбана на замовлення). Провісниками є також двійкові змінні: 1 (натиснуто) або 0 …

1
Вибір моделі в режимі офлайн та онлайн-навчання
Останнім часом я намагаюся дізнатися більше про онлайн-навчання (це абсолютно захоплююче!), І одна тема, яку мені не вдалося зрозуміти, - як думати про вибір моделі в офлайні та в Інтернеті. В Зокрема, припустимо , що ми тренуємо класифікатор в автономному режимі, на основі деякого фіксованого набору даних . Скажімо, його …

3
GLM з безперервними даними, накопиченими в нулі
Я намагаюся запустити модель, щоб оцінити, наскільки добре катастрофічні захворювання, такі як туберкульоз, СНІД тощо, впливають на витрати на госпіталізацію. Я маю "затрати на госпіталізацію" як залежну змінну та різні індивідуальні маркери як незалежні змінні, майже всі з яких є манекенами, такими як стать, голова домогосподарства, статус бідності і, звичайно, …

6
Методи в R або Python для вибору функції в непідконтрольному навчанні [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 2 роки тому . Які доступні методи / реалізація в R / Python для відмови / вибору неважливих / важливих функцій у даних? Мої дані не …

1
Надійна оцінка куртозу?
Я використовую звичайний оцінювач для , але я помітивщо навіть невеликі «викиди» в моєму емпіричному розподілі, тобто невеликі піки далеко від центру, впливаютьйого надзвичайно. Чи є надійніший оцінювач куртозу?K^=μ^4σ^4K^=μ^4σ^4\hat{K}=\frac{\hat{\mu}_4}{\hat{\sigma}^4}

3
Які проблеми з використанням процентного результату в лінійній регресії?
У мене є дослідження, в якому багато результатів представлені як відсотки, і я використовую кілька лінійних регресій для оцінки впливу деяких категоричних змінних на ці результати. Мені було цікаво, оскільки лінійна регресія припускає, що результат - це постійний розподіл, чи існують методологічні проблеми у застосуванні такої моделі до відсотків, які …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.