Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Обчисліть передбачення випадкових ефектів вручну для лінійної змішаної моделі
Я намагаюся вручну обчислити передбачення випадкових ефектів від лінійної змішаної моделі, і використовуючи позначення, надані Вудом в узагальнених моделях добавок: вступ з R (pg 294 / pg 307 pdf), я заплутався в тому, які параметри кожного представляє. Нижче наведено резюме з Вуду. Визначте лінійну змішану модель Y= Xβ+ Zb + …

1
Як зробити перехресну перевірку cv.glmnet (регресія LASSO в R)?
Мені цікаво, як правильно підійти до навчання та тестування моделі LASSO, використовуючи glmnet в R? Зокрема, мені цікаво, як це зробити, якщо відсутність зовнішнього набору даних тесту потребує використання я перехресної перевірки (або іншого подібного підходу) для тестування моєї моделі LASSO. Дозвольте мені розбити свій сценарій: У мене є лише …

2
Що таке вибірка випадкової величини?
Випадкова величина визначається як вимірювана функція з однієї -алгебра з базовим мірою до іншої -алгебра .σ ( Ω 1 , F 1 ) P σ ( Ω 2 , F 2 )ХXXσσ\sigma( Ω1, F1)(Ω1,F1)(\Omega_1, \mathcal F_1)ПPPσσ\sigma( Ω2, F2)(Ω2,F2)(\Omega_2, \mathcal F_2) Як ми можемо говорити про вибірку цієї випадкової величини? Чи …

1
Чи реалізований пробовідбірник Монте-Карло / MCMC, який може мати справу з ізольованими локальними максимумами заднього розподілу?
Наразі я використовую байєсівський підхід для оцінки параметрів для моделі, що складається з декількох ОР. Оскільки у мене є 15 параметрів для оцінювання, мій пробний простір є 15-мірним, і мій пошук заднього розподілу, здається, має багато локальних максимумів, дуже відокремлених великими регіонами з дуже низькою ймовірністю. Це призводить до проблем …

1
Реплікація результатів для лінійної регресії glmnet за допомогою загального оптимізатора
Як зазначено в заголовку, я намагаюся повторити результати лінійки glmnet, використовуючи оптимізатор LBFGS з бібліотеки lbfgs. Цей оптимізатор дозволяє нам додати термін регулятора L1, не турбуючись про диференційованість, доти, поки наша об'єктивна функція (без терміна регулятора L1) опукла. minβ∈Rp12n∥β0+Xβ−y∥22+αλ∥β∥1+12(1−α)λ∥β∥22minβ∈Rp12n‖β0+Xβ−y‖22+αλ‖β‖1+12(1−α)λ‖β‖22\min_{\beta \in \mathbb{R}^p} \frac{1}{2n}\Vert \beta_0 + X\beta - y \Vert_2^2 + \alpha …

4
Як можна пояснити, що є неупередженим оцінювачем для лайперсона?
Припустимо, є неупередженим оцінювачем для . Тоді звичайно, . ; & thetasE[ & thetas ; |thetas]=thetasθ^θ^\hat{\theta}θθ\thetaЕ [ θ^∣ θ ] = θE[θ^∣θ]=θ\mathbb{E}[\hat{\theta} \mid \theta] = \theta Як пояснити це лайперсону? У минулому я вже говорив, що якщо ви середньо оцінюєте купу значень , оскільки розмір вибірки збільшується, ви отримуєте кращу …

4
різниця між нейронною мережею та глибоким навчанням
З точки зору різниці між нейронною мережею та глибоким навчанням, ми можемо перелічити декілька предметів, таких як включено більше шарів, масивний набір даних, потужне комп'ютерне обладнання, щоб зробити навчання складною моделлю можливою. Окрім них, чи є більш детальне пояснення щодо різниці між NN та DL?

5
Більшість інтерпретованих моделей класифікації
За винятком дерев рішень та логістичної регресії, які інші класифікаційні моделі забезпечують хорошу інтерпретацію? Мене не цікавлять точність чи інші параметри, важлива лише інтерпретація результатів.

2
Чи графічні моделі та машини Больцмана пов'язані математично?
Хоча я фактично займався програмуванням з машинами Больцмана на уроці фізики, я не знайомий з їх теоретичною характеристикою. Навпаки, я знаю скромну кількість про теорію графічних моделей (про перші кілька розділів книги « Графічні моделі» Лаурітцена ). Запитання: Чи є якісь змістовні зв’язки між графічними моделями та машиною Больцмана? Чи …

1
Співвідношення між швидкістю навчання та кількістю прихованих шарів?
Чи є якесь правило між глибиною нейронної мережі та швидкістю навчання? Я помічав, що чим глибше мережа, тим нижчим повинен бути рівень навчання. Якщо це правильно, чому це так?

2
Довідковий запит: Класична статистика для працюючих науковців
Я працюючий науковець з великим досвідом регресії, інших алгоритмів машинного навчання та програмування (як для аналізу даних, так і для загальної розробки програмного забезпечення). Більшу частину мого трудового життя було зосереджено на побудові моделей для прогнозування точності (робота в різних бізнес-обмеженнях) та побудові трубопроводів даних для підтримки моєї власної (та …

3
Коли ви використовуєте PCA, а не LDA в класифікації?
Я читаю цю статтю про різницю між принциповим аналізом компонентів та множинним дискримінантним аналізом (лінійний дискримінантний аналіз), і я намагаюся зрозуміти, чому ви коли-небудь використовуватимете PCA, а не MDA / LDA. Пояснення узагальнено наступним чином: грубо кажучи, в PCA ми намагаємося знайти осі з максимальними відхиленнями, де дані найбільш розповсюджені …

1
Інтервал між полями та інтервалом Тукі-Крамера
Довідковий документ "notch" ( або оригінальний текст ) від boxplot у "R" містить таке: Якщо виїмки двох сюжетів не перетинаються, це є «вагомим доказом» того, що два медіани відрізняються (Chambers et al, 1983, p. 62). Дивіться boxplot.stats для використаних розрахунків. а " boxplot.stats " містить таке: Виїмки (якщо вимагається) поширюються …

2
Порівняйте статистичну значимість різниці між двома поліноміальними регресіями в R
Тому, перш за все, я провів деякі дослідження на цьому форумі, і мені відомо, що вони задавали надзвичайно подібні запитання, але вони, як правило, не відповідають належним чином, або іноді відповідь просто недостатньо детальна, щоб я зрозумів. Тож цього разу моє запитання таке: у мене є два набори даних, на …

1
Як отримати "власні значення" (відсотки поясненої дисперсії) векторів, які не є власними векторами PCA?
Мені хотілося б зрозуміти, як я можу отримати відсоток дисперсії набору даних не в просторі координат, наданому PCA, а на дещо іншому наборі (повернутих) векторів. set.seed(1234) xx <- rnorm(1000) yy <- xx * 0.5 + rnorm(1000, sd = 0.6) vecs <- cbind(xx, yy) plot(vecs, xlim = c(-4, 4), ylim = …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.