Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Варіаційні Бейс поєднується з Монте-Карло
Я читаю на варіанті Байєса, і, як я це розумію, зводиться до думки, яку ви наближаєте p ( z∣ x )p(z∣x)p(z\mid x) (де zzz є прихованими змінними вашої моделі та хxx спостережувані дані) з функцією q(z)q(z)q(z), роблячи припущення, що qqq факторизує як qi(zi)qi(zi)q_i(z_i) де ziziz_iє підмножиною прихованих змінних. Тоді може …

1
Похідне від поперечної втрати ентропії у word2vec
Я намагаюся пропрацювати свій шлях через перший набір проблем навчального матеріалу онлайн-класу cs224d в Інтернеті, і у мене виникають проблеми з проблемою 3A: При використанні пропуску грамової моделі word2vec з функцією прогнозування softmax і функцією перехресної ентропії втрати ми хочемо обчислити градієнти відносно прогнозованих векторів слів. Отже, враховуючи функцію softmax: …

2
Тенденції рівня виживання в дослідженнях контрольного випадку
Я подав статтю, яку відхилили через неправильний спосіб аналізу аналізу виживання. Суддя не залишив інших деталей та пояснень, крім: "Аналіз виживання часових тенденцій вимагає більш складних способів цензури". Питання: Чи зменшився зайвий ризик смерті серед курців за останні десятиліття? Дані: 25 000 курців у Німеччині. Вони були зараховані до когорти …

1
Чи точне тлумачення рідкості?
Відповідно до документації removeSparseTermsфункції з tmпакету, це тягне за собою рідкість: A term-document matrix where those terms from x are removed which have at least a sparse percentage of empty (i.e., terms occurring 0 times in a document) elements. I.e., the resulting matrix contains only terms with a sparse factor …

6
Як нотація
Як читається позначення ? Це слід нормальний розподіл? Або - це нормальний розподіл? А може, X приблизно нормально ..X∼N(μ,σ2)X∼N(μ,σ2)X\sim N(\mu,\sigma^2)XXX XXX XXX Що робити, якщо є декілька змінних, які слідують (або як би там не було) за одним і тим же розподілом? Як написано?

3
Визначення відфільтрованих функцій після вибору функцій за допомогою scikit learn
Ось мій код вибору функції в Python: from sklearn.svm import LinearSVC from sklearn.datasets import load_iris iris = load_iris() X, y = iris.data, iris.target X.shape (150, 4) X_new = LinearSVC(C=0.01, penalty="l1", dual=False).fit_transform(X, y) X_new.shape (150, 3) Але після отримання нової X (залежної змінної - X_new), як я можу знати, які змінні …

1
Перехресне підтвердження регресії ласо в R
Функція R cv.glm (бібліотека: завантаження) обчислює оцінену помилку передбачення перехресної перевірки K-кратного для узагальнених лінійних моделей і повертає дельту. Чи є сенс використовувати цю функцію для регресії ласо (бібліотека: glmnet), і якщо так, то як це можна виконати? Бібліотека glmnet використовує перехресну перевірку, щоб отримати найкращий параметр повороту, але я …

3
відношення між простої регресії та множинною регресією
Дуже основне питання, що стосується регресій OLSR2R2R^2 запустіть регресію OLS y ~ x1, маємо , скажімо, 0,3R2R2R^2 запустіть регресію OLS y ~ x2, у нас є інший , скажімо, 0,4R2R2R^2 тепер ми запускаємо регресію y ~ x1 + x2, яким значенням може бути R квадрату регресії? Я думаю, що зрозуміло, …

2
Що таке "параметр компонента дисперсії" у моделі змішаного ефекту?
На сторінці 12 книги Бейтса про модель змішаного ефекту він описує модель наступним чином: У кінці екрана він згадує про відносний коефіцієнт коваріації , в залежності від дисперсії-компонента параметра ,ΛθΛθ\Lambda_{\theta}θθ\theta не пояснюючи, що саме стосуються. Скажіть, нам дано , як би ми отримали з нього ?θθ\thetaΛθΛθ\Lambda_{\theta} У відповідній примітці це …

1
Тестування значення коефіцієнта Шарпа
Який правильний спосіб перевірити значущість коефіцієнтів різкості чи інформації? Коефіцієнти Шарпа будуть базуватися на різних показниках власного капіталу і можуть мати різні періоди огляду. Одне з описаних нами рішень просто застосовує t-тест Стьюдента, df встановлюється на тривалість періоду огляду. Я не вагаюся застосовувати вищевказаний метод через такі проблеми: Я вважаю, …

1
Чому результати головної складової не співвідносяться?
Supose - це матриця середньосередніх даних. Матриця дорівнює , має чітких власних значень та власних векторів , ... , які є ортогональними.AA\mathbf AS=cov(A)S=cov(A)\mathbf S=\text{cov}(\mathbf A)m×mm×mm\times mmmms1s1\mathbf s_1s2s2\mathbf s_2smsm\mathbf s_m -м головний компонент (деякі люди називають їх «десятки») є вектор . Іншими словами, це лінійна комбінація стовпців , де коефіцієнти є …

2
Що таке букетизація?
Я ходив довкола, щоб знайти чітке пояснення "букетизації" в машинному навчанні без удачі. Що я розумію поки що, букетизація схожа на квантування в цифровій обробці сигналів, коли діапазон нескінченних значень замінюється одним дискретним значенням. Це правильно? Які плюси і мінуси (крім очевидного впливу втрати інформації) застосування букетізації? Чи є якісь …

2
Вкладена перехресна перевірка - чим вона відрізняється від вибору моделі через kfold CV на навчальному наборі?
Я часто бачу людей, які говорять про перехресну перевірку 5x2 як про особливий випадок вкладеної перехресної перевірки . Я припускаю, що перше число (тут: 5) стосується кількості складок у внутрішній петлі, а друге число (тут: 2) стосується кількості складок у зовнішній петлі? Отже, чим це відрізняється від "традиційного" підбору моделі …

2
Різниця між PCA та спектральною кластеризацією для невеликого вибіркового набору булевих ознак
У мене є набір даних з 50 зразків. Кожен зразок складається з 11 (можливо співвідносних) булевих ознак. Мені хотілося б дещо, як візуалізувати ці зразки на двовимірному графіку та перевірити, чи є серед 50-ти зразків кластери / групування. Я спробував наступні два підходи: (a) Запустіть PCA на матриці 50x11 та …

3
Норма, поділена на
нехай і .Z∼ N( 0 , 1 )Z∼N(0,1)Z \sim N(0,1)W∼χ2( и )W∼χ2(s)W \sim \chi^2(s) Якщо і незалежно розподілені, то змінна слідує за розподілом зі ступенями свободи .ZZZWWWY=ZW/ с√Y=ZW/sY = \frac{Z}{\sqrt{W/s}}тttссs Я шукаю доказ цього факту, посилання є досить хорошим, якщо ви не хочете записувати повний аргумент.

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.