Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Обґрунтування моделі фіксованих ефектів проти випадкових ефектів у метааналізі
Я прочитав декілька публікацій, що намагаються виправдати використання моделі фіксованих ефектів із твердженнями за принципом "модель фіксованих ефектів була обрана, оскільки гетерогенність була низькою". Однак я переживаю, що все-таки може бути невідповідний підхід до аналізу даних. Чи є причини чи публікації, які обговорюють, чи може це бути помилкою?

5
Як виміряти дисперсію в даних про частоту слова?
Як я можу оцінити кількість дисперсії у векторі лічильників слів? Я шукаю статистику, яка буде високою для документа А, оскільки вона містить багато різних слів, які трапляються нечасто, і низькі для документа B, оскільки вони містять одне слово (або кілька слів), які трапляються часто. Більш загально, як можна виміряти дисперсію …

4
Чому тести гіпотез щодо повторно впорядкованих наборів даних занадто часто відкидають нуль?
tl; dr: Починаючи з набору даних, згенерованого під нуль, я перекомпонував випадки із заміною та провів перевірку гіпотез на кожному перекомпонованому наборі даних. Ці тести гіпотези відкидають нуль більше 5% часу. нижче, дуже просте моделювання, я набори даних за допомогою , і я підходжу просту модель OLS до кожного. Потім …

2
Точний відбір проб від неправильних сумішей
Припустимо, я хочу взяти вибірку з безперервного розподілу p(x)p(x)p(x) . Якщо у мене є вираз ppp у формі p(x)=∑i=1∞aifi(x)p(x)=∑i=1∞aifi(x)p(x) = \sum_{i=1}^\infty a_i f_i(x) f i pai⩾0,∑iai=1ai⩾0,∑iai=1a_i \geqslant 0, \sum_i a_i= 1fifif_ippp Вибірка мітки з ймовірністюa iiiiaiaia_i ВибіркаX∼fiX∼fiX \sim f_i Чи можливо узагальнити цю процедуру, якщо періодично є негативними? Я підозрюю, …

6
Прості реальні приклади для навчання байесівської статистики?
Я хотів би знайти кілька «реальних прикладів» для навчання байєсівської статистики. Байєська статистика дозволяє офіційно включити попередні знання в аналіз. Я хотів би надати студентам декілька простих реальних прикладів дослідників, що включають попередні знання в свій аналіз, щоб студенти могли краще зрозуміти мотивацію, чому можна, в першу чергу, використовувати байєсівські …

3
Чи припущення про лінійність у лінійній регресії є лише визначенням ?
Я переглядаю лінійну регресію. У підручнику Гріна сказано: Тепер, звичайно, будуть існувати й інші припущення щодо лінійної регресійної моделі, такі як . Це припущення у поєднанні з припущенням про лінійність (яке фактично визначає ) ставить структуру на модель.ϵE(ϵ|X)=0E(ϵ|X)=0E(\epsilon|X)=0ϵϵ\epsilon Однак припущення про лінійність саме по собі не наводить жодної структури нашої …

4
Як я можу отримати значення випадковим чином з оцінки щільності ядра?
У мене є деякі спостереження, і я хочу імітувати вибірку на основі цих спостережень. Тут я розглядаю непараметричну модель, зокрема, я використовую згладжування ядра, щоб оцінити CDF з обмежених спостережень. Тоді я малюю значення навмання з отриманого CDF. Далі - мій код (ідея полягає в тому, щоб отримати випадкову сукупність …

7
Чи є чутливість чи специфічність функцією поширеності?
Стандартне навчання говорить, що чутливість та специфічність є властивостями тесту і не залежать від поширеності. Але це не просто припущення? Принципи внутрішньої медицини Харрісона говорить 19-е видання Вже давно стверджується, що чутливість та специфічність є незалежними від поширеності параметрами точності тестування, і багато текстів все ще роблять це твердження. Однак …

1
Зв'язок LASSO між
Я розумію, що регресія LASSO полягає в тому, що коефіцієнти регресії вибираються для вирішення проблеми мінімізації: хвβ∥ у- Xβ∥22 с . т . ∥ β∥1≤ tminβ‖y−Xβ‖22 s.t.‖β‖1≤t\min_\beta \|y - X \beta\|_2^2 \ \\s.t. \|\beta\|_1 \leq t На практиці це робиться за допомогою множника Лагранжа, що дозволяє вирішити проблему хвβ∥ у- …

1
Коли не використовувати перехресну перевірку?
Коли я читаю на сайті, більшість відповідей свідчать про те, що крос-валідація повинна здійснюватися в алгоритмах машинного навчання. Однак, читаючи книгу "Розуміння машинного навчання", я побачив, що існує вправа, що іноді краще не використовувати перехресну перевірку. Я справді розгублений. Коли алгоритм тренінгу для всіх даних кращий, ніж перехресне підтвердження? Чи …

2
Якщо сума ймовірностей подій дорівнює ймовірності їх об’єднання, чи означає це, що події неперервні?
Аксіоматично ймовірність - це функція яка присвоює кожному події A реальне число P ( A ), якщо вона задовольняє трьом фундаментальним припущенням (припущення Колмогорова):ППPП( А )П(А)P(A)ААA П( A ) ≥ 0 для кожного A П(А)≥0 для кожногоАP(A) \geq 0 \ \text{for every} A П( Ω ) = 1П(Ω)=1P(\Omega) = 1 …

2
Чому оцінювач вважається випадковою змінною?
Я розумію, що таке оцінювач і оцінка: Оцінювач: Правило для обчислення оцінки Оцінка: Значення, обчислене з набору даних на основі оцінки Між цими двома термінами, якщо мене попросять вказати на випадкову змінну, я б сказав, що оцінка є випадковою змінною, оскільки її значення буде змінюватися випадковим чином на основі вибірок …

2
Поліноми високого порядку B-Splines VS в регресії
Я не маю на увазі конкретного прикладу чи завдання. Я просто новачок у використанні b-сплайнів і хотів краще зрозуміти цю функцію в контексті регресії. Давайте припустимо , що ми хочемо , щоб оцінити залежність між змінним відгуком і деякі провісники х 1 , х 2 , . . . , …

1
Чи є теорема відносного контрасту від Beyer et al. стаття: "Про дивну поведінку метрики відстані у просторі великого розміру" вводить в оману?
Це цитується дуже часто, коли згадується прокляття розмірності і йде (формула праворуч називається відносним контрастом) limd→∞var(||Xd||kE[||Xd||k])=0,then:Dmaxkd−DminkdDminkd→0limd→∞var(||Xd||kE[||Xd||k])=0,then:Dmaxdk−DmindkDmindk→0 \lim_{d\rightarrow \infty} \text{var} \left(\frac{||X_d||_k}{E[||X_d||_k]} \right) = 0, \text{then}: \frac{D_{\max^{k}_{d}} - D_{\min^{k}_{d}}}{D_{\min^{k}_{d}}} \rightarrow 0 Результат теореми показує, що різниця між максимальною та мінімальною відстаніми до заданої точки запиту не збільшується так швидко, як найближча відстань …

1
Докази рівня бакалавра теореми Пітмана – Купмана – Дармуа
Теорема Пітмана – Коопмана – Дармуа говорить, що якщо ідентичний вибірки з параметризованого сімейства розподілів ймовірностей допускає достатню статистику, кількість скалярних компонентів не зростає з розміром вибірки, то це експоненціальна сім'я. Чи дають докази будь-які підручники чи елементарні збірники? Чому вона названа на честь цих трьох осіб?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.