Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Що таке "строго позитивний розподіл"?
Я читаю "Причинність" Юдеї Перл (друге видання 2009 р.) Та в розділі 1.1.5 Умовна незалежність та графоїди, він говорить: Далі наводиться (частковий) перелік властивостей, задоволених умовною залежністю незалежності (X_ || _Y | Z). Симетрія: (X_ || _ Y | Z) ==> (Y_ || _X | Z). Розкладання: (X_ || _ …

2
Виявлення комутації з імовірнісним програмуванням (pymc)
Зараз я читаю "книгу" про ймовірнісне програмування та байєсовські методи для хакерів . Я прочитав кілька розділів, і думав над першою главою, де перший приклад з pymc складається з виявлення точки відьми в текстових повідомленнях. У цьому прикладі випадкова величина, яка вказує, коли відбувається точка комутації, позначається символом . Після …

1
Коли правильне оцінювання правила є кращою оцінкою узагальнення в класифікаційному середовищі?
Типовим підходом до вирішення проблеми класифікації є визначення класу кандидатних моделей, а потім проведення вибору моделі за допомогою певної процедури, наприклад перехресної перевірки. Зазвичай вибирають модель з найбільшою точністю або якусь пов'язану функцію, що кодує конкретну інформацію про проблему, наприклад .FβFβ\text{F}_\beta Припустимо, що кінцевою метою є створення точного класифікатора (де …

1
Чому функціональна форма 1-ї стадії в 2SLS не важлива?
У презентації сьогодні спікер висунув вищезазначене твердження. Він сказав, що навіть якщо перший етап буде неправильно визначений, оцінки коефіцієнтів другого етапу все одно будуть дійсними. Як студент з низьким ступенем навчання, я не міг попросити пояснень, тому зараз я просив вашої допомоги!

2
Баєсовий аналіз таблиць на випадок надзвичайних ситуацій: Як описати розмір ефекту
Я працюю над прикладами в аналізі даних Doing Bayesian Kruske , зокрема експоненціальної пуассонової ANOVA в гл. 22, який він подає як альтернативу часто-часто-тестовим тестам незалежності для таблиць на випадок надзвичайних ситуацій. Я бачу, як ми отримуємо інформацію про взаємодії, які трапляються більш-менш часто, ніж можна було б очікувати, якби …

2
SD більше середньої, негативної шкали
Мені було надано статтю, в якій повідомлялося про дослідження, дуже схоже на те, яке я хочу провести в лабораторії. Але я помітив, що для змінної, що цікавить, Тривалість, значення SD більше, ніж середнє значення ... оскільки ця тривалість вимірюється в хвилинах, вона ніколи не може бути негативною, і це здається …

1
Еквівалентність значень AIC та p у виборі моделі
У коментарі до відповіді на це питання було зазначено, що використання AIC у виборі моделі еквівалентно використанню р-значення 0,154. Я спробував це в R, де я використав "зворотний" алгоритм вибору підмножини, щоб викинути змінні з повної специфікації. По-перше, послідовно викидаючи змінну з найвищим р-значенням і зупиняючи, коли всі p-значення нижче …

1
Приклад CLT, коли моменти не існують
РозглянемоXn=⎧⎩⎨1−12kw.p. (1−2−n)/2w.p. (1−2−n)/2w.p. 2−k for k>nXn={1w.p. (1−2−n)/2−1w.p. (1−2−n)/22kw.p. 2−k for k>nX_n = \begin{cases} 1 & \text{w.p. } (1 - 2^{-n})/2\\ -1 & \text{w.p. } (1 - 2^{-n})/2\\ 2^k & \text{w.p. } 2^{-k} \text{ for } k > n\\ \end{cases} Мені потрібно показати, що, хоча це нескінченна кількість моментів,n−−√(X¯n)→dN(0,1)n(X¯n)→dN(0,1)\sqrt{n}(\bar{X}_n) \overset{d}{\to} N(0,1) …

2
Як би ви візуалізували сегментовану воронку? (а ви могли б це зробити з Python?)
Я побачив цю публікацію на Moz, яка представила сегментовану маркетингову лійку: Така річ мала б неабияку цінність у моїй роботі. Я поняття не маю - це візуалізувати необроблені дані, щоб показати сегментовану воронку, як ця. Ідея полягає в тому, що потенційні продажі надходять з різних джерел (які ми використовуємо для …

2
Конвергенція в розподілі \ CLT
Враховуючи, що , умовний дістр. з є . має граничний дистриб. Пуассона ( ), - позитивна константа.N= nN=нN = nYYYχ2( 2 п )χ2(2н)\chi ^2(2n)NNNθθ\thetaθθ\theta Покажіть, що як , у розподілі.θ → ∞θ→∞\theta \rightarrow \infty ( Y- Е( Y) ) /Вар( Y)------√→ N( 0 , 1 ) (Y-Е(Y))/Вар⁡(Y)→N(0,1)\space \space (Y - …



1
Значення відсікання відстані Кука
Я читав на відстані кухаря, щоб визначити людей, які сильно впливають на мою регресію. У первісному дослідженні Кука він говорить, що коефіцієнт скорочення 1 повинен бути порівнянним для визначення впливових факторів. Однак у різних інших дослідженнях використовується або як скорочення.4н4н\frac{4}{n}4n - k - 14н-к-1\frac{4}{n-k-1} У моєму дослідженні жоден із моїх …

2
Зміщення оптимізму - оцінки похибки прогнозування
У книзі «Елементи статистичного навчання» (доступна у форматі PDF в Інтернеті) обговорюється оптимістичне зміщення (7.21, стор. 229). Він зазначає, що зміщення оптимізму - це різниця між помилкою тренувань та помилкою у вибірці (помилка, яка спостерігається, якщо ми вибираємо нові значення результатів у кожному з початкових навчальних балів) (на нижче). Далі, …

2
R виявляє тенденцію до збільшення / зменшення тенденції часових рядів
У мене багато часових рядів з періодами: день, тиждень або місяць. За допомогою stl()функції чи за допомогою loess(x ~ y)я можу побачити, як виглядають тенденції певного часового ряду. Мені потрібно виявити, чи збільшується чи зменшується тенденція часових рядів. Як я можу цим керувати? Я намагався обчислити коефіцієнти лінійної регресії lm(x …
9 r  time-series  trend 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.