Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Лінійна модель регресії, яка найкраще підходить для даних з помилками
Я шукаю алгоритм лінійної регресії, який найбільше підходить для даних, незалежна змінна (x) яких має постійну помилку вимірювання, а залежна змінна (y) має помилку, залежну від сигналу. Наведене вище зображення ілюструє моє запитання.

3
Нерозуміння оцінки Монте-Карло Пі
Я цілком впевнений, що розумію, як працює інтеграція Монте-Карло, але не розумію формулювання того, як вона використовується для оцінки Pi. Я проходжусь за процедурою, викладеною на 5-му слайді цієї презентації http://homepages.inf.ed.ac.uk/imurray2/teaching/09mlss/slides.pdf Я розумію попередні кроки. Пі дорівнює 4-кратній площі чверті одиничного кола. А площа правої верхньої чверті одиничного кола, з …

3
Як включити і до регресії і чи слід їх центрувати?
Я хочу включити термін та його квадрат (змінні предиктора) до регресії, тому що я припускаю, що низькі значення позитивно впливають на залежну змінну, а високі значення мають негативний ефект. повинен захопити ефект більш високих значень. Тому я очікую, що коефіцієнт буде позитивним, а коефіцієнт буде від'ємним. Крім , я включаю …

2
Оцінка параметрів з узагальненими лінійними моделями
За замовчуванням, коли ми використовуємо glmфункцію в R, він використовує метод ітераційно перезавантажених найменших квадратів (IWLS), щоб знайти максимальну оцінку ймовірності параметрів. Зараз у мене два питання. Чи гарантують оцінки IWLS глобальний максимум функції ймовірності? На основі останнього слайду в цій презентації, я думаю, це не так! Я просто хотів …

2
Чому залишки Пірсона від негативної біноміальної регресії менше, ніж ті, що виникають в результаті пуассонової регресії?
У мене є ці дані: set.seed(1) predictor <- rnorm(20) set.seed(1) counts <- c(sample(1:1000, 20)) df <- data.frame(counts, predictor) Я провів пуассонову регресію poisson_counts <- glm(counts ~ predictor, data = df, family = "poisson") І негативна біноміальна регресія: require(MASS) nb_counts <- glm.nb(counts ~ predictor, data = df) Тоді я обчислював статистику …

3
Чи потрібно ICA спочатку запустити PCA?
Я переглянув документ, що базується на застосуванні, в якому сказано, що застосовувати PCA перед застосуванням ICA (використовуючи пакет FastICA). Моє запитання полягає в тому, чи вимагає ICA (fastICA) перший запуск PCA? Цей документ згадував про це ... також стверджується, що попереднє застосування PCA підвищує продуктивність ICA шляхом (1) відкидання невеликих …

4
Неортогональна методика, аналогічна PCA
Припустимо, у мене є набір даних з 2D точок, і я хочу виявити напрямки всіх локальних максимумів дисперсії в даних, наприклад: PCA не допомагає в цій ситуації, оскільки це ортогональне розкладання, і тому не вдається виявити обидві лінії, які я вказав синім кольором, швидше, його вихід може виглядати як той, …

2
Алгоритм ЕМ Практична задача
Це проблема практики для середньострокового іспиту. Проблема - приклад алгоритму ЕМ. У мене виникають проблеми з частиною (f). Я перераховую частини (а) - (д) для завершення, і якщо я помилився раніше. Нехай - незалежні експоненціальні випадкові величини зі швидкістю . На жаль, фактичні значення не спостерігаються, і ми лише спостерігаємо, …

2
Аналіз виживання, коли коваріати недоступні для цензурованих даних
Я дивлюся на час, необхідний суддям для прийняття рішень. Кожен суддя оцінює кількість заявників і може або схвалити, або не затвердити заяву. Справа завершується, коли суддя виголошує свій звіт, який може пройти через деякий час після слухання. Кілька випадків все ще були відкриті наприкінці періоду дослідження. Я хочу оцінити середній …
9 survival 

1
Чому кореляція залишків не має значення при тестуванні на нормальність?
Коли (тобто походить від лінійної регресійної моделі), і в цьому випадку залишки співвідносні і не є незалежними. Але коли ми робимо регресійну діагностику і хочемо перевірити припущення , кожен підручник пропонує використовувати графіки Q – Q та статистичні тести на залишки які були розроблені для перевірки, чи для деяких .Y=AX+εY=AX+εY …

4
Як зробити багатоваріантне машинне навчання? (передбачення декількох залежних змінних)
Я хочу передбачити групи предметів, які хтось придбає ... тобто у мене є декілька змінних, що залежать від коліна. Замість того, щоб будувати 7 або більше незалежних моделей, щоб передбачити ймовірність того, що хтось купить кожен із 7 предметів, а потім поєднати результати, які методи я повинен розглянути, щоб мати …


3
Вибір k вузлів при сплайсі згладжування регресії, еквівалентний k категоричним змінним?
Я працюю над моделлю прогнозних витрат, де вік пацієнта (ціла кількість, виміряна в роках) є однією із змінних прогнозів. Очевидна сильна нелінійна залежність між віком та ризиком перебування у лікарні: Я розглядаю санкціоновану сплайсинг згладжування регресії для віку пацієнта. Згідно з елементами статистичного навчання (Hastie et al, 2009, с.151), оптимальне …

3
Якщо
Припустимо наступне налаштування: Нехай Zi=min{ki,Xi},i=1,...,nZi=min{ki,Xi},i=1,...,nZ_i = \min\{k_i, X_i\}, i=1,...,n . Також Xi∼U[ai,bi],ai,bi>0Xi∼U[ai,bi],ai,bi>0X_i \sim U[a_i, b_i], \; a_i, b_i >0 . Більше того, ki=cai+(1−c)bi,0<c<1ki=cai+(1−c)bi,0<c<1k_i = ca_i + (1-c)b_i,\;\; 0 k_i) = 1- \Pr(X_i \le k_i) =1−ki−aibi−ai=1−(1−c)(bi−ai)bi−ai=c=1−ki−aibi−ai=1−(1−c)(bi−ai)bi−ai=c= 1- \frac {k_i - a_i}{b_i-a_i} = 1-\frac {(1-c)(b_i-a_i)}{b_i-a_i} =c Так у всіх FZi(zi)=⎧⎩⎨⎪⎪⎪⎪⎪⎪⎪⎪⎪⎪0zi<aizi−aibi−aiai≤zi<ki1ki≤ziFZi(zi)={0zi<aizi−aibi−aiai≤zi<ki1ki≤ziF_{Z_i}(z_i) = \begin{cases} …

2
Чи може вузький інтервал довіри навколо незначного ефекту свідчити про нульове значення?
Очевидно помилковим є припущення, що невідхилення нуля означає, що нуль є істинним. Але у випадку, коли нуль не відхиляється і відповідний довірчий інтервал (CI) вузький і зосереджений навколо 0, чи це не дає свідчень для нуля? Я маю два думки: Так, на практиці це дозволило б підтвердити, що ефект є …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.