Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Який розподіл похибки навколо даних логістичного зростання?
В екології ми часто використовуємо логістичне рівняння зростання: Nt=KN0ertK+N0ert−1Nt=KN0ertK+N0ert−1 N_t = \frac{ K N_0 e^{rt} }{K + N_0 e^{rt-1}} або Nt=KN0N0+(K−N0)e−rtNt=KN0N0+(K−N0)e−rt N_t = \frac{ K N_0}{N_0 + (K -N_0)e^{-rt}} де KKK - вантажопідйомність (досягнута максимальна щільність), N0N0N_0 - початкова щільність, rrr - темп зростання, ttt час від початкового. Значення NtNtN_t …
10 r  distributions  pdf  ecology 

2
Як правильно ставитись до декількох точок даних по кожному предмету
Зараз я сперечаюся з кимось про те, як правильно поводитися з даними за допомогою декількох вимірювань для кожного предмета. У цьому випадку дані збиралися для кожного предмета протягом короткого часу за різних умов у кожному предметі. Усі вимірювання складаються з однакової величини, просто кратної. Один з варіантів зараз - це …

3
Моделі Маркова з умовними ймовірностями переходу
По-перше, дозвольте мені наперед визнати, що я не так добре розбираюся у статистиці та математиці, як хотілося б. Дехто може сказати, що достатньо знань, щоб бути небезпечним. : DI вибачаюся, якщо я не використовую термінологію правильно. Я намагаюся моделювати ймовірності переходу системи з одного стану в інший. Проста модель Маркова …

3
Де спільна дисперсія між усіма IV в лінійному множинні рівняння регресії?
Якщо лінійне множинне регресійне рівняння, якщо бета-ваги відображають внесок кожної окремої незалежної змінної понад і внесок усіх інших IV, де в рівнянні регресії є дисперсія, поділена на всі IV, що прогнозує DV? Наприклад, якщо діаграма Венна, відображена нижче (і взята зі сторінки "про" CV тут: https://stats.stackexchange.com/about ), позначається як 3 …

2
Як моделювати багатоваріантні результати в R?
У більшості ситуацій ми маємо справу лише з однією змінною результату / відповіді, такою як . Однак у деяких сценаріях, особливо у клінічних даних, змінні результату можуть бути високомірними / багатоваріантними. Такі , як , де містить , і змінних і ці результати все корельовані. Якщо являє собою лікування (так …

2
AUC в порядковій логістичній регресії
Я використовую 2 різновиди логістичної регресії - один - простий тип, для двійкової класифікації, а другий - порядковий логістичний регрес. Для обчислення точності першого я використовував перехресну перевірку, де я обчислював AUC для кожної складки і ніж обчислював середнє AUC. Як я можу це зробити для звичайної логістичної регресії? Я …

3
Відстань махаланобіса через PCA, коли
Я маю матрицю, де - кількість генів і - кількість пацієнтів. Той, хто працював з такими даними, знає, що завжди більше . Використовуючи вибір функцій, я отримав вниз до більш розумного числа, однак все ж більший за .n × pн×pn\times ppppннnpppннnppppppннn Я хотів би обчислити подібність пацієнтів на основі їх …

3
Як створити систему рекомендацій, яка інтегрує як спільну фільтрацію, так і вміст?
Я створюю систему рекомендацій і хочу включити як рейтинги "подібних" користувачів, так і функції елементів. Вихід - прогнозований рейтинг [0-1]. Я розглядаю нейронну мережу (для початку). Отже, вхідні дані - це поєднання особливостей елементів та рейтингів кожного користувача. Для елемента A та користувача 1 система може бути навчена комбінованим даним, …

1
Відсутні значення у змінній відповіді в JAGS
Gelman & Hill (2006) кажуть: У помилках пропущені результати в регресії можна легко впоратися, просто включивши вектор даних, NA та все. Помилки явно моделює змінну результатів, і тому тривіально використовувати цю модель для ефекту імпульсування відсутніх значень при кожній ітерації. Це звучить як простий спосіб використання JAGS для прогнозування. Але …

1
Заперечення проти рандомізації
У клінічних випробуваннях - методологічна перспектива , пише Стівен Піантадосі (гл.13, стор 334): У главі 2 я зазначив заперечення проти рандомізації Авелем та Кохом (1997) та Урбахом (1993) та зазначив, що варто вивчити їхні проблеми та ймовірні помилки. Вони відкидають рандомізацію як означає перевірити певні статистичні тести, підстава для причинного …

1
Доведення послідовності зменшується (підтримується побудовою великої кількості точок)
Багато питань, які я опублікував у минулому місяці щодо SE, мали на меті допомогти мені вирішити цю конкретну проблему. На всі питання відповіли, але я все ще не можу знайти рішення. Отже, я подумав, що треба просто задати проблему, яку я намагаюся вирішити безпосередньо. Дозволяє Хн∼ЖнХн∼ЖнX_n \sim F_n, де Жн= …

1
vcovHC, vcovHAC, NeweyWest - яку функцію використовувати?
Я намагаюся оновити свою модель на основі lm (), щоб отримати правильні стандартні помилки та тести. Я дуже розгублений, яку матрицю VC використовувати. У sandwichпакет пропозицій vcovHC, vcovHACі NeweyWest. У той час як перший припадає лише на гетероскедастичність, останні два пояснюють як послідовну кореляцію, так і гетерокедастичність. Тим не менш, …

1
Кальман-фільтр проти згладжування сплайнів
Питання: Для яких даних доцільно використовувати моделювання простору стану та фільтрацію Кальмана замість згладжування сплайнів і навпаки? Чи є якась залежність еквівалентності між ними? Я намагаюся зрозуміти, як ці методи поєднуються на високому рівні. Я переглянув нову Гауссова оцінку Джонстона : Можливості послідовності та мультирезолюції . Дивно, що не було …

3
Як перевірити гіпотезу, що кореляція дорівнює заданій величині за допомогою R?
Чи є функція перевірки гіпотези про те, що співвідношення двох векторів дорівнює заданому числу, скажімо, 0,75? Використовуючи cor.test, я можу перевірити cor = 0, і я можу побачити, чи 0,75 знаходиться в довірчому інтервалі. Але чи є функція для обчислення р-значення для cor = 0,75? x <- rnorm(10) y <- …
10 r  correlation 

3
Лінійна регресія з факторами в R
Я намагаюся зрозуміти, як саме працюють фактори в Р. Скажімо, я хочу запустити регресію, використовуючи деякі вибіркові дані в R: > data(CO2) > colnames(CO2) [1] "Plant" "Type" "Treatment" "conc" "uptake" > levels(CO2$Type) [1] "Quebec" "Mississippi" > levels(CO2$Treatment) [1] "nonchilled" "chilled" > lm(uptake ~ Type + Treatment, data = CO2) Call: …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.