Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Інтерпретація графіку залишків проти встановлених значень з регресії Пуассона
Я намагаюся вписати дані в GLM (пуассонова регресія) в Р. Коли я побудував залишки проти встановлених значень, графік створив кілька (майже лінійних із невеликою увігнутою кривою) "лінії". Що це означає? library(faraway) modl <- glm(doctorco ~ sex + age + agesq + income + levyplus + freepoor + freerepa + illness …

6
Довідник зі статистики з R - чи існує він і що він повинен містити?
Фон Навколо цього проходить багато дискусій, тому я подумав, що можу знайти свою відповідь від попередніх кроків на StackExchange та люто гуглити. Після використання півдня, намагаючись знайти лише один довідник для (біо) статистики з R, я вкрай розгубився і довелося здатися. Можливо, комбінований безкоштовний матеріал насправді кращий за будь-яку книгу, …
25 r  references 

1
Які діагностичні діаграми існують для кількісної регресії?
Відповідаючи на запитання щодо OLS , мені цікаво: які діагностичні діаграми існують для кількісної регресії? (а чи є їх реалізація?) Швидкий пошук в Google вже з'явився з черв'ячним сюжетом (про який я раніше ніколи не чув), і я з радістю дізнаюся про інші методи, про які ви могли б знати. …


4
Ziliak (2011) виступає проти використання p-значень і згадує деякі альтернативи; хто вони?
В останній статті, що обговорює недоліки, покладаючись на значення p для статистичного висновку, яке називається "Матриця проти Сіракузано та Студент проти Фішера, статистичне значення для випробування" (DOI: 10.1111 / j.1740-9713.2011.00511.x), Стівен Т. Зіляк виступає проти використання р-значень. У заключних параграфах він говорить: Дані - це одне, про що ми вже …

6
Які хороші методи візуалізації даних для порівняння розподілів?
Я пишу кандидатську дисертацію і зрозумів, що надмірно покладаюся на графіки, щоб порівняти розподіли. Які ще альтернативи вам подобаються для досягнення цього завдання? Я також хотів би запитати, чи знаєте ви будь-який інший ресурс, як галерея R, в якій я можу надихнути себе різними ідеями щодо візуалізації даних.

5
Навіщо використовувати метод Монте-Карло замість простої сітки?
інтегруючи функцію або в складні моделювання, я бачив метод Монте-Карло широко застосовується. Я запитую себе, чому не створюється сітка точок, щоб інтегрувати функцію, а не малювати випадкові точки. Хіба це не принесе більш точних результатів?

7
Чому, наприклад, стать зазвичай кодується 0/1, а не 1/2?
Я розумію логіку кодування для аналізу даних. Моє запитання нижче стосується використання певного коду. Чи є причина, чому стать часто кодується як 0 для жіночої та 1 для чоловічої? Чому це кодування вважається "стандартним"? Порівняйте це з Жіноча = 1 та Чоловіча = 2. Чи є проблема з цим кодуванням?

1
Побудова довірчих інтервалів на основі ймовірності профілю
Під час мого елементарного курсу статистики я навчився будувати 95% довірчий інтервал, такий як середня сукупність, , виходячи з асимптотичної нормальності для "великих" розмірів вибірки. Крім методів перекомпонування (наприклад, завантажувальної програми), існує ще один підхід, заснований на "ймовірності профілю" . Чи може хтось з'ясувати цей підхід?μμ\mu За яких ситуацій побудовані …

2
Чи PCA нестабільний при мультиколінеарності?
Я знаю, що в регресійній ситуації, якщо у вас є набір сильно корельованих змінних, це зазвичай "погано" через нестабільність оцінених коефіцієнтів (дисперсія йде в бік нескінченності, оскільки детермінанта йде до нуля). Моє запитання - чи зберігається ця «поганість» у ситуації з УПС. Чи стають коефіцієнти / навантаження / ваги / …

4
Вирішення невизначеності моделі
Мені було цікаво, як байєси в спільноті CrossValided розглядають проблему невизначеності моделі та як вони вважають за краще вирішувати її? Я спробую поставити своє запитання у двох частинах: Наскільки важливо (на ваш досвід / думку) стосується невизначеності моделі? Я не знайшов жодного документу, який би займався цим питанням, у спільноті …

2
Коли я повинен * не * використовувати функцію nlm R для MLE?
Я натрапив на кілька посібників, які пропонують використовувати Nlm R для максимальної оцінки ймовірності. Але жодна з них (включаючи документацію R ) не дає багато теоретичних вказівок щодо того, коли використовувати або не використовувати цю функцію. Наскільки я можу сказати, nlm просто робить градієнтний спуск по лінії методу Ньютона. Чи …

2
Загальна лінійна модель проти узагальненої лінійної моделі (з функцією зв’язку ідентичності?)
Це моє перше повідомлення, тому будь ласка, будь ласка, будь ласка, якщо я не дотримуюся деяких стандартів! Я здійснив пошук свого питання, і нічого не вийшло. Моє запитання стосується переважно практичних відмінностей між загальним лінійним моделюванням (GLM) та узагальненим лінійним моделюванням (GZLM). У моєму випадку це було б кілька безперервних …


2
Тест на коефіцієнт ймовірності в R
Припустимо, я збираюся зробити універсальну логістичну регресію на декількох незалежних змінних, як це: mod.a <- glm(x ~ a, data=z, family=binominal("logistic")) mod.b <- glm(x ~ b, data=z, family=binominal("logistic")) Я зробив порівняння моделі (тест коефіцієнта ймовірності), щоб побачити, чи модель краща за нульову модель за допомогою цієї команди 1-pchisq(mod.a$null.deviance-mod.a$deviance, mod.a$df.null-mod.a$df.residual) Потім я …
25 r  logistic  diagnostic 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.