Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Проблема з доведенням умовного очікування як найкращого прогноктора
У мене є проблема з доказом E(Y|X)∈argming(X)E[(Y−g(X))2]E(Y|X)∈arg⁡ming(X)E[(Y−g(X))2]E(Y|X) \in \arg \min_{g(X)} E\Big[\big(Y - g(X)\big)^2\Big] які дуже ймовірно виявляють глибше нерозуміння очікувань та умовних очікувань. Я знаю, що я знаю, такий доказ (іншу версію цього доказу можна знайти тут ) ===argming(X)E[(Y−g(x))2]argming(X)E[(Y−E(Y|X)+E(Y|X)−g(X))2]argming(x)E[(Y−E(Y|X))2+2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]argming(x)E[2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]arg⁡ming(X)E[(Y−g(x))2]=arg⁡ming(X)E[(Y−E(Y|X)+E(Y|X)−g(X))2]=arg⁡ming(x)E[(Y−E(Y|X))2+2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]=arg⁡ming(x)E[2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]\begin{align*} &\arg \min_{g(X)} E\Big[\big(Y - g(x)\big)^2\Big]\\ = &\arg \min_{g(X)} E \Big[ \big(Y …

3
Приклад розподілу, коли для теореми центральної межі необхідний великий розмір вибірки
У деяких книгах зазначено, що розмір вибірки розміром 30 або вище необхідний, щоб теорема про центральну межу дала хороший наближення для . Х¯X¯\bar{X} Я знаю, цього недостатньо для всіх дистрибутивів. Я хотів би побачити кілька прикладів розподілів, де навіть при великому розмірі вибірки (можливо, 100, 1000 або більше) розподіл середнього …

1
Як я можу знайти значення, не вказані в (інтерполювати в) статистичні таблиці?
Часто люди використовують програми для отримання p-значень, але іноді - з будь-якої причини - може знадобитися отримання критичного значення з набору таблиць. З огляду на статистичну таблицю з обмеженою кількістю рівнів значущості та обмеженою кількістю ступенів свободи, як я можу отримати приблизні критичні значення на інших рівнях значущості чи ступені …

2
Значення категоричного предиктора в логістичній регресії
У мене виникають проблеми з інтерпретацією значень z для категоричних змінних в логістичній регресії. У наведеному нижче прикладі я маю категоричну змінну з 3 класами, і відповідно до значення z, CLASS2 може бути релевантним, а інші - ні. Але тепер що це означає? Що я міг би об'єднати інші класи …

5
Який найкращий спосіб візуалізувати зв’язок між дискретними та безперервними змінними?
Який найкращий спосіб виявити зв’язок між: безперервна і дискретна змінна, дві дискретні змінні? Поки я використовував схеми розкидання, щоб переглянути зв'язок між безперервними змінними. Однак у випадку дискретних змінних бали даних накопичуються через певні інтервали. Таким чином, лінія найкращого пристосування може бути упередженою.

5
Як відобразити смуги помилок для перехресних (парних) експериментів
Наступний сценарій став найбільш поширеним запитанням у трійці слідчого (I), рецензента / редактора (R, не пов’язаного з CRAN) і мене (M) як творця сюжету. Можна припустити, що (R) - типовий медичний рецензент великого начальника, який знає лише, що кожен сюжет повинен мати панель помилок, інакше це неправильно. Якщо бере участь …

1
Як трактуються значення "NA" в glm в R
У мене є таблиця даних T1, яка містить майже тисячу змінних (V1) і близько 200 мільйонів точок даних. Дані рідкі, і більшість записів - NA. У кожній точці даних є унікальний пара ідентифікатора та дати, який можна відрізняти від іншого. У мене є ще одна таблиця T2, яка містить окремий …


3
Яка практична відмінність між правилами асоціації та деревами рішень при обробці даних?
Чи є дійсно простий опис практичних відмінностей між цими двома методиками? Обидва, здається, використовуються для наглядового навчання (хоча правила асоціації також можуть поводитися без нагляду). І те й інше можна використовувати для прогнозування Найближче, що я знайшов до «хорошого» опису, - це « Підручник із Статсофта» . Кажуть, що правила …

1
Чи є статистичний тест для порівняння двох зразків розміром 1 і 3?
Для екологічного проекту моя лабораторна група додала оцту до 4-х резервуарів, що містять рівний об'єм води в ставку, 1 контроль без елодеї (водної рослини) та 3 обробки з однаковою кількістю елодеї в кожному. Метою додавання оцту було зниження рН. Гіпотеза полягала в тому, що цистерни з елодеєю швидше повернуться до …

2
Яка діагностика може підтвердити використання конкретного сімейства GLM?
Це здається таким елементарним, але я завжди зациклююся на цьому ... Більшість даних, з якими я маю справу, не є нормальними, а більшість аналізів базується на структурі GLM. Для мого поточного аналізу у мене є змінна відповідь, яка "швидкість ходьби" (метри / хвилина). Мені легко визначити, що я не можу …

2
Найефективніше використання кольору в картах тепла / контуру
Досить часто застосовувати тепло / контурні карти при представленні значень ЕЕГ часу. Кольорова схема, яка часто вибирається (і яка мені подобається та використовую), є "струменевою" кольоровою схемою (див., Наприклад, ЕЕГ часу пошуку зображень Google ). Мені цікаво, чи є кращі кольорові схеми для представлення цих сюжетів та / або вказівки …

1
Чи може lmer () використовувати сплайни як випадкові ефекти?
Скажімо, ми працюємо над моделлю випадкових ефектів деяких даних підрахунку з часом, і ми хочемо контролювати деякі тенденції. Зазвичай ви робите щось на кшталт: lmer(counts ~ dependent_variable + (1+t+I(t^2)|ID), family="poisson") включити квадратичну форму для t. Чи можна використовувати деякі більш складні методи згладжування, такі як ЗЛАСНЕ згладжування або сплайси для …

2
Якщо принцип ймовірності зіткнеться з частою частотою ймовірності, тоді ми відкинемо одну з них?
У коментарі, нещодавно опублікованому тут, один із коментаторів вказав на блог Ларрі Вассермана, який зазначає (без жодних джерел), що частота виводки суперечить принципу ймовірності. Принцип ймовірності просто говорить, що експерименти, що дають подібні функції ймовірності, повинні давати аналогічні умовиводи. Дві частини цього питання: Які частини, аромат чи школа частого виведення …

3
Інтерпретація трьох форм "змішаної моделі"
Існує відмінність, яка мене спонукає до змішаних моделей, і мені цікаво, чи зможу я отримати трохи ясності. Припустимо, у вас є змішана модель підрахунку даних. Є змінна, яку ви знаєте, що ви хочете як фіксований ефект (A), і інша змінна для часу (T), згрупована за словами змінної "Site". Як я …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.