Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Чи можемо ми порівняти кореляції між групами, порівнявши нахили регресії?
У цьому питанні вони запитують, як порівняти Пірсона r для двох незалежних груп (наприклад, чоловіків та жінок). Відповідь та коментарі пропонували два способи: Використовуйте відому формулу Фішера, використовуючи "z-перетворення" r; Використовуйте порівняння схилів (коефіцієнти регресії). Останнє можна легко виконати просто за допомогою насиченої лінійної моделі: , де і - корельовані …

2
Що таке "відхилити зараження" і як це можна використовувати для підвищення точності моделі?
Хтось може детально пояснити: Що означає відхилення зараження? Як це можна використовувати для підвищення точності моєї моделі? У мене є ідея відхилити зараження в застосуванні до кредитних карт, але бореться з думкою про її використання, щоб підвищити точність моєї моделі.
10 logistic 


1
Як ви генеруєте криві ROC для перехресної валідації "один-один"?
Під час виконання 5-кратної перехресної валідації (наприклад), типово обчислювати окрему криву ROC для кожної з 5-ти кратних і часто разів середньої кривої ROC з std. дев. показано у вигляді товщини кривої. Однак для перехресної перевірки LOO, де у кожній складці є лише одна тестова точка даних, не представляється сенсом обчислити …

4
Хороша книга про теоретичний підхід до статистики
Коли я 10 років тому я брав курси теоретичної статистики як недолік , ми використовували Сучасну математичну статистику Дудевича та Мішри. Я вважаю, що зараз звертаюся до книги, і мені нагадують, що деякі приклади коду збираються для IBM 370. Хоча вигадка, я не можу не відчути, що це дещо застаріло. …
10 references 

2
Чи використовувати компенсацію в регресії Пуассона при прогнозуванні загальних кар'єрних цілей, забитих хокеїстами
У мене виникло питання щодо того, чи можна використовувати компенсацію. Припустимо дуже просту модель, де ви хочете описати (загальну) кількість голів у хокеї. Отже, у вас є цілі, кількість зіграних ігор та фіктивна змінна "нападник", яка дорівнює 1, якщо гравець є нападником, а 0 - в іншому випадку. Отже, яка …

2
Спостерігається лівий косий та симетричний розподіл
Це мені досить важко описати, але я спробую зробити свою проблему зрозумілою. Тому спочатку ви повинні знати, що я до цього часу робив дуже просту лінійну регресію. Перш ніж оцінити коефіцієнт, я спостерігав за розподілом свого . Це важкий лівий косий. Після того, як я оцінив модель, я повністю впевнено …

1
Інтервал довіри для різниці засобів у регресії
Припустимо, у мене є квадратична модель регресії з помилками задовольняють звичайним припущенням (незалежним, нормальним, незалежним від значень ). Нехай - найменші оцінки квадратів.Y=β0+β1X+β2X2+ϵY=β0+β1X+β2X2+ϵ Y = \beta_0 + \beta_1 X + \beta_2 X^2 + \epsilon ϵϵ\epsilonXXXb0,b1,b2b0,b1,b2b_0, b_1, b_2 У мене є два нових значення та , і мені цікаво отримати інтервал …

1
Що означає ефективність Гаусса?
Що стосується надійних оцінок, що означає ефективність Гаусса ? Наприклад, має 82% ефективності Гаусса і 50% точки пробою.QнQнQ_{_n} Довідково: Rousseeuw PJ, and Croux, C. (1993). "Альтернативи середнього абсолютного відхилення". Дж. Американський статистичний доц., 88, 1273-1283

1
Як обчислити стандартну помилку коефіцієнтів шансів?
У мене є два набори даних із досліджень, пов'язаних з геномом. Єдина доступна інформація - коефіцієнт шансів і значення р для першого набору даних. Для другого набору даних я маю коефіцієнт коефіцієнта, p-значення та частоти алелей (AFD = хвороба, AFC = управління) (наприклад: 0,321). Я намагаюся зробити метааналіз цих даних, …

2
Як я можу пояснити просторову коваріацію у лінійній моделі?
Фон У мене є дані польового дослідження, в якому є чотири рівні лікування та шість повторень у кожному з двох блоків. (4x6x2 = 48 спостережень) Блоки розташовані приблизно на відстані 1 милі, а всередині блоків - сітка з 42, 2 м х 4 м ділянок та шириною 1 м; моє …

2
Як узагальнити та порівняти нелінійні зв’язки?
У мене є дані про відсоток органічної речовини в озерних відкладах від 0 см (тобто інтервал осад - вода) до 9 см для приблизно 25 озер. У кожному озері було взято по 2 ядра з кожного місця, тому у мене є 2 повторювані міри відсотка органічної речовини на кожній глибині …

3
Манекени із змінними пастками
Я використовую велику регресію OLS, де всі незалежні змінні (приблизно 400) - фіктивні змінні. Якщо всі включені, існує ідеальна мультиколінеарність (фільтр фіктивних змінних), тому я повинен опустити одну із змінних, перш ніж запустити регресію. Перше моє запитання: яку змінну слід опустити? Я читав, що краще опустити змінну, яка присутня у …

4
Як отримати значення, використані в plot.gam в мгcv?
Я хотів би дізнатися значення, які (x, y)використовуються для побудови графіків plot(b, seWithMean=TRUE)у пакеті mgcv . Хтось знає, як я можу витягти або обчислити ці значення? Ось приклад: library(mgcv) set.seed(0) dat <- gamSim(1, n=400, dist="normal", scale=2) b <- gam(y~s(x0), data=dat) plot(b, seWithMean=TRUE)

2
Як зробити репрезентативний набір вибірки з великого загального набору даних?
Які статистичні прийоми для створення вибіркового набору, який є репрезентативним для всієї сукупності (з відомим рівнем довіри)? Також, Як перевірити, якщо зразок відповідає загальному набору даних? Чи можливо, без розбору всього набору даних (що може бути мільярдами записів)?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.