Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Діаграма QQ не відповідає гістограмі
У мене є гістограма, щільність ядра та пристосований нормальний розподіл прибутку фінансових журналів, які перетворюються на втрати (знаки змінюються), і нормальний графік QQ цих даних: Сюжет QQ чітко показує, що хвости неправильно підігнані. Але якщо я переглядаю гістограму та пристосований нормальний розподіл (синій), навіть значення близько 0,0 не відповідають правилам. …

3
Крива ROC, що перетинає діагональ
На даний момент я використовую двійковий класифікатор. Коли я будую криву ROC, я отримую хороший підйом на початку, тоді він змінює напрямок і перетинає діагональ, а потім, звичайно, назад, роблячи криву нахиленою S подібною формою. Що може бути тлумаченням / поясненням цього ефекту? Дякую
12 roc 

1
Узгодження позначень для змішаних моделей
Мені знайомі такі позначення, як: yij=β0+βixij+uj+eij=β0j+βixij+eijyij=β0+βixij+uj+eij=β0j+βixij+eij\begin{align} y_{ij} &= \beta_0 + \beta_i x_{ij} + u_j + e_{ij}\\ &= \beta_{0j} + \beta_i x_{ij} + e_{ij} \end{align} where , іβ0j=β0+ujβ0j=β0+uj\beta_{0j}=\beta_{0}+u_j yij=β0+β1xij+u0j+u1jxij+eij=β0j+β1jxij+eijyij=β0+β1xij+u0j+u1jxij+eij=β0j+β1jxij+eij\begin{align} y_{ij} &= \beta_0 + \beta_1 x_{ij} + u_{0j} + u_{1j} x_{ij} + e_{ij} \\ &= \beta_{0j} + \beta_{1j} x_{ij} + e_{ij} \end{align} …

3
Стратегія пристосування високолінійної функції
Для аналізу даних експерименту з біофізики я в даний час намагаюся зробити підгонку кривої з дуже нелінійною моделлю. Функція моделі в основному виглядає так: y=ax+bx−1/2y=ax+bx−1/2y = ax + bx^{-1/2} Тут особливо велике значення викликає значення .bbb Сюжет для цієї функції: (Зауважте, що модель моделі заснована на ретельному математичному описі системи, …


2
Проблема зі порівнянням GLM-моделей, що мають іншу функцію зв'язку
З огляду на той самий набір сімейств коваріатів та розподілу, як я можу порівнювати моделі, що мають різні функції зв’язку? Я думаю, що тут правильна відповідь - "AIC / BIC", але я не впевнений на 100%. Чи можливо мати вкладені моделі, якщо вони мають інше посилання?

1
Якби тенісний матч був одним великим набором, скільки ігор дало б однакову точність?
У тенісу є своєрідна система трьох балів, і мені цікаво, чи має це якась статистична користь з точки зору матчу як експерименту для визначення кращого гравця. Для незнайомих людей у ​​звичайних правилах гра виграється від першого до 4 очок, якщо у вас є 2-очковий привід (тобто якщо це 4-2, ви …

3
Чи співвідносяться кореляція чи коефіцієнт визначення з відсотком значень, які падають по лінії регресії?
Кореляція, , - міра лінійної асоціації між двома змінними. Коефіцієнт детермінації, r 2 , - це міра того, яка частина змінності в одній змінній може бути "пояснена" варіацією в іншій.rrrr2r2r^2 Наприклад, якщо - кореляція між двома змінними, то r 2 = 0,64 . Отже, 64% змінності в одному можна пояснити …

2
Чи можу я відхилити та різницю, щоб зробити серію нерухомою?
У мене є набір даних, який з часом збільшується (обмінний курс валюти, щомісячні дані за 20 років), моє запитання: чи можу я знецінити дані, а потім відмінити їх також, щоб зробити їх нерухомими, якщо деградація сама по собі цього не досягає? І якщо так, то чи вважатиметься це вдвічі різницею, …

2
Що таке повна достатня статистика?
У мене є проблеми з розумінням повної достатньої статистики? Нехай є достатньою статистикою.T=ΣxiT=ΣxiT=\Sigma x_i Якщо з ймовірністю 1, для деякої функції , то це повна достатня статистика.E[g(T)]=0E[g(T)]=0E[g(T)]=0ggg Але що це означає? Я бачив приклади уніформи та Бернуллі (стор. 6 http://amath.colorado.edu/courses/4520/2011fall/HandOuts/umvue.pdf ), але це не інтуїтивно, я більше розгубився, побачивши інтеграцію. …

2
Чому збільшення кількості функцій знижує продуктивність?
Я намагаюся зрозуміти, чому збільшення кількості функцій може знизити продуктивність. Наразі я використовую класифікатор LDA, який працює краще двозначно серед певних функцій, але гірше, коли дивлюся більше функцій. Моя точність класифікації виконується за допомогою стратифікованого 10-кратного xval. Чи є простий випадок, коли класифікатор працював би краще одноразово, ніж двоваріантно, щоб …

1
Десезоналізація даних підрахунку
Я використовував stl () в R, щоб розкласти дані про підрахунок на трендові, сезонні та нерегулярні компоненти. Отримані значення тренду вже не є цілими числами. У мене є такі питання: Чи stl () є відповідним способом деасоналізації даних підрахунку? Оскільки результуюча тенденція більше не оцінюється міжджерелом, чи можу я використовувати …

1
Як здійснити регресію інструментальних змінних із терміном інструментальної взаємодії в Stata?
У мене є проблема з синтаксисом Stata. Мені потрібно зробити наступну регресію: у= a x + b z+c(xz)+ey=ax+bz+c(xz)+ey = ax + bz + c(xz) + e де і і є інструментованими, а також термін взаємодії використовує інструментовані значення і .xxxzzzxzxzxzzxxxzzz Просто генерування прогнозованих значень для та та використання їх як …

1
Як обчислити "Шляхи до Білого дому" за допомогою R?
Я щойно натрапив на цей чудовий аналіз, який є і цікавим, і красивим візуально: http://www.nytimes.com/interactive/2012/11/02/us/politics/paths-to-the-white-house.html Мені цікаво, як таке "дерево шляху" можна побудувати за допомогою R. Які дані та алгоритм потрібні для побудови такого дерева шляхів? Дякую.

1
Чи можна тлумачити включення квадратичного терміна в логістичну регресію як вказівку на перелом?
У логістичної регресії з лінійними і квадратичними членами тільки, якщо у мене є лінійний коефіцієнт і квадратичний коефіцієнт , я можу сказати, що є точка повороту ймовірності на ?β1β1\beta_1β2β2\beta_2−β1/(2β2)−β1/(2β2)-\beta_1 / (2\beta_2)

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.