Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Інтуїція та використання для коефіцієнта варіації
Зараз я відвідую курс «Вступ до менеджменту операцій» на Coursera.org. В якийсь момент курсу професор почав займатися різницею в часі операцій. Вимірювання, яке він використовує, - коефіцієнт варіації , співвідношення між середнім відхиленням і середнім: cv= σмкcv=σмкc_v = \frac{\sigma}{\mu} Навіщо використовувати це вимірювання? Які переваги та недоліки роботи з резюме …

1
Що таке "bagplot" або "biurariate boxplot"?
Я знайшов документ, який представляє багатовимірну (тут двовимірну) версію боксерської коробки - мішок. Яка саме ця сумка? Я бачу серію вкладених багатокутників на основі вершин, один з цих полігонів оголошений як мішок. Яка ідея побудови вкладеного багатокутника? Який із багатокутників - це торба (центральна чи середня кількість балів)? Чи володіють …

2
Чому дані слід переутворювати під нульовою гіпотезою під час тестування гіпотез під час завантаження?
Безпосереднє застосуванням методів бутстраповскіх для перевірки гіпотез є оцінка довірчого інтервалу тестової статистики & thetas шляхом багаторазового його розрахунку на бутстраповскіх зразках (Нехай статистика θ вибірку з початкового завантаження можна назвати ^ θ * ). Ми відкидаємо якщо гіпотезований параметр (який зазвичай дорівнює 0) лежить поза довірчим інтервалом .θ^θ^\hat{\theta}θ^θ^\hat{\theta}θ∗^θ∗^\hat{\theta^*}θ 0 …

2
Припущення щодо регресії Пуассона та тестування їх у R
Я хотів би перевірити, яка регресія найкраще відповідає моїм даним. Моя залежна змінна - кількість, і вона має багато нулів. І мені знадобиться допомога, щоб визначити, яку модель та сімейство використовувати (пуассон чи квазипоассон, або нульову завищену регресію пуассону) та як перевірити припущення. Регресія Пуассона: наскільки я розумію, сильне припущення …

2
Омега та альфа-надійність
Цікаво, чи хтось може пояснити, в чому головна відмінність між надійністю омеги та альфа? Я розумію, що надійність омеги базується на ієрархічній моделі факторів, як показано на наступному малюнку, і альфа використовує середні міжпозиційні кореляції. Що я не розумію, в якому стані коефіцієнт надійності омеги був би більшим, ніж альфа-коефіцієнт, …

1
Отримання різних результатів під час побудови 95% еліпсів CI за допомогою ggplot або пакета ellipse
Я хочу візуалізувати результати кластеризації (створені за допомогою protoclust{protoclust}), створюючи графіки скатера для кожної пари змінних, що використовуються для класифікації моїх даних, фарбування за класами та перекриття еліпсів для 95% довірчого інтервалу для кожного з класів (щоб перевірити, який Класи еліпсів перекриваються під кожною парою змінних). Я реалізував малюнок еліпсів …

3
Використання комп’ютерного моделювання для кращого розуміння статистичних понять на рівні випускників
Привіт, я беру аспірантуру зі статистики, і ми охоплювали тестові статистики та інші концепції. Однак мені часто вдається застосувати формули та розвинути своєрідну інтуїцію щодо того, як працюють речі, але я часто залишаюсь з відчуттям, що, можливо, якщо я підкріплюю своє дослідження симульованими експериментами, я розвину кращу інтуїцію в проблемних …

2
Побудова часового ряду, що включає в себе кілька спостережень за кожною датою
Я намагаюся застосувати часовий ряд до щоквартальних вибіркових даних (тваринна біомаса) протягом 10 років з 3 повторами на квартал. Тож 40 дат, але 120 загальних спостережень. Я читав до SARIMA'a в Shumway та Stoffer's Time Series Analysis, і це програми, а також знежирений Woodward та ін. Альфа - прикладний аналіз …
11 r  time-series 

2
Яка перевага зменшення розмірності предикторів для регресії?
Які застосування або переваги регресії зменшення розмірності (DRR) або контрольованих методів зменшення розмірності (SDR) в порівнянні з традиційними методами регресії (без зменшення розмірності)? Цей клас методів знаходить низьке розмірне представлення набору функцій для проблеми регресії. Приклади таких методів включають нарізану зворотну регресію, основні гессійські напрямки, оцінку середньої різниці нарізаних, зворотну …

1
Як оцінити верхню межу для логістичної регресії лише від 5 до 7 точок даних?
У мене є дані форми . Для оцінки від до я використовую формули цієї статті: Джон Фокс - нелінійна регресія та нелінійні найменші квадрати У цій роботі оцінюється , переглядаючи дані. Якщо я це зробити, це працює добре, навіть якщо у мене є лише три бали. З цього можу обчислити …

1
Чи можна ці дані зібрати в пропорції для біноміального glm?
Ми попросили 60 людей перерахувати стільки франшиз ресторану в Атланті, скільки могли. Загальний список включав понад 70 ресторанів, але ми усунули ті, про які згадувало менше 10% людей, залишивши нас 45. На ці 45 ми підрахували частку інформаторів, які перелічили франшизу, і нас цікавить моделювання цієї пропорції як функції рекламного …

5
Хороші книги з видобутку тексту?
Привіт, я хотів дізнатися, чи є якісь хороші книги з видобутку тексту та класифікації з деякими тематичними дослідженнями ?. Якби не деякі газети / журнали, доступні громадськості, це зробили б. Якщо вони ще краще проілюструють свої приклади з R Я не шукаю покрокового посібника, а щось, що ілюструє плюси і …

1
Як зафіксувати коефіцієнт у порядковій логістичній регресії без припущення пропорційних шансів у R?
Я хочу зробити порядкову логістичну регресію в R без припущення про пропорційність. Я знаю, що це можна зробити безпосередньо за допомогою vglm()функції в Rналаштуваннях parallel=FALSE. Але моя проблема полягає в тому, як виправити певний набір коефіцієнтів у цій регресійній установці? Наприклад, скажімо, що залежна змінна дискретна і порядкова і може …
11 r  regression  logistic 

4
Намагаєтеся обчислити індекс Джині для розподілу репутації StackOverflow?
Я намагаюся обчислити індекс Джині для розподілу репутації SO за допомогою SO Data Explorer. Рівняння, яке я намагаюся реалізувати, таке: Де: = кількість користувачів на сайті; = серійний ідентифікатор користувача (1 - 1,225,000); = репутація користувача .niyiiГ ( S) = 1n - 1( n + 1 - 2 ( ∑нi …
11 gini 

1
Чи можу я припустити (log-) нормальність для цього зразка?
Ось графік QQ для мого зразка (зверніть увагу на логарифмічну вісь Y); :n = 1000n=1000n = 1000 Як вказує Уубер, це вказує на те, що нижній розподіл є косим ліворуч (правий хвіст коротший). Використовуючи shapiro.test(на даних, перетворених журналом) в R, я отримую тестову статистику і p-значення , що означає, що …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.