Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

6
Розмір вибірки для логістичної регресії?
Я хочу зробити логістичну модель зі своїх даних опитування. Це невелике опитування чотирьох житлових колоній, в якому було опитано лише 154 респонденти. Моя залежна змінна - "задовільний перехід до роботи". Я виявив, що з 154 респондентів 73 сказали, що вони задовільно перейшли на роботу, а решта - не. Тож залежна …

4
Чи є сітки лінії та сірі фони графічними, і чи слід їх використовувати лише за винятком?
Здається, що більшість органів влади погоджуються, що темні або інакше видатні сітки в сюжетах є "діаграмою" за будь-яким розумним визначенням і відволікають глядача від повідомлення в основній частині діаграми. Тому я не буду намагатися наводити посилання на цю тему. Точно так же, ми всі можемо погодитися , що там буде …

2
Які існують стандартні практики створення синтетичних наборів даних?
Як контекст: Під час роботи з дуже великим набором даних мене іноді запитують, чи можемо ми створити синтетичний набір даних, де ми «знаємо» взаємозв'язок між предикторами та змінною відповіді або відносини між предикторами. З роками я, мабуть, стикаюся або з одноразовими синтетичними наборами даних, схожими на те, що вони були …


9
Вимірювання точності моделі на основі логістичної регресії
У мене є навчена модель логістичної регресії, яку я застосовую до набору даних тестування. Залежна змінна - двійкова (булева). Для кожного зразка в наборі даних тестування я застосовую логістичну регресійну модель, щоб генерувати% ймовірність того, що залежна змінна буде істинною. Потім я записую, чи було акустичне значення правдивим чи хибним. …

3
Відмінності між MANOVA та повторними заходами ANOVA?
Яка різниця між повторними заходами ANOVA над деяким фактором (скажімо, експериментальним станом) та MANOVA? Зокрема, один веб-сайт, на який я натрапив, припустив, що MANOVA не робить те саме припущення про сферичність, яке робить повторні заходи ANOVA, це правда? Якщо так, то чому б не просто завжди використовувати MANOVA? Я намагаюся …

6
Яка ймовірність я походити від конкретної людини, народженої в 1300 році?
Іншими словами, виходячи з наступного, що таке p? Для того, щоб зробити це математичною проблемою, а не антропологією чи суспільствознавством, а також спростити проблему, припустимо, що товаришів обирають з однаковою ймовірністю для всієї сукупності, за винятком того, що брати і сестри та перші родички ніколи не спарюються, а товариші завжди …

4
Імпортна ціна акцій з Yahoo Finance в R?
Заблокований . Це питання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Я хотів би імпортувати ціну акцій «Остання торгівля» з фінансів Yahoo у Р. Наміром є робота з (майже) даними в реальному часі. Чи є рішення? Заздалегідь …
26 r 

3
Що таке тета при негативній біноміальній регресії з R?
У мене виникло питання щодо негативної біноміальної регресії: Припустимо, у вас є такі команди: require(MASS) attach(cars) mod.NB<-glm.nb(dist~speed) summary(mod.NB) detach(cars) (Зауважте, що автомобілі - це набір даних, який доступний в R, і мені не дуже важливо, чи має ця модель сенс.) Що я хотів би знати: це як інтерпретувати змінну theta(повернуту …

2
Чи має ім'я розподілу ?
Днями я перебіг цю щільність. Хтось назвав це ім'я? f(x)=log(1+x−2)/2πf(x)=log⁡(1+x−2)/2πf(x) = \log(1 + x^{-2}) / 2\pi Щільність є нескінченною на початку, і вона також має жирові хвости. Я бачив, що він використовувався як попередній розподіл у контексті, коли очікувалося, що багато спостережень будуть невеликими, хоча великі значення також очікувалися.

3
Чи є сенсом перевірити нормальність із дуже малим розміром вибірки (наприклад, n = 6)?
У мене розмір вибірки 6. У такому випадку чи є сенс перевіряти нормальність за допомогою тесту Колмогорова-Смірнова? Я використовував SPSS. У мене дуже невеликий розмір вибірки, оскільки потрібен час, щоб отримати кожен. Якщо це не має сенсу, скільки зразків є найменшим числом, яке має сенс тестувати? Примітка. Я робив експеримент, …

4
Чому RANSAC не використовується найбільш широко в статистиці?
Виходячи з області комп’ютерного зору, я часто використовував метод RANSAC (Random Sample Consensus) для пристосування моделей до даних з великою кількістю видатків. Однак я ніколи не бачив, щоб його використовували статистики, і я завжди мав враження, що це не вважається "статистично обгрунтованим" методом. Чому це так? Він є випадковим за …

3
Як зрозуміти вихід з функції polr R (упорядкована логістична регресія)?
Я новачок у R, замовлений логістичний регрес та polr. Розділ "Приклади" внизу сторінки довідки для polr (який відповідає логістичній або пробітній регресії моделі впорядкованому фактору) options(contrasts = c("contr.treatment", "contr.poly")) house.plr <- polr(Sat ~ Infl + Type + Cont, weights = Freq, data = housing) pr <- profile(house.plr) plot(pr) pairs(pr) Яку …
26 r  logistic 

1
Як можна емпірично продемонструвати в R, яким методам перехресної перевірки AIC та BIC є рівнозначними?
У запитанні в іншому місці на цьому веб-сайті кілька відповідей згадували, що АПК еквівалентна перехресній валідації "відхід" (LOO) і що BIC еквівалентна перехресній валідації K-кратного. Чи є спосіб емпірично продемонструвати це в R таким чином, щоб методи, які беруть участь у LOO та K-кратному рівні, були зрозумілі та продемонстровані як …
26 r  aic  cross-validation  bic 

11
Книжкові рекомендації для багатоваріантного аналізу
Мені цікаво отримати кілька книжок про багатофакторний аналіз, і мені потрібні ваші рекомендації. Безкоштовні книги завжди вітаються, але якщо ви знаєте про чудову невільну книгу MVA, будь ласка, озвучте її.

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.