Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як вертикально скласти два графіки з однаковою шкалою x, але різною шкалою y в R?
Привітання, В даний час я роблю наступне в R: require(zoo) data <- read.csv(file="summary.csv",sep=",",head=TRUE) cum = zoo(data$dcomp, as.Date(data$date)) data = zoo(data$compressed, as.Date(data$date)) data <- aggregate(data, identity, tail, 1) cum <- aggregate(cum, identity, sum, 1) days = seq(start(data), end(data), "day") data2 = na.locf(merge(data, zoo(,days))) plot(data2,xlab='',ylab='compressed bytes',col=rgb(0.18,0.34,0.55)) lines(cum,type="h",col=rgb(0,0.5,0)) Фрагмент резюме.csv: date,revision,file,lines,nclass,nattr,nrel,bytes,compressed,diff,dcomp 2007-07-25,16,model.xml,96,11,22,5,4035,991,0,0 2007-07-27,17,model.xml,115,16,26,6,4740,1056,53,777 …

5
Чи є змінна значення в лінійній регресійній моделі?
У мене лінійна регресійна модель із вибіркою та змінними спостереженнями, і я хочу знати: Чи є певна змінна достатньо важливою, щоб залишатися включеною в модель. Чи слід включити до моделі іншу змінну (із спостереженнями). Яка статистика може мені допомогти? Як отримати їх найбільш ефективно?

4
Як знайти інтервал довіри для загальної кількості подій
У мене є детектор, який буде виявляти подію з певною вірогідністю p . Якщо детектор каже, що відбулася подія, то це завжди так, тому немає помилкових позитивних результатів. Коли я запускаю його деякий час, я виявляю k події. Я хотів би порахувати, яка загальна кількість подій, що сталися, були виявлені …


2
Візуалізація декількох "гістограм" (бар-діаграм)
У мене виникають труднощі вибрати правильний спосіб візуалізації даних. Скажімо, у нас є книгарні, які продають книги , і кожна книга має принаймні одну категорію . Для книгарні, якщо порахувати всі категорії книг, ми отримуємо гістограму, яка показує кількість книг, які потрапляють у певну категорію для цієї книгарні. Я хочу …

2
Як визначити, чи підходить модель виживання з відсутніми даними?
Я трохи спрощуючи, я маю близько мільйона записів, які фіксують час входу та виходу людей у ​​систему, яка охоплює близько десяти років. Кожен запис має час входу, але не кожен запис має час виходу. Середній час роботи в системі становить ~ 1 рік. Часи виходу відсутні через дві причини: Людина …

1
Як можна використовувати оптимальне масштабування для масштабування порядкової категоріальної змінної?
У відповіді на це запитання про те, що категоричні дані розглядаються як безперервне , оптимальне масштабування, було зазначено. Як працює цей метод і як він застосовується?

4
Розрахунок співвідношення вибіркових даних, що використовуються для підгонки / навчання та перевірки моделі
За умови розміру вибірки "N", яку я планую використовувати для прогнозування даних. Які існують способи поділу даних, щоб я використовував деякі для встановлення моделі, а решту даних для перевірки моделі? Я знаю, що на це немає чорно-білої відповіді, але було б цікаво знати деякі "великі правила" або зазвичай використовувані співвідношення. …

7
Нормальний розподіл і монотонні перетворення
Я чув, що велика кількість, що зустрічається в природі, зазвичай розподіляється. Це, як правило, виправдано, використовуючи центральну граничну теорему, яка говорить про те, що при середньому значенні кількості iid випадкових величин ви отримуєте нормальне розподіл. Так, наприклад, ознака, яка визначається аддитивним ефектом великої кількості генів, може бути приблизно нормально розподілена, …

2
Чи впливає перехресна перевірка на її результати?
Як відомо, існує два популярних типи перехресної перевірки, K-кратна та випадкова підсистема (як описано у Вікіпедії ). Тим не менш, я знаю, що деякі дослідники роблять і публікують документи, де те, що описується як резюме в K-кратному стані, є насправді випадковим підмінами, тому на практиці ви ніколи не знаєте, що …




1
Різниця між Naive Bayes і періодичною нейронною мережею (LSTM)
Я хочу провести аналіз настрою на текст, пройшов кілька статей, деякі з них використовують "Naive Bayes", а інші - "Recurrent Neural Network (LSTM)" , з іншого боку я бачив бібліотеку пітонів для аналізу настроїв, які є nltk. Він використовує "Naive Bayes", може хто-небудь пояснити, в чому різниця між використанням цих …

4
Черв'як та яблуко Очікувана цінність
Яблуко знаходиться в вершині п'ятикутника , і черв'як знаходиться дві вершини вдалині, на . Щодня черв’як повзає з однаковою ймовірністю до однієї з двох сусідніх вершин. Таким чином, через добу черв'як знаходиться у вершині або , кожна з вірогідністю . Через два дні черв'як може знову опинитися у , оскільки …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.