Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як я можу використовувати логістичну регресію бета-версії + необроблені дані для отримання ймовірностей
У мене встановлена ​​модель (з літератури). У мене також є вихідні дані для прогнозних змінних. Яке рівняння я повинен використовувати для отримання ймовірностей? В основному, як я поєдную необроблені дані та коефіцієнти для отримання ймовірностей?

5
Чи може очищення даних погіршити результати статистичного аналізу?
Збільшення кількості випадків та випадків смерті відбувається під час епідемій (раптове збільшення кількості) через циркуляцію вірусу (як Вірус Західного Нілу в США у 2002 р.) Або зменшення опірності людей, забруднення їжі чи води або збільшення кількості комарі. Ці епідемії представлятимуть пережиті люди, які можуть виникати кожні 1 - 5 років. …

2
Модель виживання для прогнозування Churn - прогнози, що змінюються у часі?
Я хочу створити модель прогнозування для прогнозування відбиття і хочу використати дискретну модель виживання часу, пристосовану до набору даних щодо персонального періоду (по одному рядку для кожного клієнта та дискретному періоду, яким вони загрожували, з показником для події - рівним 1 якщо збивання трапилося в той період, інше 0). Мені …

1
Логіка F-тесту ANOVA в простому лінійному регресії
Я намагаюся зрозуміти логіку, що стоїть на F-тесті ANOVA в простому лінійному регресійному аналізі. Питання, яке у мене таке, наступне. Коли значення F, тобто MSR/MSEвелике, ми приймаємо модель як значущу. У чому полягає логіка цього?
17 regression  anova 

1
Як створити кольорові таблиці за допомогою Sweave та xtable? [зачинено]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 2 роки тому . Я використовую Sweave та xtable для створення звіту. Я хотів би додати трохи фарбування на стіл. Але мені не вдалося знайти жодного …

3
Аналіз головних компонентів «назад»: скільки дисперсії даних пояснюється заданою лінійною комбінацією змінних?
Я провів аналіз головних компонентів шести змінних , , , , і . Якщо я правильно розумію, непроведений PC1 підказує мені, яка лінійна комбінація цих змінних описує / пояснює найбільшу дисперсію даних, а PC2 повідомляє мені, яка лінійна комбінація цих змінних описує наступну найбільшу дисперсію даних та ін.AAABBBCCCDDDEEEFFF Мені просто …

3
Коли корисна у використанні інтерактивна візуалізація даних?
Готуючись до бесіди, яку я незабаром розповім, я нещодавно почав розбиратися у двох основних (безкоштовних) інструментах для інтерактивної візуалізації даних: GGobi та mondrian - обидва пропонують широкий спектр можливостей (навіть якщо вони трохи помийні). Я хочу попросити вашої допомоги в артикуляції (як для себе, так і для своєї майбутньої аудиторії) …

2
Чи "кожен синій футболка" є систематичним зразком?
Я викладаю клас введення статистики та переглядав типи вибірки, включаючи систематичну вибірку, де ви відбираєте вибірки кожного kth окремого чи об'єкта. Студент запитав, чи буде відбирати вибірки у кожної людини з певною характеристикою те саме. Наприклад, чи було б вибірки кожної людини з блакитною футболкою досить випадковим і забезпечили б …
17 sampling 

2
Статистичний пейзаж
Хтось написав коротке опитування різних підходів до статистики? До першого наближення ви маєте частолістську та баєсівську статистику. Але коли ви придивитесь ближче, у вас є й інші підходи, такі як вірогідність та емпіричний Байєс. І тоді у вас є підрозділи в таких групах, як суб'єктивний Байєс, об'єктивний Байєс, в баєсівській …

7
Чи є середня справедливіша за середню?
Нещодавно я прочитав пораду про те, що зазвичай слід застосовувати медіану, а не означає, щоб знищити людей, що живуть. Приклад: Наступна стаття http://www.amazon.com/Forensic-Science-Introduction-Scientist-Investigative/product-reviews/1420064932/ на даний момент має 16 відгуків: review= c(5, 5, 5, 5, 5, 5, 5, 5, 5, 5, 4, 4, 3, 2, 1, 1) summary(review) ## "ordinary" summary …
17 mean  median  average 

3
Логістична регресія та структура набору даних
Я сподіваюся, що зможу задати це питання правильним способом. У мене є доступ до даних відтворення, тому це більше питання з найкращим підходом та правильним конструюванням даних. Що я хочу зробити, це підрахувати ймовірність виграти гру в НХЛ, враховуючи рахунок та час, що залишився в регулюванні. Я думаю, я міг …

8
Міра якості кластеризації
У мене є алгоритм кластеризації (не k-означає) з вхідним параметром (кількість кластерів). Після виконання кластеризації я хотів би отримати деякий кількісний показник якості цього кластеризації. Алгоритм кластеризації має одну важливу властивість. Для якщо я подаю точок даних без будь-якої суттєвої різниці між ними до цього алгоритму, я отримаю один кластер, …
17 clustering 

2
Непараметричний байєсівський аналіз в R
Я шукаю гарний підручник з кластеризації даних при Rвикористанні ієрархічного процесу діріхле (HDP) (один з останніх і популярних непараметричних методів Байєса). Існує DPpackage(ІМХО, найбільш повний з усіх доступних) Rдля непараметричного байєсівського аналізу. Але я не в змозі зрозуміти приклади, подані в R Newsпосібнику з посібника або в його посібнику досить …

5
Простий, надійний, відкритий та сумісний формат простого тексту для зберігання даних
У попередньому запитанні я запитав про інструменти для редагування файлів CSV . Гевін посилається на коментар до R Help від Duncan Murdoch, припускаючи, що формат обміну даними - більш надійний спосіб зберігання даних, ніж CSV. Для деяких додатків потрібна спеціальна система управління базами даних. Однак для невеликих масштабів аналізу даних …

2
Навіщо використовувати масштаб Платта?
Для того, щоб відкалібрувати рівень довіри до ймовірності в контрольованому навчанні (скажімо, зіставити довіру з SVM або дерева рішень за допомогою проб даних), одним із методів є використання масштабування Платта (наприклад, отримання каліброваних ймовірностей з підвищення рівня ). В основному використовується логістична регресія для відображення на . Залежна змінна є …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.