Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

5
Чи можу я використовувати «ліве око» та «праве око» у своїй вибірці як два різних предмета?
Мої дані такі. У мене дві групи пацієнтів. Пацієнтам кожної групи проводився різний тип операцій на очах. 5 змінних вимірювали на пацієнтах у кожній групі. Я хочу порівняти ці змінні між двома групами за допомогою тесту на перестановку або MANOVA. Око, на якому було зроблено операцію, насправді не має значення …
11 sampling 

2
Як знайти групування (траєкторії) серед поздовжніх даних?
Контекст Я хочу встановити сцену, перш ніж дещо розширювати питання. У мене є поздовжні дані, вимірювання, проведені на суб'єктах приблизно кожні 3 місяці, первинний результат є числовим (як у безперервному до 1dp) в межах від 5 до 14, а основна маса (усіх точок даних) становить від 7 до 10. Якщо …

1
Визначення оптимальної дискретизації даних від безперервного розподілу
Припустимо , що у вас є набір даних Y1, . . . , YнY1,...,YnY_{1}, ..., Y_{n} від безперервного розподілу з щільністю підтримуваної на що невідомо, але досить велика, тому оцінка щільності ядра (наприклад), , є досить точний. Для конкретного застосування мені потрібно перетворити спостережувані дані в кінцеву кількість категорій, щоб …

1
Як намалювати сюжетний осад у пітоні? [зачинено]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закритий минулого року . Я використовую сингулярне векторне розкладання на матриці та отримую матриці U, S та Vt. На даний момент я намагаюся вибрати поріг для кількості …


4
Чи бувають випадки, коли в k-засобів немає оптимального k?
Це було в моїй свідомості принаймні кілька годин. Я намагався знайти оптимальний k для виходу з алгоритму k-означає (з метрикою косинусної схожості ), тому в кінцевому підсумку побудував спотворення як функцію від кількості кластерів. Мій набір даних - це колекція 800 документів у 600-мірному просторі. З того, що я розумію, …

2
Статистика замовлень (наприклад, мінімум) нескінченної колекції чи-квадратних змінних?
Тут у мене вперше, тому, будь ласка, повідомте мене, чи можу я прояснити своє питання будь-яким способом (у тому числі форматування, теги тощо). (І, сподіваюся, я можу відредагувати пізніше!) Я намагався знайти посилання та намагався вирішити себе за допомогою індукції, але не вдалося в обох. Я намагаюся спростити розподіл, який, …

2
Впорядкування дерева класифікації (в rpart) в набір правил?
Чи існує спосіб побудувати складне дерево класифікації за допомогою rpart (в R) для організації правил прийняття рішень для кожного класу? Отже, замість того, щоб отримати одне величезне дерево, ми отримаємо набір правил для кожного з класів? (якщо так, то як?) Ось простий приклад коду для показу прикладів на: fit <- …
11 r  classification  cart  rpart 

1
Які питання задає статистик щодо аналізу спалаху кишкової палички?
Ви , можливо, чули про нещодавній ентерогеморрагічна кишкова паличка ( EHEC ) спалаху в Німеччині . Які питання запитав би статистик щодо аналізу EHEC? Я думаю про Q + Як між журналістами / державними чиновниками ↔ неекспертами, скажімо, викладачами та інженерами зі ступенем диплома / магістра, але, максимум, трохи статистикою. …

1
Чому завантажувальне використання залишків із моделі змішаних ефектів дає антиконсервативні довірчі інтервали?
Зазвичай я маю справу з даними, де кілька осіб вимірюються кілька разів у кожному з двох або більше умов. Я нещодавно грав із моделюванням змішаних ефектів, щоб оцінити докази відмінностей між умовами, моделюючи individualяк випадковий ефект. Для візуалізації невизначеності щодо прогнозів такого моделювання я використовував завантажувальний запуск, де на кожній …

5
Кластеризація SOM для номінальних / кругових змінних
Цікаво, чи хтось знайомий з кластеризацією номінальних входів. Я розглядав SOM як рішення, але, мабуть, він працює лише з числовими характеристиками. Чи є розширення для категоричних ознак? Зокрема, мені було цікаво про "Дні тижня" як про можливі функції. Звичайно, можна перетворити його в числову ознаку (тобто пн - нд, що …

3
Як порівняти два набори даних із графіком QQ за допомогою ggplot2?
Як і статистика, так і R-початківець, мені було дуже важко намагатися генерувати qqplots із співвідношенням сторін 1: 1. ggplot2, здається, пропонує набагато більший контроль над побудовою графіку, ніж пакети графіку R за замовчуванням, але я не можу зрозуміти, як зробити qqplot в ggplot2 для порівняння двох наборів даних. Отже, моє …

2
Візуалізація багатовимірних даних (LSI) у 2D
Я використовую приховану семантичну індексацію, щоб знайти схожість між документами ( спасибі, JMS! ) Після зменшення розміру я спробував кластеризувати k-засоби, щоб згрупувати документи в кластери, що працює дуже добре. Але я хотів би піти трохи далі і візуалізувати документи як набір вузлів, де відстань між будь-якими двома вузлами обернено …

7
Методика скорочення даних для виявлення типів країн
Викладаю вступний курс економічної географії. Щоб допомогти моїм студентам розвинути краще розуміння видів країн, що зустрічаються в сучасній світовій економіці, та оцінити методи скорочення даних, я хочу створити завдання, яке створює типологію різних країн (наприклад, з високим рівнем доходу, тривала тривалість життя mfg з доданою вартістю; експортер природних ресурсів з …

1
Помилка повідомляти з середнім та графічним зображеннями?
Я використовував широкий спектр тестів для моїх дипломних даних, від параметричних ANOVA та t-тестів до непараметричних тестів Крускала-Уолліса та Манна-Уїтні, а також двосторонніх перетворених ANOVA та GzLM з бінарними, дані про пуассоні та пропорції. Тепер мені потрібно повідомити про все, коли я все це пишу в своїх результатах. Я вже …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.