Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як перевірити рівність дисперсій з круговими даними
Мені цікаво порівняти величину варіабельності у межах 8 різних вибірок (кожна з різних сукупностей). Я знаю, що це можна зробити декількома методами з даними співвідношення: рівність дисперсії тесту F-тесту, тест Левене тощо. Однак мої дані кругові / спрямовані (тобто дані, які демонструють періодичність, наприклад, напрямок вітру та загальні кутові дані …

4
Чому рішення, що має найменший квадрат, дає в цьому випадку погані результати?
На сторінці 204, розділ 4, "Розпізнавання образів та машинне навчання" від Bishop є зображення, де я не розумію, чому рішення "Найменший квадрат" дає тут погані результати: У попередньому параграфі було сказано про те, що рішення з найменшими квадратами не мають надійності для людей, що випадають, як ви бачите на наступному …

4
Різниця між регресійним аналізом та аналізом дисперсії?
Це питання було перенесено з обміну стека математики, оскільки на нього можна відповісти на перехресній валідації. Мігрували 7 років тому . Я зараз навчаюсь регресійному аналізу та дисперсійному аналізу. При регресійному аналізі у вас є фіксована одна змінна, і ви хочете знати, як ця змінна йде з іншою змінною. При …
21 regression 

3
Що означає непозитивна визначена матриця коваріації про мої дані?
Я маю ряд багатоваріантних спостережень і хотів би оцінити щільність ймовірності для всіх змінних. Передбачається, що дані зазвичай розподіляються. При малій кількості змінних все працює так, як я очікував, але переміщення до більшої кількості призводить до того, що матриця коваріації стає не позитивно визначеною. Я звів проблему в Matlab до: …

4
Важливість предикторів у множинній регресії: Часткова проти стандартизованих коефіцієнтів
Мені цікаво, яка точна залежність між частковим та коефіцієнтами у лінійній моделі та чи слід використовувати лише один чи обидва для ілюстрації важливості та впливу факторів.R2R2R^2 Наскільки я знаю, summaryя отримую оцінки коефіцієнтів, а із anovaсумою квадратів для кожного фактора - частка суми квадратів одного множника, поділена на суму суми …

1
Залишкова діагностика в регресійних моделях на основі МСМС
Нещодавно я взявся за пристосування регресійних змішаних моделей у байєсівській основі, використовуючи алгоритм MCMC (фактично функція MCMCglmm в R). Я вважаю, що я зрозумів, як діагностувати конвергенцію процесу оцінки (слід, графік гевеке, автокореляція, задній розподіл ...). Одне з того, що мене вражає в байєсівських рамках, - це те, що, здається, …

1
Як я можу вирівняти / синхронізувати два сигнали?
Я займаюся деякими дослідженнями, але застряг на етапі аналізу (варто було б приділити більше уваги моїм лекціям із статистики). Я зібрав два одночасні сигнали: витрата інтегрований для гучності і зміни розширення грудної клітки. Я хотів би порівняти сигнали і, зрештою, сподіваюся отримати гучність від сигналу розширення грудної клітки. Але спочатку …

3
PCA, коли розмірність більша, ніж кількість зразків
Я натрапив на сценарій, коли у мене є 10 сигналів / людина на 10 осіб (тобто 100 зразків), що містять 14000 точок даних (розмірів), які мені потрібно передати класифікатору. Я хотів би зменшити розмірність цих даних, і PCA, здається, є способом зробити це. Однак мені вдалося знайти лише приклади PCA, …

3
Укладання / складання моделей з каре
Я часто ловлю себе на навчання кілька різних моделей прогнозування з використанням caretв Р. я буду навчати їх все на один і ту ж поперечних складках перевірки, з допомогою caret::: createFolds, а потім вибрати кращу модель , засновану на перехресній перевірці помилок. Однак середній прогноз декількох моделей часто перевершує найкращу …
21 r  caret  ensemble 

5
Новий революційний спосіб передачі даних?
Наступний уривок - це інтерв'ю із стабільно успішним менеджером хедж-фондів Джаффрі Вудріфом ( майстер 2012 року) Швагера ( Wizzards Market Wizzards) (травень 2012 року): На питання: "Які найстрашніші помилки люди роблять при обробці даних?": Дуже багато людей вважають, що це нормально, оскільки вони використовують взіркові дані для тренінгу, а позамобільні …

3
Перший крок для великих даних (
Припустимо, ви аналізуєте величезний набір даних у розмірі мільярдів спостережень на день, де кожне спостереження має кілька тисяч розріджених та, можливо, зайвих числових та категоріальних змінних. Скажімо, є одна проблема регресії, одна незбалансована проблема бінарної класифікації та одне завдання "з'ясувати, які прогнози є найважливішими". Моя думка, як підійти до проблеми: …

1
Коли Маркові випадкові поля
У підручнику, графічні моделях, експоненціальна сім'ї та варіаційні умовиводах , М. Йордані і М. Уейнрайт обговорюється зв'язок між експонентними родинами і марковскими випадковими полів (неорієнтовані графічні моделями). Я намагаюся краще зрозуміти стосунки між ними за допомогою наступних питань: Чи всі члени ДПС сімей експоненціалів? Чи можуть усі члени родин експоненціалів …

2
"Намір слідчого" та порогові значення / р-значення
Я читаю слайди Джона Крушке "Аналіз даних байєсівських даних" , але насправді виникає питання щодо його інтерпретації t-тестів та / або всієї системи тестування значущості гіпотез. Він стверджує, що значення p не визначено, оскільки вони залежать від намірів слідчого. Зокрема, він наводить приклад (сторінки 3-6) двох лабораторій, які збирають однакові …

2
Порівняння кластеризації: Індекс Rand та Варіації інформації
Мені було цікаво, чи хтось мав уявлення чи інтуїцію за різницею між варіацією інформації та індексом Rand для порівняння кластерів. Я прочитала документ " Порівняння кластерів - відстань, заснована на інформації " Марини Меліа (Journal of Multivariate Analysis, 2007), але, окрім зауваження різниці у визначеннях, я не розумію, що це …

1
Чому тест Левене на рівність дисперсій, а не відношення F?
SPSS використовує тест Levene для оцінки однорідності дисперсій у процедурі незалежного групового t-випробування. Чому тест Левене кращий, ніж просте співвідношення F у співвідношенні дисперсій двох груп?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.