Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Чи існують бібліотеки для методів, схожих на CART, які використовують розріджені прогнози та відповіді?
Я працюю з кількома великими наборами даних, використовуючи пакет gbm в Р. І моя матриця передбачення, і мій вектор відповідей досить рідкісні (тобто більшість записів дорівнює нулю). Я сподівався побудувати дерева рішень за допомогою алгоритму, який використовує цю обмеженість, як це було зроблено тут ). У цій роботі, як і …

2
Значення початкових ймовірностей переходу у прихованій марківській моделі
Які переваги надають певні початкові значення перехідним ймовірностям у прихованій моделі Маркова? Врешті-решт система їх вивчить, тож який сенс давати значення, крім випадкових? Чи змінюється базовий алгоритм, такий як Баум-Велч? Якщо я знаю ймовірності переходу на початку дуже точно, і моя головна мета - передбачити вихідні ймовірності з прихованого стану …

1
Модифікація лінійного балістичного акумулятора (LBA) в R
Модель "Лінійний балістичний акумулятор" (LBA) - досить вдала модель поведінки людини у швидких простих завданнях рішення. Donkin і ін (2009, PDF ) надати код , який дозволяє оцінити параметри моделі даної поведінкові дані людини, і я скопіював цей код (з деякими незначними змінами форматування) по суті тут . Однак я …

2
Яка сила тесту на регресію F?
Класичний F-тест для підмножини змінних у багатолінійній регресії має вигляд деSSE(R)- це сума помилок у квадраті за 'зменшеною' моделлю, яка гніздиться всередині 'великої' моделіB, аdf- ступеня свободи двох моделей. Згідно з нульовою гіпотезою, що додаткові змінні в 'великій' моделі не мають лінійної пояснювальної сили, статистика розподіляється як F зdfR-dfBіdfBступенями свободи.Ж= …

1
Зменшення кількості рівнів невпорядкованої категоричної змінної предиктора
Я хочу навчити класифікатор, скажімо, SVM, або випадковий ліс, або будь-який інший класифікатор. Однією з особливостей у наборі даних є категоріальна змінна з 1000 рівнями. Який найкращий спосіб зменшити кількість рівнів у цій змінній. У R є функція, що називається combine.levels()в пакеті Hmisc , яка поєднує в собі нечасті рівні, …

1
Що це за "максимальний коефіцієнт кореляції"?
Типовою статистикою обробки зображень є використання функцій текстури Haralick , яких 14. Мене цікавить 14-та з цих особливостей: З огляду на карту суміжності (яку ми можемо просто переглянути емпіричним розподілом двох цілих чисел i , j < 256 ), вона визначається як: квадратний корінь другого власного значення Q , де …

2
Чи варто публікувати на рецензованій вікі StatProb.com? [зачинено]
Закрито . Це питання ґрунтується на думці . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб на нього можна було відповісти фактами та цитатами, відредагувавши цю публікацію . Закрито 7 місяців тому . Фон Я читав про StatProb.com з коментаря до блогу Ендрю Гельмана . За даними …

1
Визначення, чи є зміна часового ряду статистично значущою
Я маю загальну кількість дзвінків, що надійшли щотижня, і склав їх на графіку, починаючи майже 3 роки. На очей здається, що на Різдво відбулося масове падіння, яке, схоже, не відновилося, схоже, що в запитах сталася крокова зміна. Чи є тест, який я можу зробити, що може кількісно оцінити цю різницю? …

2
Чи є спосіб пояснити передбачення з випадкової лісової моделі?
Скажіть, у мене є модель прогностичної класифікації на основі випадкового лісу (використовуючи пакет randomForest в R). Я хотів би налаштувати його так, щоб кінцеві користувачі могли вказати елемент для створення прогнозу, і він виведе ймовірність класифікації. Поки жодних проблем. Але було б корисно / здорово мати можливість вивести щось на …

4
Як генерувати випадкову матрицю кореляції, яка має приблизно нормально розподілені позадіагональні записи із заданим стандартним відхиленням?
Я хотів би створити випадкову кореляційну матрицю таким, щоб розподіл її позадіагональних елементів виглядав приблизно як нормальний. Як я можу це зробити? Мотивація така. Для набору даних із часових рядів кореляційний розподіл часто виглядає досить близьким до нормального. Я хотів би генерувати багато "нормальних" кореляційних матриць для представлення загальної ситуації …

4
Що означає перенапруження дослідження?
Що означає перенапруження дослідження? Моє враження полягає в тому, що це означає, що розміри вибірки настільки великі, що ви маєте змогу визначати мізерні розміри ефектів. Ці розміри ефектів, можливо, настільки малі, що вони швидше є наслідком незначних упереджень у процесі вибірки, ніж (не обов'язково прямого) причинного зв'язку між змінними. Це …

3
Вимірювання нелінійної залежності
Коваріація між двома випадковими змінними визначає міру того, наскільки вони лінійно пов'язані між собою. Але що робити, якщо спільний розподіл круговий? Звичайно, в структурі розподілу є структура. Як ця структура видобувається?

2
Як намалювати графік взаємодії з довірчими інтервалами?
Мої спроби: Я не міг отримати інтервали довіри в interaction.plot() з іншого боку, plotmeans()пакет "gplot" не відображав би два графіки. Крім того, я не міг накласти два plotmeans()графіки один на інший, тому що за замовчуванням вісь відрізняється. Я мав певний успіх, використовуючи plotCI()пакет 'gplot' і накладаючи два графіки, але все-таки …

2
Як вибрати кількість компонентів для незалежного аналізу компонентів?
За відсутності хороших апріорних здогадок про кількість компонентів, які потрібно запитати в незалежному аналізі компонентів, я прагну автоматизувати процес відбору. Я думаю, що розумним критерієм може бути число, яке мінімізує глобальні докази кореляції між обчисленими компонентами. Ось псевдокод такого підходу: for each candidate number of components, n: run ICA specifying …
11 ica 

1
Вірогідність покриття базового інтервалу надійності завантаження
У мене є питання щодо курсу, над яким я працюю: Проведіть дослідження в Монте-Карло, щоб оцінити ймовірність покриття стандартного нормального довірчого інтервалу завантаження та основного довірчого інтервалу завантажувальної стрічки. Вибірка з нормальної сукупності та перевірка рівня емпіричного покриття для середньої вибірки. Ймовірності покриття для звичайного звичайного інтерфейсу завантаження: n = …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.