Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Поєднання інформації з декількох досліджень для оцінки середнього рівня та дисперсії нормально розподілених даних - байєсівський та метааналітичний підходи
Я розглянув набір робіт, кожен з яких повідомляє про спостережуване середнє значення та SD про вимірювання у відповідному зразку відомого розміру, . Я хочу зробити найкращу здогадку про ймовірний розподіл тієї ж міри в новому дослідженні, яке я розробляю, і наскільки невизначеність у цій здогадці. Я радий вважати ).ХХXннnХ∼ N( …

1
Перетворення (нормалізація) дуже малих значень ймовірності у ймовірність
Я пишу алгоритм, де, задаючи модель, я обчислюю ймовірність списку наборів даних, а потім потрібно нормалізувати (до ймовірності) кожного з вірогідних. Тож щось на зразок [0,00043, 0,00004, 0,00321] може бути перетворене на таке, як [0,2, 0,03, 0,77]. Моя проблема полягає в тому, що ймовірність журналу, з якою я працюю, зовсім …

3
Як і коли використовувати коригування Bonferroni
У мене є два питання щодо використання коригування Bonferroni: Чи доцільно використовувати коригування Bonferroni у всіх випадках багаторазового тестування? Якщо хтось проводить тест на наборі даних, то він розбиває цей набір на більш тонкі рівні (наприклад, розділить дані за статтю) та виконує ті самі тести, як це може вплинути на …

6
Яка різниця між описовою та інфекційною статистикою?
Моє розуміння полягало в тому, що описова статистика кількісно описує особливості вибірки даних, тоді як інфекційна статистика робила висновки про популяції, з яких брали зразки. Однак на сторінці вікіпедії для статистичного висновку зазначено: Здебільшого статистичні умовиводи висловлюють положення про популяції, використовуючи дані, отримані від сукупності, що цікавить, за допомогою якоїсь …

6
Задні дуже відрізняються від попереднього та ймовірного
Якщо пріоритет і ймовірність сильно відрізняються один від одного, то іноді виникає ситуація, коли задній не схожий ні на один. Дивіться, наприклад, цю картинку, яка використовує звичайні розподіли. Хоча це математично правильно, це, схоже, не відповідає моїй інтуїції - якщо дані не збігаються з моїми твердими переконаннями або даними, я …

1
Виявлення залишків у даних підрахунку
У мене є те, що я наївно вважав проблемою досить прямої, яка передбачає виявлення зовнішньої кількості для багатьох різних наборів даних про підрахунок. Зокрема, я хочу визначити, чи одне або більше значень у ряді даних підрахунку є вищими чи нижчими, ніж очікувалося, щодо решти підрахунків у розподілі. Помилковий фактор полягає …

3
Як перевірити нормальний розподіл за допомогою Excel для проведення t-тесту?
Я хочу знати, як перевірити набір даних на нормальність в Excel, просто щоб переконатися, що вимоги щодо використання t-тесту виконуються . Для правильного хвоста, чи доцільно просто обчислити середнє та стандартне відхилення, додайте 1, 2 та 3 стандартних відхилення від середнього, щоб створити діапазон, а потім порівняйте його з нормальним …

3
Маючи сполучник перед: Глибока властивість чи математична аварія?
Деякі дистрибутиви мають сполучені пріори, а деякі -. Це розрізнення лише випадковість? Тобто ви займаєтесь математикою, і це працює так чи інакше, але це насправді не говорить вам нічого важливого про розподіл, крім самого факту? Або наявність чи відсутність сполучників попередньо відображає якусь глибшу властивість розподілу? Чи поділяються дистрибутиви зі …

5
Випадковий ліс проти регресії
Я запустив регресійну модель OLS на наборі даних з 5 незалежними змінними. Незалежні змінні та залежні змінні є одночасно безперервними та лінійно пов'язаними. Площа R становить близько 99,3%. Але коли я запускаю те саме, використовуючи випадковий ліс у R, то мій результат '% Варіант пояснив: 88.42'. Чому випадковий лісовий результат …

5
Як контролювати витрати на помилкову класифікацію у випадкових лісах?
Чи можна контролювати вартість помилкової класифікації в пакеті R randomForest ? У моїй власній роботі хибні негативи (наприклад, помилки, що у людини може бути захворювання) набагато дорожчі, ніж помилкові позитиви. Пакет rpart дозволяє користувачеві контролювати витрати на помилкову класифікацію, визначаючи матрицю втрат, щоб по-різному визначити неправильні класифікації. Чи існує щось …

1
Які деякі вдосконалення щодо алгоритмів підручника MCMC, які люди використовують для байєсівського висновку?
Коли я кодую імітацію Монте-Карло для якоїсь проблеми, і модель досить проста, я використовую дуже базовий вибірковий зразок підручника Гіббса. Коли неможливо використовувати вибірку Гіббса, я кодую підручник «Метрополіс-Гастінгс», про який я дізнався роки тому. Єдина думка, яку я йому приділяю, - це вибір стрибкового розподілу або його параметрів. Я …

4
Багаторазова імпутація та вибір моделі
Множинна імпутація є досить простою, коли у вас є апріорна лінійна модель, яку ви хочете оцінити. Однак справи здаються дещо складнішими, коли ви насправді хочете зробити якийсь вибір моделі (наприклад, знайти "найкращий" набір змінних прогнозів з більшого набору змінних кандидатів - я маю на увазі конкретно LASSO та дробові поліноми, …

5
Джерела для вивчення (а не просто ведення) статистики / математики через R
Мене цікавлять приклади джерел (код R, пакети R, книги, розділи книг, статті, посилання тощо) для вивчення статистичних та математичних понять через R (це може бути і через інші мови, але R - мій улюблений аромат). Завдання полягає в тому, що вивчення матеріалу спирається на програмування, а не лише на те, …

3
Що відбувається, коли ви застосуєте SVD до проблеми спільної фільтрації? Яка різниця між ними?
У процесі спільної фільтрації у нас є значення, які не заповнені. Припустимо, користувач не переглянув фільм, тоді ми мусимо поставити "na" туди. Якщо я збираюсь взяти SVD цієї матриці, тоді мені потрібно ввести якесь число - скажімо 0. Тепер, якщо я розбиваю на матрицю, у мене є спосіб знайти подібних …

3
Порівняння та порівняння, p-значень, рівнів значущості та помилки типу I
Мені було цікаво, чи може хтось дати короткий пробіг щодо визначень та використання p-значень, рівня значущості та помилки типу I. Я розумію, що р-значення визначаються як "ймовірність отримання тестової статистики принаймні такої ж екстремальної, як та, яку ми насправді спостерігали", тоді як рівень значущості - це лише довільне значення відсічення …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.