Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Видалення меж на R ділянках для досягнення осі Туфте
Заблокований . Це питання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Розглянемо наступний графік: x <- 1:100 y1 <- rnorm(100) y2 <- rnorm(100)+100 par(mar=c(5,5,5,5)) plot(x,y1,pch=0,type="b",col="red",yaxt="n",ylim=c(-8,2),ylab="") axis(side=2, at=c(-2,0,2)) mtext("red line", side = 2, line=2.5, at=0) par(new=T) plot(x,y2,pch=1,type="b",col="blue",yaxt="n",ylim=c(98,108), ylab="") …

5
Основні статті про матричні декомпозиції
Нещодавно я прочитав книгу Skillicorn про матричні розклади та був трохи розчарований, оскільки був орієнтований на студентську аудиторію. Я хотів би скласти (для себе та інших) коротку бібліографію істотних статей (опитування, але також проривні статті) про матричні розклади. Я маю на увазі насамперед щось на SVD / PCA (і надійні …


3
Оцініть певний інтервал нормального розподілу
Я знаю, що легкої в обробці формули для CDF нормального розподілу дещо відсутня через складну функцію помилок у ній. Однак мені цікаво, чи є приємна формула для . Або яким може бути наближення "найсучаснішого" до цієї проблеми.N( c-≤ x &lt; c+| μ, σ2)N(c-≤х&lt;c+|мк,σ2)N(c_{-} \leq x < c_{+}| \mu, \sigma^2)

1
Чи правильно я обчислив ці коефіцієнти ймовірності?
Я автор пакета ez для R, і я працюю над оновленням для включення автоматичного обчислення коефіцієнтів ймовірності (LR) у висновок ANOVA. Ідея полягає в тому, щоб забезпечити LR для кожного ефекту, аналогічного випробуванню цього ефекту, якого досягає ANOVA. Наприклад, LR для основного ефекту являє собою порівняння нульової моделі з моделлю, …

2
Як порівнюється сила логістичної регресії та t-тесту?
Чи сила логістичної регресії та еквівалент t-тесту? Якщо це так, вони повинні бути "еквівалентом щільності даних", під яким я маю на увазі, що однакова кількість базових спостережень дає ту саму потужність за умови фіксованої альфа-0,05. Розглянемо два випадки: [Параметричний t-тест]: робиться 30 малюнків із біноміального спостереження та отримані значення усереднюються. …

4
Середні та середні властивості
Чи може хтось пояснити мені, що я зрозумів математичну логіку, яка поєднала б два твердження (а) та (б) разом? Будемо мати набір значень (деякий розподіл). Тепер, а) медіана не залежить від кожного значення [воно просто залежить від одного або двох середніх значень]; б) Медіана - це місце мінімальних відхилень суми …

5
Використання lmer для прогнозування
Привіт, у мене є дві проблеми, які звучать як природні кандидати для багаторівневих / змішаних моделей, які я ніколи не використовував. Найпростіший і той, який я сподіваюся спробувати як вступ, такий: Дані виглядають як багато рядків форми x y innergroup outergroup де x - числовий коваріат, на якому я хочу …

7
Як вивчення «стохастичних процесів» допоможе мені як статистику?
Я хочу вирішити, чи варто мені пройти курс під назвою "ВСТУП ДО СТОХАСТИЧНИХ ПРОЦЕСІВ", який відбудеться в наступному семестрі в моєму університеті. Я запитав викладача, як вивчення такого курсу допоможе мені як статистику, він сказав, що оскільки він виходить з вірогідності, він знає дуже мало статистики і не знає, як …

10
Стратегія редагування файлів значень, розділених комами (CSV)
Коли я працюю над проектами з аналізу даних, я часто зберігаю дані у файлах даних, розміщених комами або вкладками (CSV, TSV). Хоча дані часто належать до спеціалізованої системи управління базами даних. Для багатьох моїх заявок це було б надмірним речей. Я можу редагувати файли CSV та TSV в Excel (або, …

3
Як можна оцінити стандартні помилки коефіцієнта при використанні регресії хребта?
Я використовую регресію хребта на високо мультиколінеарних даних. Використовуючи OLS, я отримую великі стандартні похибки коефіцієнтів завдяки мультиколінеарності. Я знаю, що регресія хребта - це спосіб вирішити цю проблему, але в усіх реалізаціях регресії хребтів, які я переглянув, немає стандартних помилок, повідомлених для коефіцієнтів. Я хотів би дещо оцінити, наскільки …

4
Різниця між гістограмою та pdf?
Якщо ми хочемо наочно бачити розподіл безперервних даних, який з гістограм та pdf слід використовувати? Які відмінності між гістограмою та pdf не відрізняються від формули?

6
Гарне введення в різні види ентропії
Я шукаю книгу чи Інтернет-ресурс, який пояснює різні види ентропії, такі як Ентропія зразків та Ентропія Шеннона та їх переваги та недоліки. Чи може хтось вказати мені в правильному напрямку?


5
Чому ми не використовуємо t-розподіл для побудови довірчого інтервалу для пропорції?
Для обчислення довірчого інтервалу (CI) для середнього значення з невідомим стандартним відхиленням (sd) ми оцінюємо стандартне відхилення чисельності населення, використовуючи t-розподіл. Зокрема, CI=X¯±Z95%σX¯CI=X¯±Z95%σX¯CI=\bar{X} \pm Z_{95\% }\sigma_{\bar X} де σX¯=σn√σX¯=σn\sigma_{\bar X} = \frac{\sigma}{\sqrt n} . Але оскільки у нас немає точкової оцінки стандартного відхилення сукупності, ми оцінюємо через наближенняCI=X¯±t95%(se)CI=X¯±t95%(se)CI=\bar{X} \pm t_{95\% …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.