Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Як називається ця діаграма, що показує помилкові та справжні позитивні показники та як вона формується?
На зображенні нижче показано безперервну криву помилкових позитивних показників проти справжніх позитивних показників: Однак те, що я не одразу отримую, - це те, як розраховуються ці ставки. Якщо метод застосовується до набору даних, він має певну швидкість FP та певну швидкість FN. Чи це не означає, що кожен метод повинен …

2
Чи слід використовувати величину "N" у "Normal Distribution" на англійській англійській мові?
Це питання трохи ліворуч, але я подумав, що спільнота тут, мабуть, має сильні погляди на цю тему! Я пишу кандидатську дисертацію. Послідовно, кажучи про величини, які формально пов'язані з гауссовим розподілом, я заздалегідь використовував "N" у "Normal", щоб посилатися на них. Наприклад, "[... За таких обставин] отриманий розподіл не є …

1
Використання кореляції як метрики відстані (для ієрархічної кластеризації)
Я хотів би ієрархічно кластеризувати свої дані, але замість того, щоб використовувати евклідову відстань, я хотів би використовувати кореляцію. Крім того, оскільки коефіцієнт кореляції коливається від -1 до 1, причому як -1, так і 1 позначають "співрегуляцію" в моєму дослідженні, я розглядаю як -1, так і 1 як d = …

2
Які не байєсівські методи існують для прогнозного висновку?
За байєсівським висновком прогнозний розподіл для майбутніх даних виводиться шляхом інтеграції невідомих параметрів; інтеграція по задньому розподілу цих параметрів дає задній прогнозний розподіл - розподіл для майбутніх даних, що обумовлюються вже наявними. Які існують не байєсовські методи прогнозного висновку, які враховують невизначеність в оцінках параметрів (тобто вони не просто включають …

2
Shrunken vs unbiased : оцінювачі
У мене в голові з'явилася якась плутанина щодо двох типів оцінювачів популяційного значення коефіцієнта кореляції Пірсона. А. Фішер (1915) показав, що для біваріантної нормальної популяції емпіричний є негативно упередженим оцінником , хоча зміщення може бути практично значним лише для невеликого розміру вибірки ( ). Зразок r недооцінює \ rho в …


1
Вибір серед правильних правил скорингу
Більшість ресурсів на правильних правилах балів згадує низку різних правил скорингу, такі як втрата журналу, оцінка Brier або сферичне оцінювання. Однак вони часто не дають великих рекомендацій щодо відмінностей між ними. (Виставка А: Вікіпедія .) Вибір моделі, яка максимально збільшує логарифмічну оцінку, відповідає вибору моделі максимальної ймовірності, що здається хорошим …

2
Покрокова лінійна обчислення алгебри з регресією найменших квадратів
Як приворот до питання про лінійно-змішані моделі в R, і поділитися як орієнтир для початківців / проміжних прихильників статистики, я вирішив опублікувати як незалежний "Q & A-стиль" кроки, пов'язані з "ручним" обчисленням коефіцієнти та прогнозовані значення простої лінійної регресії. Приклад - вбудований R набір даних, mtcarsі він буде встановлений як …

1
Чому існують лише основних компонентів для даних, якщо кількість вимірів ?
У PCA, коли кількість розмірів більша (або навіть дорівнює) кількості зразків , чому саме у вас буде не більше власних векторів ? Іншими словами, ранг коваріаційної матриці серед розмірів - .dddNNNN−1N−1N-1d≥Nd≥Nd\ge NN−1N−1N-1 Приклад: ваші зразки - це векторизовані зображення розміром , але у вас лише зображень.d=640×480=307200d=640×480=307200d = 640\times480 = 307\,200N=10N=10N=10

2
Що таке "регресія зниженого рангу"?
Я читав "Елементи статистичного навчання" і не міг зрозуміти, про що йдеться в розділі 3.7 "Багаторазове скорочення та вибір". Це говорить про RRR (регресія зі зниженим рангом), і я можу лише зрозуміти, що передумова стосується узагальненої багатовимірної лінійної моделі, де коефіцієнти невідомі (і підлягають оцінці), але, як відомо, не мають …

4
Яка найкраща візуалізація для таблиць на випадок надзвичайних ситуацій?
Який найкращий сюжет, з статистичної точки зору, для відображення таблиці непередбачених ситуацій , яка, як правило, аналізується за допомогою тесту чи-квадрата? Це ухилена барплот, штабельна штанга, теплова карта, контурний графік, тремтіння розсіювання, кілька рядків або щось інше? Чи слід показувати абсолютні значення чи відсотки? Редагувати: Або, як підказує @forecaster у …

6
Розширені приклади регресійного моделювання
Я шукаю розширений випадок лінійної регресії, що ілюструє кроки, необхідні для моделювання складних, декількох нелінійних зв’язків за допомогою GLM або OLS. Напрочуд складно знайти ресурси, що виходять за рамки базових шкільних прикладів: більшість прочитаних книг не піде далі, ніж перетворення журналу відповіді, поєднане з BoxCox одного прогноктора, або природний сплайн …

3
Чи існує байєсівський підхід до оцінки щільності
Я зацікавлений , щоб оцінити щільність безперервної випадкової величини ХХX . Один із способів цього, який я дізнався, - це використання оцінки щільності ядра. Але зараз мене цікавить байєсівський підхід, що йде в наступних напрямках. Спочатку я вважаю , що ХХX слід розподіл ЖЖF . Я приймаю ннn свідчення ХХX …

2
Генерування даних за допомогою заданої матриці коваріації вибірки
З огляду на матрицю коваріації , як генерувати такі дані, щоб у них була матриця зразкової коваріації \ hat {\ boldsymbol \ Sigma} = \ boldsymbol \ Sigma_s ?ΣsΣs\boldsymbol \Sigma_sΣ^=ΣsΣ^=Σs\hat{\boldsymbol \Sigma} = \boldsymbol \Sigma_s Більш загально: нас часто цікавить генерування даних із щільності f(x|θ)f(x|θ) f(x \vert \boldsymbol\theta) , при цьому …


Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.