Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Приклади реальних процесів процесів рішення Маркова
Я переглядав багато навчальних відео, і вони виглядають однаково. Цей, наприклад: https://www.youtube.com/watch?v=ip4iSMRW5X4 Вони пояснюють стан, дії та ймовірності, які є нормальними. Людина пояснює це нормально, але я просто не можу здатися, що я розуміюсь, чим би це було використано в реальному житті. Я ще не зустрічав жодного списку. Найпоширеніший, який …

1
Чи було скопійовано повідомлення про найсучасніший результат використання векторів абзацу для аналізу настроїв?
Мене вразили результати в роботі ICML 2014 « Розподілені представлення вироків і документів » Ле та Міколова. Метод, який вони описують, називається "векторами абзацу", вивчає непідконтрольне уявлення довільно довгих абзаців / документів, заснованих на розширенні моделі word2vec. У статті представлено найсучасніші показники аналізу настроїв за допомогою цієї методики. Я сподівався …

1
Чому орієнтовні значення найкращого лінійного неупередженого прогноктора (BLUP) відрізняються від найкращого лінійного неупередженого оцінювача (BLUE)?
Я розумію, що різниця між ними пов’язана з тим, чи змінна групування в моделі оцінюється як фіксований або випадковий ефект, але мені незрозуміло, чому вони не однакові (якщо вони не однакові). Мене конкретно цікавить, як це працює при використанні оцінки невеликих площ, якщо це актуально, але я підозрюю, що питання …

4
Наскільки погана настройка гіперпараметрів за межами перехресної перевірки?
Я знаю, що здійснення настроювання гіперпараметрів поза перехресної перевірки може призвести до упереджених високих оцінок зовнішньої дійсності, тому що набір даних, який ви використовуєте для вимірювання продуктивності, той самий, який ви використовували для налаштування функцій. Мені цікаво, наскільки ця проблема погана . Я можу зрозуміти, як це було б по-справжньому …

1
Як використовувати метод дельти для стандартних помилок граничних ефектів?
Мене цікавить краще розуміння методу дельти для наближення стандартних помилок середніх граничних ефектів регресійної моделі, що включає термін взаємодії. Я розглянув пов'язані питання в рамках дельта-методу, але жодне не дало того, що я шукаю. Розглянемо такі приклади даних як мотивуючий приклад: set.seed(1) x1 <- rnorm(100) x2 <- rbinom(100,1,.5) y <- …

2
Як інтерпретувати ці сюжети ACF та Pacf
Далі наведені сюжети ACF та Pacf щомісячних даних. Другий сюжет - це acf з ci.type = 'ma': Наполегливість високих значень в сюжеті ACF, ймовірно, представляє довгострокову позитивну тенденцію. Питання полягає в тому, чи це означає сезонні зміни? Я намагався бачити різні сайти на цю тему, але не впевнений, чи показують …

2
Чи є якась перевага SVD над PCA?
Я знаю, як обчислити PCA та SVD математично, і я знаю, що обидва можна застосувати до регресії лінійних найменших квадратів. Основна перевага SVD математично виглядає в тому, що він може бути застосований до не квадратних матриць. Обидва фокусуються на розкладанні матриціОкрім переваги зазначеного SVD, чи є додаткові переваги чи розуміння, …
20 pca  least-squares  svd 

6
Чи є медіана тип середнього для деякого узагальнення “середнього”?
Поняття "середній" бродить набагато ширше, ніж традиційне середнє арифметичне; чи розтягується воно так далеко, щоб включати медіану? За аналогією, raw data⟶idraw data⟶meanraw mean⟶id−1arithmetic meanraw data⟶recipreciprocals⟶meanmean reciprocal⟶recip−1harmonic meanraw data⟶loglogs⟶meanmean log⟶log−1geometric meanraw data⟶squaresquares⟶meanmean square⟶square−1root mean squareraw data⟶rankranks⟶meanmean rank⟶rank−1medianraw data⟶idraw data⟶meanraw mean⟶id−1arithmetic meanraw data⟶recipreciprocals⟶meanmean reciprocal⟶recip−1harmonic meanraw data⟶loglogs⟶meanmean log⟶log−1geometric meanraw data⟶squaresquares⟶meanmean square⟶square−1root mean squareraw …
20 mean  average  median 

2
Методи обчислення факторних балів, а що таке матриця «коефіцієнт оцінки» в PCA або факторному аналізі?
Як я розумію, в PCA на основі кореляцій ми отримуємо факторні (= головний компонент в даному випадку) навантаження, які є не що інше, як кореляції між змінними та факторами. Тепер, коли мені потрібно генерувати факторні бали в SPSS, я можу безпосередньо отримати факторні бали кожного респондента за кожен фактор. Я …


1
Як отримати значення середньої квадратичної помилки в лінійній регресії в R
Нехай модель лінійної регресії, отримана функцією R, хотіла б знати, чи можливо її отримати за допомогою команди Середня квадратична помилка. У мене був наступний результат прикладу > lm <- lm(MuscleMAss~Age,data) > sm<-summary(lm) > sm Call: lm(formula = MuscleMAss ~ Age, data = data) Residuals: Min 1Q Median 3Q Max -16.1368 …
20 r  regression  error 

2
Відбір проб Гіббса порівняно із загальним MH-MCMC
Я щойно читав про вибірку Гіббса та алгоритм Metropolis Hastings і маю пару питань. Як я розумію, у випадку вибірки Гіббса, якщо у нас є велика багатоваріантна проблема, ми беремо вибірку з умовного розподілу, тобто вибірки однієї змінної, зберігаючи всі інші фіксованими, тоді як у MH ми робимо вибірку від …

3
Коефіцієнт тестової моделі (нахил регресії) проти деякого значення
В R, коли у мене є (узагальнена) лінійна модель ( lm, glm, gls, glmm, ...), як я можу перевірити коефіцієнт (регресійний нахил) в відношенні будь-якого іншого значення , ніж 0? У зведенні моделі автоматично підсумовуються результати коефіцієнта t-тесту, але лише для порівняння з 0. Я хочу порівняти його з іншим …
20 r  regression  t-test 

4
Чи існує алгоритм, що нагадує дерево рішень для непідконтрольного кластеризації?
У мене набір даних складається з 5 функцій: A, B, C, D, E. Всі вони є числовими значеннями. Замість того, щоб робити кластеризацію на основі щільності, я хочу зробити це кластеризувати дані у формі дерева, що нагадує рішення. Я маю на увазі такий підхід: Алгоритм може розділити дані на X …

2
ККТ проти необмеженої постановки регресії ласо
L1 пеналізована регресія (aka lasso) представлена ​​у двох складах. Нехай обидві цілі функції Q1=12||Y−Xβ||22Q2=12||Y−Xβ||22+λ||β||1.Q1=12||Y−Xβ||22Q2=12||Y−Xβ||22+λ||β||1. Q_1 = \frac{1}{2}||Y - X\beta||_2^2 \\ Q_2 =\frac{1}{2}||Y - X\beta||_2^2 + \lambda ||\beta||_1. Тоді два різних рецептури - argminβQ1argminβQ1 \text{argmin}_\beta \; Q_1 умови ||β||1≤t,||β||1≤t, ||\beta||_1 \leq t, і, що еквівалентно argminβQ2.argminβQ2. \text{argmin}_\beta \; Q_2. Використовуючи умови …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.