Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Перехресна перевірка та налаштування параметрів
Чи може хто-небудь сказати мені, що саме дає аналіз перехресної перевірки? Це просто середня точність чи вона дає будь-яку модель з налаштованими параметрами? Тому що я десь чув, що для настройки параметрів використовується перехресна перевірка.


1
Як перевірити статистичну значимість категоріальної змінної в лінійній регресії?
Якщо в лінійній регресії у мене є категоріальна змінна ... як я можу знати статичну значимість категоріальної змінної? Скажімо , фактор X1X1X_1 має 10 рівнів ... буде 10 різних результуючі значення т-під парасольки змінної один фактор ...X1X1X_1 Мені здається, що статистичне значення перевіряється для кожного рівня факторної змінної? Ні? @Macro: …

3
Чи краще побудувати класифікатор багатокласового рівня, ніж кілька двійкових?
Мені потрібно класифікувати URL-адреси на категорії. Скажімо, у мене є 15 категорій, на які я планую занулювати кожну URL-адресу. Чи краще 15-ти класичний класифікатор? Де я маю 15 міток і генерую функції для кожної точки даних. Або створити 15 двійкових класифікаторів, скажімо: Movie чи Non-Movie, і використати цифри, які я …

1
Якщо довірчі інтервали для коефіцієнтів лінійної регресії повинні базуватися на нормалі або
Будемо мати лінійну модель, наприклад просто просту ANOVA: # data generation set.seed(1.234) Ng <- c(41, 37, 42) data <- rnorm(sum(Ng), mean = rep(c(-1, 0, 1), Ng), sd = 1) fact <- as.factor(rep(LETTERS[1:3], Ng)) m1 = lm(data ~ 0 + fact) summary(m1) Результат такий: Call: lm(formula = data ~ 0 + …

1
Багатоваріантний нормальний задній
Це дуже просте запитання, але я не можу знайти виведення ні в Інтернеті, ні в книзі. Мені б хотілося побачити, як один баєс оновляє багатоваріантний нормальний розподіл. Наприклад: уявіть це P(x|μ,Σ)P(μ)==N(μ,Σ)N(μ0,Σ0).P(x|μ,Σ)=N(μ,Σ)P(μ)=N(μ0,Σ0). \begin{array}{rcl} \mathbb{P}({\bf x}|{\bf μ},{\bf Σ}) & = & N({\bf \mu}, {\bf \Sigma}) \\ \mathbb{P}({\bf \mu}) &= & N({\bf \mu_0}, …

1
MLE проти найменших квадратів у примірному розподілі ймовірностей
Враження, яке я склав, грунтуючись на кількох прочитаних нами працях, книгах та статтях, полягає в тому, що рекомендований спосіб встановлення розподілу ймовірностей на набір даних - це використання максимальної оцінки ймовірності (MLE). Однак, як фізик, більш інтуїтивно зрозумілим способом є просто пристосування pdf моделі до емпіричного pdf даних, використовуючи найменші …


2
Як інтерпретувати коефіцієнти з логістичної регресії?
У мене є така функція ймовірності: Проблема = 11 + е- zПроб=11+е-z\text{Prob} = \frac{1}{1 + e^{-z}} де z= В0+ В1Х1+ ⋯ + BнХн.z=Б0+Б1Х1+⋯+БнХн.z = B_0 + B_1X_1 + \dots + B_nX_n. Моя модель виглядає так Pr(Y=1)=11+exp(−[−3.92+0.014×(gender)])Pr(Y=1)=11+exp⁡(−[−3.92+0.014×(gender)])\Pr(Y=1) = \frac{1}{1 + \exp\left(-[-3.92 + 0.014\times(\text{gender})]\right)} Я розумію, що означає перехоплення (3,92), але зараз …

1
Як працює тест на квадрат Пірсона
Після нещодавнього голосування за відмову я намагався перевірити своє розуміння тесту Пірсона на квадрат. Зазвичай я використовую статистику хі-квадрата (або зменшену статистику чи-ква) для підгонки або перевірки отриманої придатності. У цьому випадку дисперсія зазвичай не є очікуваною кількістю підрахунків у таблиці чи гістограмі, а деякою експериментально визначеною дисперсією. Так чи …

2
Найкращий спосіб виконати багатокласний SVM
Я знаю, що SVM - це двійковий класифікатор. Я хотів би поширити його на багатокласний SVM. Який найкращий, а може, найпростіший спосіб його виконання? код: в MATLAB u=unique(TrainLabel); N=length(u); if(N>2) itr=1; classes=0; while((classes~=1)&&(itr<=length(u))) c1=(TrainLabel==u(itr)); newClass=double(c1); tst = double((TestLabel == itr)); model = svmtrain(newClass, TrainVec, '-c 1 -g 0.00154'); [predict_label, accuracy, …

2
Чи є графічне зображення компромісу дисперсії зміщення в лінійній регресії?
Я страждаю від затемнення. Мені було подано наступне зображення, щоб продемонструвати компроміс-відхилення в контексті лінійної регресії: Я можу бачити, що жодна з двох моделей не підходить. "Прості" не оцінюють складність XY-відношення, а "комплекс" - це просто надмірно, в основному вивчаючи дані тренувань напам'ять. Однак я цілком не бачу упередженості та …

2
Чому класифікатор регресійного регресу досить добре працює для класифікації тексту?
Під час експерименту з класифікації тексту я виявив класифікатор хребта, що генерує результати, які постійно перевершують тести серед тих класифікаторів, які частіше згадуються та застосовуються для завдань з виведення тексту, таких як SVM, NB, kNN тощо. Хоча я ще не розробив про оптимізацію кожного класифікатора в цій конкретній задачі класифікації …

2
Випадкова хода з імпульсом
Розглянемо ціле випадкове прогулянку, починаючи з 0, з наступними умовами: Перший крок плюс-мінус 1, з однаковою ймовірністю. Кожен наступний крок: 60%, ймовірно, будуть в тому ж напрямку, що і попередній крок, 40%, ймовірно, будуть у зворотному напрямку Яке розповсюдження дає це? Я знаю, що випадковий хід без імпульсу дає нормальне …

4
Вузький інтервал довіри - більша точність?
У мене є два питання щодо довірчих інтервалів: Мабуть, вузький довірчий інтервал означає, що існує менший шанс отримати спостереження протягом цього інтервалу, отже, наша точність вище. Також 95% довірчий інтервал вужчий, ніж 99% довірчий інтервал, який ширший. Інтервал довіри 99% є більш точним, ніж 95%. Чи може хтось дати просте …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.