Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як знайти очікувану відстань між двома рівномірно розподіленими точками?
Якби я визначив координати і де(Х1,Y1)(X1,Y1)(X_{1},Y_{1})(Х2,Y2)(X2,Y2)(X_{2},Y_{2}) Х1,Х2∼ Unif ( 0 , 30 ) і Y1,Y2∼ Unif ( 0 , 40 ) .X1,X2∼Unif(0,30) and Y1,Y2∼Unif(0,40).X_{1},X_{2} \sim \text{Unif}(0,30)\text{ and }Y_{1},Y_{2} \sim \text{Unif}(0,40). Як я можу знайти очікуване значення відстані між ними? Я думав, оскільки відстань обчислюється буде очікуваним значенням просто бути ?(Х1-Х2)2+ …

1
Як вказати контрастну матрицю (в R) для різниці між рівнем і середнім рівнем інших?
У мене є регресійна модель, яка виглядає приблизно так: Y=β0+β1X1+β2X2+β3X3+β12X1X2+β13X1X3+β123X1X2X3Y=β0+β1X1+β2X2+β3X3+β12X1X2+β13X1X3+β123X1X2X3Y = \beta_0+\beta_1X_1 + \beta_2X_2 + \beta_3X_3 +\beta_{12}X_1X_2+\beta_{13}X_1X_3+\beta_{123}X_1X_2X_3 ... або у позначенні R: y ~ x1 + x2 + x3 + x1:x2 + x1:x3 + x1:x2:x3 Скажімо X1X1X_1 і X2X2X_2 є категоричними змінними та X3X3X_3є числовим. Ускладнення полягає в томуX1X1X_1 має …
9 r  contrasts 

3
Тести на еквівалентність нестандартних даних?
У мене є деякі дані, які я не можу обов'язково вважати отриманими з звичайних розподілів, і я хотів би провести тести на еквівалентність між групами. Для нормальних даних існують такі методи, як TOST (два однобічних t-тести). Чи є щось аналогічне TOST для ненормативних даних?

3
Вибір кластерів для k-означає: 1 випадок кластера
Хтось знає хороший метод визначити, чи кластеризація за допомогою kmeans навіть підходить? Тобто, що робити, якщо ваш зразок насправді однорідний? Я знаю, що щось на зразок моделі суміші (через mclust в R) надасть статистику відповідності для випадку кластеру 1: k, але, схоже, для всіх методів оцінки kmeans потрібні принаймні 2 …
9 r  clustering  k-means 

1
Який внесок Студента (Госсета) у формулюванні t-тесту?
Недавній питання , пов'язаний з цим питання , і цитований джерело , нещодавно зробив мені відомо , що корекцію для вибіркових оцінок дисперсії генеральної сукупності називається корекцією Бесселя . Бессел був мертвий до 1846 року ( цитування wikipedia ), а t-тест був опублікований у 1908 році ( цитування wikipedia ). …

1
Момент, що генерує функцію внутрішнього добутку двох гауссових випадкових векторів
Чи може хто-небудь підказати, як я можу обчислити функцію, що генерує момент, внутрішнього добутку двох гауссових випадкових векторів, кожен розподілений як , незалежних один від одного? Чи є для цього якийсь стандартний результат? Будь-який вказівник високо оцінений.N( 0 ,σ2)N(0,σ2)\mathcal N(0,\sigma^2)

2
Використання алгоритму ЕМ для зв'язування записів
Мене цікавить зв'язування записів у двох наборах даних за прізвищем, прізвищем та роком народження. Чи можна це зробити за допомогою алгоритму ЕМ, і якщо так, то як? Розглянемо наступний запис у 1-му як приклад: Карл Маккарті, 1967 рік. Я прошу пошук усіх записів у другому наборі даних і призначу відстань …

3
Регресія до середньої загадки
У розділі "Регресія до середнього" Даніеля Канемана "Мислення, швидкий і повільний" наводиться приклад, і читача просять прогнозувати продажі окремих магазинів, враховуючи загальний прогноз продажів та кількість продажів за попередній рік . Наприклад (у прикладі книги є 4 магазини, тут я використовую 2 для простоти): Store 2011 2012 1 100 ? …

2
Як я міг уявити важливість різних вхідних даних для прогнозу для нелінійної моделі чорного поля?
Я будую інтерактивний інструмент прогнозування (в python) як допоміжний засіб для прогнозування, який робиться в моїй організації. На сьогоднішній день процес прогнозування значною мірою керується людьми: прогнозисти засвоюють дані у своїх природних нейронних мережах та використовують свої вивчені кишки для прогнозування. На основі довгострокової перевірки прогнозу та прогнозного моделювання я …

2
Розуміння вусів коробки
У мене питання щодо інтерпретації вусів боксер. Я читав наступне: "У верхній і нижній частині прямокутника" вуса "показують діапазон у 1,5 рази більше відстані між 0,25- і 0,75-квантовими", але не цілком розумію, що означає "відстань" . Неможливо мати на увазі масу ймовірності, оскільки між квантилем 0,25 та 0,75 ми, очевидно, …

2
Припущення узагальнених лінійних моделей
На сторінці 232 статті "Супутник R застосованій регресії" відзначають Фокс та Вайсберг Тільки сім'я Гаусса має постійну дисперсію, а у всіх інших GLM умовна дисперсія y at xx\bf{x} залежить від μ(x)μ(x)\mu(x) Раніше вони зазначали, що умовна дисперсія Пуассона є μμ\mu а двочлен є μ(1−μ)Nμ(1−μ)N\frac{\mu(1-\mu)}{N}. Для гауссів це звичне і часто …

1
Моделювання даних для логістичної регресії з категоричною змінною
Я намагався створити деякі тестові дані для логістичної регресії, і я знайшов цей пост. Як імітувати штучні дані для логістичної регресії? Це хороша відповідь, але вона створює лише постійні змінні. Що з категоричною змінною x3 з 5 рівнями (ABCDE), пов'язаними з y, для того ж прикладу, що і у посиланні?

1
Пропоновані книги з просторової статистики
Назвіть декілька найкращих книг для вивчення i) мінливості одновимірних та багатоваріантних змінних (реальних, лічильних даних) у просторовій області. ii) вибірку одноваріантної або багатоваріантної змінної на основі її розподілу в просторових місцях. (Просторовий відбір проб коротко)

3
Обчислення коефіцієнта Жакарда або іншого асоціації для двійкових даних за допомогою множення матриць
Я хочу знати, чи є можливий спосіб обчислити коефіцієнт Жакарда за допомогою матричного множення. Я використав цей код jaccard_sim <- function(x) { # initialize similarity matrix m <- matrix(NA, nrow=ncol(x),ncol=ncol(x),dimnames=list(colnames(x),colnames(x))) jaccard <- as.data.frame(m) for(i in 1:ncol(x)) { for(j in i:ncol(x)) { jaccard[i,j]= length(which(x[,i] & x[,j])) / length(which(x[,i] | x[,j])) jaccard[j,i]=jaccard[i,j] …

2
Яке ядро ​​SVM використовувати для проблеми бінарної класифікації?
Я початківець, коли мова йде про підтримку векторних машин. Чи є якісь вказівки, які говорять, яке ядро ​​(наприклад, лінійне, поліноміальне) найкраще підходить для конкретної проблеми? У моєму випадку я повинен класифікувати веб-сторінки відповідно до того, містять вони якусь конкретну інформацію чи ні, тобто у мене є проблема бінарної класифікації. Чи …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.