Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Інтерпретація сюжету QQ
Розглянемо наступний код та вихід: par(mfrow=c(3,2)) # generate random data from weibull distribution x = rweibull(20, 8, 2) # Quantile-Quantile Plot for different distributions qqPlot(x, "log-normal") qqPlot(x, "normal") qqPlot(x, "exponential", DB = TRUE) qqPlot(x, "cauchy") qqPlot(x, "weibull") qqPlot(x, "logistic") Схоже, що цей QQ-графік для log-normal майже такий самий, як QQ-графік …

2
Як сказати, чи є залишки автокорельовані з графікою
Коли ви робите регресію OLS та намічаєте отримані залишки, як ви можете визначити, чи є залишки автокорельовані? Я знаю, що для цього є тести (Дурбін, Бреш-Годфрі), але мені було цікаво, чи можна просто подивитися на сюжет, щоб оцінити, чи може бути автокореляція проблемою (адже для гетерокедастичності це зробити досить просто).

1
Чим відрізняється вільна від розповсюдження статистика / методи та непараметрична статистика?
З Вікіпедії Перше значення непараметричних охоплює методи, які не покладаються на дані, що належать до якогось конкретного розподілу. До них належать, серед іншого,: методи вільного розподілу, які не покладаються на припущення, що дані черпають із заданого розподілу ймовірностей. Як такий, це протилежність параметричної статистики. Він включає непараметричні статистичні моделі, умовиводи …

4
Які переваги має регресія Пуассона над лінійною регресією в даному випадку?
Мені було надано набір даних, що містить кількість нагород, отриманих студентами в одній середній школі, де передбачувачі кількості зароблених нагород включають тип програми, за якою студент був зарахований, та бал на їх підсумковому іспиті з математики. Мені було цікаво, чи може хтось мені сказати, чому лінійна регресійна модель може бути …

1
Функція витрат для перевірки регресійних моделей Пуассона
Для підрахунку даних, які я зібрав, я використовую регресію Пуассона для побудови моделей. Я роблю це за допомогою glmфункції в R, де я використовую family = "poisson". Для оцінки можливих моделей (у мене є кілька прогнозів) я використовую AIC. Все йде нормально. Тепер я хочу здійснити перехресну перевірку. Мені вже …

2
Інтерпретація результату кластеризації k-засобів у R
Я використовував kmeansінструкцію R для виконання алгоритму k-означає на наборі даних ірису Андерсона. У мене питання про деякі параметри, які я отримав. Результати: Cluster means: Sepal.Length Sepal.Width Petal.Length Petal.Width 1 5.006000 3.428000 1.462000 0.246000 У цьому випадку, що означає «Кластер»? Це середнє значення відстаней усіх об'єктів у кластері? Також в …

1
Як ви можете виявити, чи є процес Гаусса надмірним?
Я готую процес Гаусса з ядром ARD з великою кількістю параметрів, максимізуючи граничну достовірність даних замість перехресної перевірки. Я підозрюю, що це надмірно підходить. Як я можу перевірити цю підозру в байєсівському контексті?

1
встановлення експоненціальної функції з використанням найменших квадратів проти узагальненої лінійної моделі проти нелінійних найменших квадратів
У мене є набір даних, який представляє експоненціальний розпад. Я хотів би помістити в ці дані експоненціальну функцію . Я спробував журнал перетворити змінну відповіді, а потім використовувати найменші квадрати, щоб підходити до рядка; використання узагальненої лінійної моделі з функцією зв’язку журналу та розподілом гами навколо змінної відповіді; і використовуючи …

2
Як поєднати результати логістичної регресії та випадкового лісу?
Я новачок у машинному навчанні. Я застосував логістичну регресію та випадковий ліс на одному і тому ж наборі даних. Тож я набуваю змінної важливості (абсолютний коефіцієнт для логістичної регресії та змінне значення для випадкових лісів). Я думаю об'єднати два, щоб отримати остаточне значення змінної. Чи може хтось поділитися своїм досвідом? …

2
Порівняння двох лінійних моделей регресії
Я хотів би порівняти дві моделі лінійної регресії, які представляють швидкість деградації мРНК протягом часу за двох різних умов. Дані для кожної моделі збираються незалежно. Ось набір даних. Журнал часу (годин) (обробка A), журнал (лікування B) 0 2,02 1,97 0 2,04 2,06 0 1,93 1,96 2 2,02 1,91 2 2,00 …

1
Kernelised k Найближчий сусід
Я новачок у ядрах і потрапив у корч, намагаючись ядро ​​kNN. Прелімінарії Я використовую поліноміальне ядро: К( Х , у ) = ( 1 + ⟨ х , у ⟩ )гK(x,y)=(1+⟨x,y⟩)dK(\mathbf{x},\mathbf{y}) = (1 + \langle \mathbf{x},\mathbf{y} \rangle)^d Ваш типовий евклідовий kNN використовує таку метрику відстані: г( х , у ) …

1
Щільність Y = log (X) для розподіленого гаммою X
Це питання тісно пов’язане з цією публікацією Припустимо, у мене є випадкова величина , і я визначаю Y = log ( X ) . Я хотів би знайти функцію щільності ймовірності Y .Х∼ Гамма ( k , θ )X∼Gamma(k,θ)X \sim \text{Gamma}(k, \theta)Y= журнал( X)Y=log⁡(X)Y = \log(X)YYY Спочатку я думав, що …

1
Прогнозування впорядкованого logit в R
Я намагаюся зробити впорядковану регресію logit. Я керую такою моделлю (просто маленька тупа модель, яка оцінює кількість фірм на ринку з мірою доходу та населення). Моє запитання щодо прогнозів. nfirm.opr<-polr(y~pop0+inc0, Hess = TRUE) pr_out<-predict(nfirm.opr) Коли я запускаю передбачення (який я намагаюся використовувати для отримання прогнозованого y), результати виходять або 0, …

2
Чи унікальні рішення PCA?
Коли я запускаю PCA на певному наборі даних, чи рішення мені надається унікальним? Тобто, я отримую набір 2d координат на основі проміжних відстаней. Чи можливо знайти хоча б ще одне розташування точок, яке б відповідало цим обмеженням? Якщо відповідь "так", як я можу знайти таке різне рішення?
12 pca 

2
Вибір функцій та налаштування параметрів з оберегом для випадкових лісів
У мене є дані з кількома тисячами функцій, і я хочу зробити рекурсивний вибір функцій (RFE), щоб видалити неінформативні. Я роблю це з каретою та RFE. Однак я почав думати, якщо я хочу отримати найкращу регресію (наприклад, випадковий ліс), коли мені слід виконати налаштування параметрів ( mtryдля РФ)? Тобто, наскільки …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.