Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Як отримати p-значення коефіцієнтів від регресії завантажувальної програми?
З Quick-R Роберта Кабакоффа у мене є # Bootstrap 95% CI for regression coefficients library(boot) # function to obtain regression weights bs <- function(formula, data, indices) { d <- data[indices,] # allows boot to select sample fit <- lm(formula, data=d) return(coef(fit)) } # bootstrapping with 1000 replications results <- boot(data=mtcars, …

1
Двопробне порівняння пропорцій, оцінка розміру вибірки: R проти Stata
Двопробне порівняння пропорцій, оцінка розміру вибірки: R проти Stata Я отримав різні результати щодо розмірів вибірки: В Р power.prop.test(p1 = 0.70, p2 = 0.85, power = 0.90, sig.level = 0.05) Результат: н = 160,7777н=160.7777n = 160.7777 (так 161) для кожної групи. У штаті sampsi 0.70 0.85, power(0.90) alpha(0.05) Результат: для …

4
Чому KNN не є "модельною"?
Розділ 2.4 ESL, схоже, класифікує лінійну регресію як "засновану на моделі", оскільки вона передбачає , тоді як аналогічне наближення не вказано для k-найближчих сусідів. Але чи не обидва методи роблять припущення щодо ?f( x ) ≈ x ⋅ βf(x)≈x⋅βf(x) \approx x\cdot\betaf( х )f(x)f(x) Пізніше в 2.4 він навіть говорить: Найменші …

1
Чи можуть випадкові ліси зробити набагато краще, ніж 2,8% помилки тесту на MNIST?
Я не знайшов жодної літератури щодо застосування випадкових лісів до MNIST, CIFAR, STL-10 тощо. Тому я подумав, що спробував би їх з інваріантним перестановкою MNIST. У R я спробував: randomForest(train$x, factor(train$y), test$x, factor(test$y), ntree=500) Це тривало протягом 2 годин і отримало 2,8% тестової помилки. Я також спробував scikit-learn , с …

1
Чи насичена модель є особливим випадком переоснащеної моделі?
Я намагаюся зрозуміти, що таке насичена модель. AFAIK - це коли ти маєш стільки ж особливостей, скільки спостережень. Чи можна сказати, що насичена модель - це особливий випадок надзвичайно приталеної моделі?

2
Тест на незалежність проти тесту на однорідність
Я викладаю базовий курс статистики, і сьогодні я висвітлю тест незалежності для двох категорій та тест на однорідність. Ці два сценарії концептуально відрізняються, але можуть використовувати однакову тестову статистику та розподіл. При тесті на однорідність граничні підсумки для однієї з категорій вважаються частиною самої конструкції - вони представляють кількість досліджуваних, …

2
Класифікатор лише для одного класу
У простій класифікації ми маємо два класи: клас-0 та клас-1. У деяких даних у мене є лише значення для класу-1, тому жодне для класу-0. Зараз я думаю про створення моделі для моделювання даних для 1 класу. Отже, коли з'являються нові дані, ця модель застосовується до нових даних і знаходить ймовірність, …


3
Узагальнені лінійні змішані моделі: вибір моделі
Це питання / тема з'явилася під час обговорення з колегою, і я шукав деякі думки з цього приводу: Я моделюю деякі дані за допомогою логістичної регресії випадкових ефектів, точніше випадкової логістичної регресії. Для фіксованих ефектів у мене є 9 змінних, які представляють інтерес і враховуються. Я хотів би зробити якийсь …

1
Які обмеження методів ядра та коли використовувати методи ядра?
Методи ядра дуже ефективні у багатьох контрольованих завданнях класифікації. Отже, які обмеження є методами ядра та коли використовувати методи ядра? Особливо в епоху даних великого масштабу, якими є досягнення ядерних методів? Яка різниця між методами ядра та навчанням з кількома примірниками? Якщо дані є 500x10000, чи 500є кількість вибірок і …


1
Який статистичний тест слід використовувати для тестування на збагачення списку генів?
Я провів експеримент, щоб перевірити клітинну чутливість до певного агента пошкодження ДНК. Ми знайшли 270 генів, які були особливо чутливими до препарату, і загальна кількість аналізованих генів становила 3668. 38 з 270 чутливих генів класифікуються як "гени відновлення ДНК". Якщо кількість "генів відновлення ДНК", що містяться в геномі, становить 112, …

1
Вірогідність журналу для GLM
У наступному коді я здійснюю логістичну регресію на згрупованих даних за допомогою glm та "від руки" за допомогою mle2. Чому функція logLik в R дає мені ймовірність журналу logLik (fit.glm) = - 2.336, що відрізняється від одного logLik (fit.ml) = - 5.514, який я отримую вручну? library(bbmle) #successes in first …

1
Яка різниця між вірогідністю та нечіткою логікою?
Я працюю з нечіткою логікою (FL) протягом багатьох років, і я знаю, що існують відмінності між FL та ймовірністю, особливо стосовно того, як FL має справу з невизначеністю. Однак я хотів би запитати, які ще відмінності існують між FL та ймовірністю? Іншими словами, якщо я маю справу з ймовірностями (злиття …
10 bayes  fuzzy 

1
Які виправлення Хоммеля Хохберга?
Нещодавно я познайомився з виправленнями Хоммеля Хохберга. Я намагаюся знайти просте пояснення щодо того, що це насправді / що робиться, але мені не пощастило. Чи може хто-небудь, будь ласка, дати короткий і простий опис про виправлення Хоммеля Хохберга?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.