Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Класифікатор проти моделі проти оцінювача
Чим відрізняється класифікатор, модель та оцінювач? З чого я можу сказати: Оцінювач - це предиктор, знайдений з алгоритму регресії класифікатор - це предиктор, знайдений з алгоритму класифікації модель може бути як оцінювачем, так і класифікатором Але з погляду в Інтернеті, здається, що у мене можуть бути змішані ці визначення. Отже, …

2
Чому усадка насправді працює, що так особливого в 0?
На цьому сайті вже розміщено повідомлення, що говорить про те саме: Чому працює усадка? Але, хоча відповіді популярні, я не вірю, що суть питання справді вирішена. Цілком зрозуміло, що введення деякої упередженості в оцінку призводить до зменшення дисперсії та може покращити якість оцінки. Однак: 1) Чому шкода, заподіяна введенням зміщення, …

2
Поступове оновлення MLE як потоку нових спостережень у
Загальне запитання Скажімо, у нас є потокові дані x1x1x_1 , , ... . Ми хочемо рекурсивно обчислити максимальну оцінку ймовірності . Тобто, обчисливши \ hat {\ boldsymbol {\ theta}} _ {n-1} = \ underset {\ boldsymbol {\ theta} \ in \ mathbb {R} ^ p} {\ arg \ max} \ …

2
Чому граничний розподіл / гранична ймовірність характеризується як "граничний"?
Маргінальне загалом посилається на те, що є невеликим ефектом, те, що знаходиться на зовнішній стороні більшої системи. Це, як правило, зменшує значення того, що описується як "граничне". То як це стосується ймовірності виникнення підмножини випадкових змінних? Якщо припустити, що слова вживаються через їх значення, це може бути ризикованою пропозицією в …

3
Які переваги лінійної регресії перед квантильною регресією?
Модель лінійної регресії створює купу припущень, що квантильна регресія не має, і, якщо допущення лінійної регресії виконуються, то моя інтуїція (і деякий дуже обмежений досвід) полягає в тому, що середня регресія дала б майже однакові результати, як лінійна регресія. Отже, які переваги має лінійна регресія? Це, звичайно, звичніше, але крім …

2
Чи насправді * корисні тести на наддисперсність у ГЛМ?
Явище «надмірної дисперсії» в GLM виникає щоразу, коли ми використовуємо модель, яка обмежує дисперсію змінної відповіді, і дані виявляють більшу дисперсію, ніж дозволяє обмеження моделі. Це трапляється зазвичай при моделюванні підрахунку даних за допомогою GLM Poisson, і це може бути діагностовано за допомогою відомих тестів. Якщо тести показують, що є …

7
Яку криву (або модель) я повинен відповідати моїм процентним даним?
Я намагаюся створити фігуру, яка показує взаємозв'язок між вірусними копіями та покриттям геному (GCC). Ось так виглядають мої дані: Спочатку я просто побудував лінійну регресію, але мої керівники сказали мені, що це неправильно, і спробувати сигмоїдальну криву. Тому я зробив це за допомогою geom_smooth: library(scales) ggplot(scatter_plot_new, aes(x = Copies_per_uL, y …

2
Які існують важливі напрямки генерації випадкових чисел у обчислювальній статистиці?
Як і чому важливі генератори випадкових чисел (RNG) в обчислювальній статистиці? Я розумію, що випадковість важлива при виборі зразків для багатьох статистичних тестів, щоб уникнути упередженості до будь-якої гіпотези, але чи є інші сфери обчислювальної статистики, де важливі генератори випадкових чисел?

1
Чи сума двох дерев рішень рівнозначна одному дереву рішень?
Припустимо , що ми маємо два регресійних дерев (Дерево і дерево B) , що відображення вхідних для виведення у ∈ R . Нехай у = е А ( х ) для дерева A і F B ( х ) для дерева B. Кожного дерева використовує двійковий шпагат, з гіперплоскостямі як …

5
Чому ?
Я гадаю, що P(A|B)=P(A|B,C)∗P(C)+P(A|B,¬C)∗P(¬C)P(A|B)=P(A|B,C)∗P(C)+P(A|B,¬C)∗P(¬C)P(A|B) = P(A | B,C) * P(C) + P(A|B,\neg C) * P(\neg C) правильно, тоді як P(A|B)=P(A|B,C)+P(A|B,¬C)P(A|B)=P(A|B,C)+P(A|B,¬C)P(A|B) = P(A | B,C) + P(A|B,\neg C) невірно. Однак у мене з’явилася «інтуїція» щодо пізнішої, тобто ви враховуєте ймовірність P (A | B), розділивши два випадки (C або Not C). …

3
Коли недоцільно контролювати змінну?
Я можу придумати хоча б один наївний приклад. Припустимо, я хочу вивчити взаємозв'язок між X і Z. Я також підозрюю, що Y впливає на Z, тому я контролюю Y. Однак, як виявляється, мені невідомо, X викликає Y, а Y викликає Z. Тому, контролюючи для Y я "приховую" відносини між X …

2
Інтуїція щодо оцінки параметрів у змішаних моделях (параметри дисперсії та умовні режими)
Я багато разів читав, що випадкові ефекти (BLUPs / умовні режими для, скажімо, предметів) не є параметрами лінійної моделі змішаних ефектів, а натомість можуть бути отримані з розрахункових параметрів дисперсії / коваріації. Наприклад, Рейнгольд Клієль та ін. (2011) стан: Випадкові ефекти - це відхилення суб'єктів від великої середньої RT та …

3
Використання glm () в якості заміни для простого тесту на квадрат чі
Мені цікаво змінити нульові гіпотези за допомогою glm() Р. Наприклад: x = rbinom(100, 1, .7) summary(glm(x ~ 1, family = "binomial")) перевіряє гіпотезу, що p=0.5p=0.5p = 0.5 . Що робити, якщо я хочу змінити нуль на ppp = якесь довільне значення, усередині glm()? Я знаю , що це може бути …

3
Чи можу я використовувати крихітний набір перевірки?
Я розумію міркування щодо розділення даних на тестовий набір і набір перевірки. Я також розумію, що розмір розбиття буде залежати від ситуації, але, як правило, коливатиметься від 50/50 до 90/10. Я побудував RNN, щоб виправити написання і почати з набору даних ~ 5м речень. Я голю 500k речень, а потім …

2
Чи є середнє значення позитивних визначених матриць також позитивно-визначеним?
Чи є середнє значення декількох позитивних певних матриць обов'язково позитивним-певним чи позитивним напіввизначеним? Середнє значення - середнє для елементів.

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.