Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Мінімальна кількість спостережень для множинної лінійної регресії
Я роблю множинні лінійні регресії. У мене 21 спостереження та 5 змінних. Моя мета - просто знайти співвідношення між змінними Чи виставлено моїх даних для багаторазової регресії? Результат t-тесту показав, що 3 моїх змінних не є істотними. Чи потрібно мені знову робити регресію зі значущими змінними (або моєї першої регресії …

3
Як обчислити різницю двох схилів?
Чи існує метод зрозуміти, чи дві лінії (більш-менш) паралельні? У мене є два рядки, породжені лінійними регресіями, і я хотів би зрозуміти, чи вони паралельні. Іншими словами, я хотів би отримати різні схили цих двох ліній. Чи існує функція R для її обчислення? EDIT: ... і як я можу отримати …

1
Тестування одночасних та відстаючих ефектів у поздовжніх змішаних моделях із коваріатами, що змінюються за часом
Нещодавно мені сказали, що неможливо включити коваріати, що змінюються за часом, в поздовжні змішані моделі без введення часових затримок для цих коріаріатів. Чи можете ви підтвердити / спростувати це? Чи є у вас якісь посилання на цю ситуацію? Я пропоную просту ситуацію для уточнення. Припустимо, я повторив заходи (скажімо, більше …

2
Ухил у середньому віці для кваліфікації звання гросмайстра за віковими групами?
Вже досить давно відомо, що наймолодший вік, в якому шахісти зуміли отримати право на титул гросмейстера, значно зменшився з 1950-х років, і наразі майже 30 гравців, які стали гросмейстером до свого 15-го дня народження . Однак на біржі шахових стеків виникає питання, який середній вік, щоб стати гросмейстером? . Хтось …

5
Яку функцію втрати слід використовувати для двійкового виявлення при виявленні обличчя / без обличчя в CNN?
Я хочу використовувати глибоке навчання для тренування бінарного виявлення обличчя / без обличчя, яку втрату я повинен використовувати, я думаю, що це SigmoidCrossEntropyLoss або Hinge-loss . Це правильно, але мені також цікаво, чи варто використовувати софтмакс, але лише з двома класами?

3
Як обговорити розсіювач з декількома лініями, що виникають?
Ми виміряли дві змінні, і розсіювач, здається, пропонує декілька "лінійних" моделей. Чи є спосіб спробувати вигнати ці моделі? Ідентифікація інших незалежних змінних виявилася складною. Обидві змінні сильно косо ліворуч (у напрямку невеликої кількості), це очікуване поширення в нашому домені. Інтенсивність точки являє собою кількість точок даних (за шкалою ) при …

1
Яка різниця між AIC () та extraAIC () в R?
Документація на R не проливає багато світла. Все, що я можу отримати за цим посиланням, - це те, що використання будь-якого з них повинно бути добре. Чого я не отримую, це те, чому вони не рівні. Факт: функція покрокової регресії в R, step()використовує extractAIC(). Цікаво, що запуск lm()моделі та glm()'null' …

2
Встановлення множинної лінійної регресії в R: автокорельовані залишки
Я намагаюся оцінити кратну лінійну регресію в R з таким рівнянням: regr <- lm(rate ~ constant + askings + questions + 0) запитання та запитання - це квартальні часові ряди даних, побудовані з askings <- ts(...). Проблема зараз полягає в тому, що я отримав автокорельовані залишки. Я знаю, що можна …

2
Чи розмір сукупності є параметром чи розміром вибірки статистичним?
Визначення параметра та статистики в значній мірі погоджуються: параметри та статистика - це числові характеристики чи числові підсумки сукупності та вибірки відповідно для даного дослідження. Я не думаю, що це звичайне використання, але ... Чи можна вважати розмір населення параметром? Чи можна вважати розмір вибірки статистичним?NNNnnn Адже розмір сукупності чи …

2
Визначення "процентиль"
Зараз я читаю замітку про біостатистику, написану PMT Education, і помічаю наступні пропозиції у Розділі 2.7: Дитина, народжена в 50-му перцентилі за масою, важча, ніж 50% дітей. Дитина, народжена в 25-му перцентилі за масою, важча, ніж 75% немовлят. Дитина, народжена в 75-му процентилі за масою, важча, ніж 25% немовлят. Але, …

2
Чому моделі «помилка в X» не використовуються більш широко?
При розрахунку стандартної помилки коефіцієнта регресії, ми не враховуємо хаотичності в конструкції матриці . Наприклад, в OLS, ми обчислюємо якXXXvar(β^)var(β^)\text{var}(\hat{\beta})var((XTX)−1XTY)=σ2(XTX)−1var((XTX)−1XTY)=σ2(XTX)−1\text{var}((X^TX)^{-1}X^TY) = \sigma^2(X^TX)^{-1} Якщо розглядалися випадковим чином , закон загальної дисперсії буде, в деякому сенсі, вимагає додаткового вкладу дисперсії , а також. тобтоXXXXXX var ( β^) = var ( E( β^| …

1
Апроксимація функції втрат другого порядку (Книга глибокого навчання, 7.33)
У книзі Goodfellow (2016) про глибоке навчання він розповів про еквівалентність ранньої зупинки до регуляризації L2 ( https://www.deeplearningbook.org/contents/regularization.html сторінка 247). Квадратичне наближення функції функції задається:jjj J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)\hat{J}(\theta)=J(w^*)+\frac{1}{2}(w-w^*)^TH(w-w^*) де - матриця Гессія (рівняння 7.33). Чи не вистачає цього середнього терміну? Розширення Тейлора повинно бути: HHHf(w+ϵ)=f(w)+f′(w)⋅ϵ+12f′′(w)⋅ϵ2f(w+ϵ)=f(w)+f′(w)⋅ϵ+12f″(w)⋅ϵ2f(w+\epsilon)=f(w)+f'(w)\cdot\epsilon+\frac{1}{2}f''(w)\cdot\epsilon^2

3
Чому обмеження, що використовуються для коефіцієнтів Баєса та p-значень, настільки різні?
Я намагаюся зрозуміти фактор Байєса (BF). Я вважаю, що це як співвідношення ймовірності 2 гіпотез. Отже, якщо BF дорівнює 5, це означає, що H1 в 5 разів частіше, ніж H0. А значення 3-10 вказує на помірні докази, тоді як> 10 вказує на вагомі докази. Однак для P-значення традиційно 0,05 приймається …

2
Максимальні параметри ймовірності відхиляються від заднього розподілу
У мене є функція ймовірності для ймовірності моїх даних урахуванням деяких параметрів моделі , які я хотів би оцінити. Якщо припустити плоскі пріори за параметрами, вірогідність пропорційна задній ймовірності. Я використовую метод MCMC для вибірки цієї ймовірності.L (d| θ)L(г|θ)\mathcal{L}(d | \theta)ггdθ ∈ RNθ∈RN\theta \in \mathbf{R}^N Дивлячись на результуючий конвергентний ланцюг, …

2
Як баєси перевіряють свої методи, використовуючи методи моделювання Монте-Карло?
Передумови : я маю доктор наук із соціальної психології, де теоретична статистика та математика ледь не висвітлювалися в моїх кількісних курсових роботах. Через школу середньої та середньої школи мене викладали (як, мабуть, багато хто з вас і в соціальних науках) через "класичну" частотистську структуру. Тепер, я теж люблю R і …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.