Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Про що свідчить лінійна регресія, що говорить F-статистика, R-квадрат та залишкова стандартна помилка?
Я дуже заплутаний у різниці значень щодо контексту лінійної регресії таких термінів: F статистика R квадрат Залишкова стандартна помилка Я знайшов цей веб-сайт, який дав мені велике розуміння в різних термінах, що беруть участь у лінійній регресії, однак терміни, згадані вище, виглядають досить багато (наскільки я розумію). Я цитую те, …

1
Інтервал прогнозування біноміальної випадкової величини
Яка формула (приблизна чи точна) для інтервалу прогнозування біноміальної випадкової величини? Припустимо, що , і ми спостерігаємо (проведено з ). відомо.Y∼Binom(n,p)Y∼Binom(n,p)Y \sim \mathsf{Binom}(n, p)yyyYYYnnn Наша мета полягає в тому, щоб отримати інтервал прогнозування на 95% для нового розіграшу від .YYY Оцінка балів дорівнює , де . Довірчий інтервал для є …

3
Чому (/) статистичний вибірки повинен працювати для політики (наприклад, Gallup)?
Опитування там (скажімо, Gallup) вибирають деяку абсурдно низьку кількість людей порівняно з чисельністю населення (наприклад, тисяча людей із сотень мільйонів). Тепер, для мене, вибірка популяції як засобу для оцінки статистики населення має сенс, коли у вас є вагомі підстави вважати, що вибірки є репрезентативними для населення (або, аналогічно, для інших …

2
Яке походження нейронних мереж автокодера?
Я шукав у Google, Wikipedia, Google вченому тощо, але не міг знайти походження Autoencoders. Можливо, це одне з тих концепцій, що розвивалося дуже поступово, і неможливо простежити чітку вихідну точку, але все ж я хотів би знайти якийсь підсумок основних кроків їхнього розвитку. У розділі про автокодування в книзі Ієна …

2
Яка формула коригуваного р-значення Бенджаміні-Хохберга?
Я розумію процедуру і те, що вона контролює. Отже, яка формула для скоригованого р-значення в процедурі BH для кількох порівнянь? Щойно я зрозумів, що оригінальний BH не виробляє відрегульованих p-значень, лише коригував умову (не) відхилення: https://www.jstor.org/stable/2346101 . Гордон Сміт все одно ввів коригувані показники рН в 2002 році, тому питання …

4
Інтервали прогнозування алгоритмів машинного навчання
Я хочу знати, чи описаний нижче процес є дійсним / прийнятним та чи є доступне обґрунтування. Ідея: контрольовані алгоритми навчання не передбачають базових структур / розподілів даних. Наприкінці дня вони виводять оціночні показники. Я сподіваюся якось кількісно оцінити невизначеність оцінок. Тепер процес побудови моделі ML є по своїй суті випадковим …

2
чи (x) значення оператора?
Я бачив оператор скрізь у деякому огляді літератури, який я роблю з причинності (див., Наприклад, цей запис у Вікіпедії ). Однак я не можу знайти формальне та загальне визначення цього оператора.гo ( x )do(x)do(x) Чи може хтось вказати мені на гарну довідку щодо цього? Мене цікавить загальне визначення, а не …

1
Тест Колмогорова – Смірнова проти t-тесту
У мене виникають певні труднощі в розумінні інтерпретації тесту 2-х зразків KS і чим він відрізняється від звичайного t-тесту між двома групами. Скажімо, у мене чоловіки і жінки роблять якесь завдання, і я збираю кілька балів з цього завдання. Моя кінцева мета - визначити, чи виконують чоловіки та жінки по-різному …

3
Як моделювати поздовжні великі дані?
Традиційно ми використовуємо змішану модель для моделювання поздовжніх даних, тобто таких даних, як: id obs age treatment_lvl yield 1 0 11 M 0.2 1 1 11.5 M 0.5 1 2 12 L 0.6 2 0 17 H 1.2 2 1 18 M 0.9 ми можемо припустити випадковий перехоплення або нахил …

1
Узагальнені бібліотеки додаткової моделі Python
Я знаю, що R має бібліотеки gam та mgcv для узагальнених моделей добавок. Але мені важко знайти своїх аналогів в екосистемі Python (статистичні моделі мають лише прототип у пісочниці). Хтось знає про існуючі бібліотеки python? Хто знає, що це може бути хорошим проектом, щоб розвивати / сприяти науковій роботі, якщо …
14 gam 


1
GAM vs LOESS проти сплайнів
Контекст : Я хочу , щоб намалювати лінію в діаграмі розсіювання , що не виникає параметрическими, тому я використовую geom_smooth()в ggplotв R. Він автоматично повертається, geom_smooth: method="auto" and size of largest group is >=1000, so using gam with formula: y ~ s(x, bs = "cs"). Use 'method = x' to …

2
Що таке проба Томпсона з точки зору мирян?
Я не в змозі зрозуміти вибірку Томпсона і як це працює. Я читав про Multi Arm Bandit і після читання алгоритму, пов'язаного з верхнім довір'ям, багато текстів наводив на думку про те, що вибірки Томпсона працюють краще, ніж UCB. Що таке проба Томпсона, простіше кажучи? Сміливо надайте довідкові статті для …

4
Які статистичні методи є, щоб рекомендувати такий фільм, як на Netflix?
Я хочу реалізувати динамічну модель, щоб рекомендувати фільм користувачеві. Рекомендацію слід оновлювати щоразу, коли користувач дивиться фільм або оцінює його. Щоб зробити це просто, я думаю врахувати два фактори: минулі рейтинги інших фільмів користувачем час, коли користувач переглядав певні минулі фільми Як можна створити таку модель та що рекомендує наукова …

3
Чи завжди в GLM вірогідність журналу насиченої моделі дорівнює нулю?
У рамках виведення узагальненої лінійної моделі для оцінки моделі використовують нульове та залишкове відхилення. Я часто бачу формули цих величин, виражені у вірогідності журналу насиченої моделі, наприклад: /stats//a/113022/22199 , Логістична регресія: Як отримати насичену модель Насичена модель, наскільки я її розумію, - це модель, яка ідеально підходить до спостережуваної реакції. …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.