Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Чи є неупереджений оцінювач відстані Хеллінгера між двома розподілами?
В умовах , коли спостерігається X1,…,XnX1,…,XnX_1,\ldots,X_n розподілено з розподілу з щільністю fff , цікаво , якщо є несмещенная оцінка (на основі «ов) відстаней Хеллінгера до іншого розподілу з щільністюXiXiX_if0f0f_0 , а саме H(f,f0)={1−∫Xf(x)f0(x)−−−−−−−−√dx}1/2.H(f,f0)={1−∫Xf(x)f0(x)dx}1/2. \mathfrak{H}(f,f_0) = \left\{ 1 - \int_\mathcal{X} \sqrt{f(x)f_0(x)} \text{d}x \right\}^{1/2}\,.

1
Зв'язок між дисперсією та попарними відстанями в межах змінної
Будь ласка, доведіть, що якщо у нас є дві змінні (однаковий розмір вибірки) і і дисперсія в більша, ніж у , то сума квадратних різниць (тобто квадратних евклідових відстаней) між точками даних у межах також більша, ніж що в .XXXYYYXXXYYYXXXYYY

1
Інтервал довіри навколо відношення двох пропорцій
У мене є дві пропорції (наприклад, частота кліків (CTR) на посилання в контрольній макеті та CTR на посилання в експериментальному макеті), і я хочу обчислити 95% довірчий інтервал навколо відношення цих пропорцій. Як це зробити? Я знаю, що можу використовувати метод дельти для обчислення дисперсії цього співвідношення, але я не …

3
Поєднання моделей машинного навчання
Я начебто новачок у передачі даних / машинне навчання / тощо. і читав про пару способів поєднання декількох моделей і циклів однієї моделі для покращення прогнозів. Моє враження від прочитання декількох статей (які часто цікаві та чудові в теорії та грецьких літерах, але короткий код та фактичні приклади) полягає в …

4
Який сенс порівнювати значення p між собою?
У мене дві популяції (чоловіки та жінки), кожна з яких містить зразків. Для кожного зразка у мене є два властивості A&B (середній бал першого року та оцінка SAT). Я використовував t-тест окремо для A&B: обидві виявили значні відмінності між двома групами; А з р = 0,008 і В з р …

2
Чи AdaBoost менш чи більше схильний до переозброєння?
Я читав різні (здавалося б) суперечливі твердження про те, чи AdaBoost (або інші прискорювальні методи) менш чи більше схильні до переозброєння порівняно з іншими методами навчання. Чи є вагомі підстави вірити тим чи іншим? Якщо це залежить, від чого це залежить? Які причини того, що AdaBoost менш / більше схильний …

2
Методи повторного відбору проб
Я використовую бібліотеку caretв R для тестування різних процедур моделювання. trainControlОб'єкт дозволяє вказати метод повторної дискретизації. Ці методи описані в документації розділі 2.3 , і включають в себе: boot, boot632, cv, LOOCV, LGOCV, repeatedcvі oob. Хоча деякі з них легко зробити висновки, не всі ці методи чітко визначені. Які процедури …
20 r  resampling  caret 

5
Що таке блок експериментального проектування?
У мене є два питання щодо поняття блоку в експериментальному проектуванні: (1) Яка різниця між блоком і фактором? (2) Я намагався прочитати деякі книги, але щось не зрозуміло: схоже, автори завжди припускають, що між "блоковим фактором" та іншими чинниками немає взаємодії. Це правильно, і якщо це так, чому?

8
Ідеї ​​програмного забезпечення "лабораторний ноутбук"?
Тож це дивна придатність, хоча насправді я думаю, що це дивно підходить для будь-якого сайту, тому я подумав, що спробую це тут, серед моїх братиків, що стискають дані. Я прийшов до епідеміології та біостатистики з біології, і досі напевно маю деякі звички з цієї галузі. Один з них - це …



4
Короткий підсумок результатів “Великого p, малого n”
Чи може хтось вказати мені на опитувальний документ на тему "Великі , малі n " результати? Мене цікавить, як ця проблема проявляється в різних контекстах дослідження, наприклад, регресія, класифікація, тест Готелінга тощо .pppннn

6
Коли випадати термін з регресійної моделі?
Чи може хтось порадити, якщо таке має сенс: Я маю справу зі звичайною лінійною моделлю з 4-ма предикторами. Я замислююся над тим, чи відмовитись від найменш значущого терміна. Це -значення трохи більше 0,05. Я стверджував на користь відмови від цього шляхом: Помноження оцінки цього терміна на (наприклад) міжквартирний діапазон вибіркових …

2
Дозволено порівняння моделей змішаних ефектів (насамперед випадкових ефектів)
Я розглядав моделювання змішаних ефектів за допомогою пакету lme4 в Р. Я в основному використовую lmerкоманду, тому я буду ставити своє запитання через код, який використовує цей синтаксис. Я думаю, що може бути загальним простим питанням: чи добре порівнювати будь-які дві моделі, побудовані з lmerвикористанням коефіцієнтів ймовірності на основі однакових …

2
Чим відрізняється біноміальна регресія від логістичної регресії?
Я завжди розглядав логістичну регресію як просто особливий випадок біноміальної регресії, де функцією зв'язку є логістична функція (замість, скажімо, пробіт-функції). Однак, якщо я прочитав відповіді на інше запитання , то, схоже, я може бути переплутаний, і між логістичною регресією та біноміальною регресією є логічна ланка. Яка різниця?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.