Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Чи повинен частковий додати до загального при множинній регресії?
Далі представлена ​​модель, створена з mtcarsнабору даних: > ols(mpg~wt+am+qsec, mtcars) Linear Regression Model ols(formula = mpg ~ wt + am + qsec, data = mtcars) Model Likelihood Discrimination Ratio Test Indexes Obs 32 LR chi2 60.64 R2 0.850 sigma 2.4588 d.f. 3 R2 adj 0.834 d.f. 28 Pr(> chi2) 0.0000 …

2
Оптимальне підключення відносно заданої змінної відповіді
Я шукаю оптимальний метод бінінгу (дискретизація) безперервної змінної щодо заданої відповіді (цільової) бінарної змінної та з максимальною кількістю інтервалів як параметр. Приклад: У мене є набір спостережень за людьми зі змінними "висота" (число безперервно) та "has_back_pains" (бінарні). Я хочу розрізнити висоту на 3 інтервали (групи) максимум з різною часткою людей …

1
Як зменшити кількість помилкових позитивних результатів?
Я намагаюся вирішити завдання, яке називається пішохідним виявленням, і треную двійковий клацифер на двох позитивних категоріях - люди, негативи - на тлі. У мене є набір даних: кількість позитивів = 3752 кількість від’ємника = 3800 Я використовую поїзд \ test split 80 \ 20% і RandomForestClassifier форму scikit-learn з параметрами: …

1
Чому б не посилювати регресію кожного разу?
Приклади цієї сторінки показують, що на просту регресію помітно впливають люди, що переживають люди, і це можна подолати за допомогою методів стійкої регресії: http://www.alastairsanderson.com/R/tutorials/robust-regression-in-R/ . Я вважаю, що lmrob і ltsReg - це інші надійні методи регресії. Чому не слід робити щоденний регрес (наприклад, rlm або rq), а не виконувати …

2
VC розмірність регресійних моделей
У серії лекцій « Навчання з даних» професор зазначає, що розмір ВК вимірює складність моделі на те, скільки точок може зруйнувати дана модель. Тож це прекрасно спрацьовує для моделей класифікації, де ми могли б сказати, що немає N точок, якщо класифікатор здатний ефективно зруйнувати k точки, вимірювання розміру VC було …

2
Використання фільтрів Калмана для імпулювання пропущених значень у часових рядах
Мене цікавить, як можна використовувати фільтри Kalman для імпультування пропущених значень у даних часових рядів. Чи це також застосовно, якщо відсутні деякі послідовні моменти часу? Я не можу багато знайти на цю тему. Будь-які пояснення, коментарі та посилання вітаються та цінуються!

1
Лінійне перетворення випадкової величини високою прямокутною матрицею
Скажімо, у нас є випадковий вектор , проведений з розподілу з функцією густини ймовірностей . Якщо ми лінійно перетворимо його на повноцінне матрицю щоб отримати , то щільність задаєтьсяX⃗ ∈RnX→∈Rn\vec{X} \in \mathbb{R}^nfX⃗ (x⃗ )fX→(x→)f_\vec{X}(\vec{x})n×nn×nn \times nAAAY⃗ =AX⃗ Y→=AX→\vec{Y} = A\vec{X}Y⃗ Y→\vec{Y}fY⃗ ( у⃗ ) = 1| det A |fХ⃗ ( …

1
Який зв’язок між регуляризацією та методом множників лагранжу?
Для запобігання перевитрати людей люди додають термін регуляризації (пропорційний площі суми параметрів моделі) з параметром регуляризації до функції витрат лінійної регресії. Чи цей параметр збігається з множником лагранжу? Тож чи регуляризація така ж, як метод множника лагранжу? Або як пов’язані ці методи? λλ\lambdaλλ\lambda

2
Як створити дані про виживання іграшки (час до події) при правильній цензурі
Я хочу створити дані про виживання іграшки (час до події), які піддаються правильній цензурі та мають певний розподіл з пропорційними небезпеками та постійною базовою небезпекою. Я створив дані наступним чином, але не можу отримати оцінені коефіцієнти небезпеки, близькі до справжніх значень, після встановлення моделі моделювання пропорційної небезпеки Кокса до імітованих …

3
Як ефективно генерувати відсортовані рівномірно розподілені значення в інтервалі?
Скажімо, я хочу генерувати набір випадкових чисел з інтервалу (a, b). Створена послідовність також повинна мати властивість її сортування. Я можу придумати два способи цього досягти. Нехай nбуде довжина послідовності, яка буде створена. 1-й алгоритм: Let `offset = floor((b - a) / n)` for i = 1 up to n: …

2
pdf добутку двох незалежних Уніфікованих випадкових величин
Нехай ~ і ~ - дві незалежні випадкові величини із заданими розподілами. Який розподіл ?U ( 0 , 2 ) Y U ( - 10 , 10 ) V = X YXXXU(0,2)U(0,2)U(0,2)YYYU(−10,10)U(−10,10)U(-10,10)V=XYV=XYV=XY Я спробував згортання, знаючи це h(v)=∫y=+∞y=−∞1yfY(y)fX(vy)dyh(v)=∫y=−∞y=+∞1yfY(y)fX(vy)dyh(v) = \int_{y=-\infty}^{y=+\infty}\frac{1}{y}f_Y(y) f_X\left (\frac{v}{y} \right ) dy Ми також знаємо, що , …


2
Чи «добре» побудувати лінію регресії для ранжированих даних (кореляція Спірмена)?
У мене є дані, за якими я розраховував співвідношення Спірмена і хочу їх візуалізувати для публікації. Залежна змінна класифікується, незалежна змінна - ні. Те, що я хочу візуалізувати, - це більше загальна тенденція, ніж власне схил, тому я класифікував незалежний та застосував кореляцію / регресію Спірмена. Але тільки коли я …

3
Пояснення формули для медіани найближчої точки до початку N зразків з одиничної кулі
В елементах статистичного навчання вводиться проблема висвітлення питань з k-nn у просторах високих розмірів. Існує точок даних, які рівномірно розподілені в -вимірній кулі одиниці.рNNNppp Середня відстань від початку до найближчої точки даних задається виразом: d(p,N)=(1−(12)1N)1pd(p,N)=(1−(12)1N)1pd(p,N) = \left(1-\left(\frac{1}{2}\right)^\frac{1}{N}\right)^\frac{1}{p} Коли , формула розпадається на половину радіуса кулі, і я бачу, як найближча …

4
Підручник з питань підкріплення
Шукаю підручник / конспекти лекцій для посилення навчання. Мені подобається "Вступ до статистичного навчання" , але, на жаль, вони не висвітлюють цю тему. Я знаю, що книга Саттона і Барто - це стандартний довідник, і, можливо, НДП також хороший, але вони датовані 1997-98 роками, і я сподівався знайти більш сучасну …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.