Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Виправлення нормально розподілених точних годин
У мене є експеримент, який виконується на сотнях комп’ютерів, розповсюджених по всьому світу, які вимірюють виникнення певних подій. Події залежать одна від одної, тож я можу їх замовляти у порядку збільшення, а потім обчислювати різницю у часі. Події повинні бути розподілені експоненціально, але при побудові гістограми це я отримую: Неточність …

2
Плутати про довірчий інтервал
Мене бентежить поняття інтервал довіри. Зокрема, припустимо, що існує гауссова змінна з відомою, і мене цікавить нижня межа середнього рівня з рівнем довіри .Х∼ N( μ , σ)Х∼N(мк,σ)X \sim N(\mu, \sigma)σσ\sigmaмкLмкL\mu_L95 %95%95\% Я буду робити експеримент разів і спостерігати за , , , , .555Х1Х1X_1Х2Х2X_2Х3Х3X_3Х4Х4X_4Х5Х5X_5 Варіант 1: Я розглядаю кожен …

1
randomForest та змінна важлива помилка?
Я не отримую різниці між rfobject$importanceі importance(rfobject)в стовпці MeanDecreaseAccuracy. Приклад: > data("iris") > fit <- randomForest(Species~., data=iris, importance=TRUE) > fit$importance setosa versicolor virginica MeanDecreaseAccuracy MeanDecreaseGini Sepal.Length 0.027078501 0.019418330 0.040497602 0.02898837 9.173648 Sepal.Width 0.008553449 0.001962036 0.006951771 0.00575489 2.472105 Petal.Length 0.313303381 0.291818815 0.280981959 0.29216790 41.284869 Petal.Width 0.349686983 0.318527008 0.270975757 0.31054451 46.323415 > …

3
Вибір функцій з використанням взаємної інформації в Matlab
Я намагаюся застосувати ідею взаємної інформації до вибору функцій, як описано в цих конспектах лекцій (на сторінці 5). Моя платформа - Matlab. Одна з проблем, які я виявляю при обчисленні взаємної інформації з емпіричних даних, полягає в тому, що число завжди зміщується вгору. Я знайшов близько 3 ~ 4 різних …

2
Просте наближення кумулятивного розподілу Пуассона в довгий хвіст?
Я хочу визначити ємність CСC таблиці, щоб вона мала залишкові шанси менше для переповнення для заданого , припускаючи, що кількість записів відповідає закону Пуассона із заданим тривалість . p ∈ [ 40 … 120 ] E ∈ [ 10 3 … 10 12 ]2−p2-p2^{-p}p ∈ [ 40 … 120 ]p∈[40…120]p\in[40\dots …

1
Чи можна навчати модель P (Y | X) за допомогою стохастичного градієнтного спуску з неіідних зразків P (X) та iid зразків P (Y | X)?
Під час тренування параметризованої моделі (наприклад, для збільшення максимальної вірогідності) за допомогою стохастичного градієнтного спуску на деякому наборі даних зазвичай прийнято вважати, що навчальні зразки витягуються внаслідок розподілу навчальних даних. Отже, якщо мета - моделювати спільний розподіл , то кожний навчальний зразок ( x i , y i ) повинен …

2
Експонентний коефіцієнт логістичної регресії відрізняється від коефіцієнта шансів
Як я розумію, показник бета-експоненції від логістичної регресії є коефіцієнтом шансів цієї змінної для залежної змінної, що цікавить. Однак значення не відповідає розрахованому вручну коефіцієнту шансів. Моя модель передбачає затримку (міру недоїдання), використовуючи, серед інших показників, страхування. // Odds ratio from LR, being done in stata logit stunting insurance age …

4
Регуляризація спорідненості для стохастичних матриць
Загальновідомо (наприклад, в області стиснення зондування), що норма є "спорідненою", в тому сенсі, що якщо ми мінімізуємо функціональний (для нерухомої матриці і вектора ) для досить великих \ lambda> 0 , ми, мабуть, для багатьох варіантів A , \ vec {b} і \ lambda буде мати багато точно нульових записів …

2
Асимптотичний розподіл статистики максимального порядку IID випадкових нормалей
Чи є розподіл хорошого обмеження як п йде до \ infty , за умови , що вони є IID нормальних розподілів з дисперсією \ Sigma ^ 2 .max(X1,X2,...,Xn)max(X1,X2,...,Xn)\max( X_1,X_2,...,X_n) nnn∞∞\inftyσ2σ2\sigma^2 Це майже напевно добре відома проблема з розумним доказом і гарним рішенням, але я копав і нічого не знайшов.


1
«Центральна гранична теорема» для зваженої суми корельованих випадкових величин
Я читаю документ, який стверджує це (тобто дискретна трансформація Фур'є, DFT) за CLT, як правило, має тенденцію до (складної) гауссової випадкової величини. Однак я знаю, що це взагалі не вірно. Прочитавши цей (помилковий) аргумент, я обшукав мережу та знайшовцей документ 2010 року Peligrad & Wu, де вони доводять, що длядеякихстаціонарних …

4
Навіщо використовувати контрольні змінні в відмінностях у відмінностях?
У мене виникає запитання щодо підходу відмінностей у відмінностях із наступним стандартним рівнянням: де treatment - фіктивна змінна для обробленої групи та посади. y=a+b1treat+b2post+b3treat⋅post+uy=a+b1treat+b2post+b3treat⋅post+u y= a + b_1\text{treat}+ b_2\text{post} + b_3\text{treat}\cdot\text{post} + u Тепер моє запитання просте: Чому більшість робіт все ще використовують додаткові контрольні змінні? Я вважав, що якщо …

2
Гігантський куртоз?
Я веду деяку описову статистику щоденних прибутків фондових індексів. Тобто, якщо і - рівні індексу на 1 день та 2 день відповідно, то - це повернення, яке я використовую (повністю стандартне в літературі).P 2 l o g e ( P 2П1П1P_1П2П2P_2л о ге( С2П1)логе(П2П1)log_e (\frac{P_2}{P_1}) Тож куртоз у деяких із …

1
Запитання щодо визначення лінійних змішаних моделей у R для даних повторних вимірювань з додатковою структурою вкладення
Структура даних > str(data) 'data.frame': 6138 obs. of 10 variables: $ RT : int 484 391 422 516 563 531 406 500 516 578 ... $ ASCORE : num 5.1 4 3.8 2.6 2.7 6.5 4.9 2.9 2.6 7.2 ... $ HSCORE : num 6 2.1 7.9 1 6.9 8.9 …

2
Навчальний посібник з вибору зразків Метрополіс-Гастінгса та Гіббса
Я маю досить хороший практичний досвід роботи з вибіркою Metropolis-Hastings та Gibbs, але хочу краще математичне розуміння цих алгоритмів. Які хороші підручники чи статті, які підтверджують правильність цих пробників (більше алгоритмів також було б чудово)?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.