Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Співвідношення обсягу часових серій
Розглянемо наступний графік: Червона лінія (ліва вісь) описує обсяг торгів певної акції. Синя лінія (права вісь) описує обсяг повідомлення про щебетання для цього запасу. Наприклад, 9 травня (05-09) було здійснено близько 1,100 мільйонів торгів та 4 000 твітів. Я хотів би порахувати, чи існує кореляція між тимчасовими серіями, або в …

2
Коли використовувати техніку bootstrap vs. bayesian?
У мене досить складна проблема аналізу рішень, пов’язана з тестуванням надійності, і логічний підхід (мені здається) передбачає використання MCMC для підтримки байєсівського аналізу. Однак було висловлено припущення, що було б доцільніше використовувати підхід до завантаження. Чи може хтось запропонувати довідку (або три), яка може підтримувати використання будь-якої техніки над іншою …

1
Логістична квантильна регресія - як найкраще передати результати
У попередньому дописі я замислювався, як боротися з оцінками EQ-5D . Нещодавно я натрапив на логістичну квантильну регресію, запропоновану Боттаєм та МакКаун, яка запроваджує елегантний спосіб вирішення обмежених результатів. Формула проста: logit(y)=log(y−yminymax−y)logit(y)=log(y−yminymax−y)logit(y)=log(\frac{y-y_{min}}{y_{max}-y}) Щоб уникнути журналу (0) та ділення на 0, ви розширите діапазон на невелике значення, . Це дає середовище, …

1
Оцінка розподілу за даними
У мене є зразок даних , отриманих в Rшляху rnorm(50,0,1), тому дані , очевидно , бере на себе нормальне розподіл. Однак Rне "знає" цю розповсюджувальну інформацію про дані. Чи існує метод, Rякий дозволяє оцінити, від якого типу розподілу походить мій зразок? Якщо ні, я скористаюсь shapiro.testфункцією та продовжую так.
12 r  distributions 

2
Очікуване значення хибної кореляції
Ми малюємо зразків, кожен розміром , незалежно від нормального розподілу.n ( μ , σ 2 )NNNnnn(μ,σ2)(μ,σ2)(\mu,\sigma^2) Тоді з зразків вибираємо 2 зразки, які мають найвищу (абсолютну) співвідношення Пірсона один з одним.NNN Яке очікуване значення цього співвідношення? Дякую [PS Це не домашнє завдання]


3
Які розподіли на позитивному k-мірному квадранті з параметризованою матрицею коваріації?
Після zzk «s питання про його проблеми з негативним моделюванням, я цікаво , що параметризрвані сімейства розподілів на позитивні к-мірної квадраті, , для яких ковариационной матриці Σ може бути безліч.Rк+R+k\mathbb{R}_+^kΣΣ\Sigma Як обговорювалося з zzk , виходячи з розподілу на Rк+R+k\mathbb{R}_+^k і застосовуючи лінійне перетворення Х⟶ Σ1 / 2( X- μ …

1
Пакети Python для роботи з моделями суміші Гаусса (GMM)
Здається, існує кілька варіантів роботи з моделями Gaussian Mixure (GMM) в Python. На перший погляд є щонайменше: PyMix - http://www.pymix.org/pymix/index.php Інструменти для моделювання сумішей PyEM - http://www.ar.media.kyoto-u.ac.jp/members/david/softwares/em/, який є частиною панелі інструментів Scipy і, здається, зосереджений на оновленнях GMM : Зараз відомий як sklearn.mixture . PyPR - http://pypr.sourceforge.net/ розпізнавання образів …

2
Ієрархічна баєсова модель (?)
Вибачте, будь ласка, мою розсилку статистичного лінгва :) Я знайшов тут декілька питань, які стосуються реклами та ціни на кліки. Але жодна з них мені не дуже допомогла в розумінні моєї ієрархічної ситуації. Існує пов'язане питання Чи є ці еквівалентні уявлення тієї ж ієрархічної байєсівської моделі? , але я не …

2
Аналіз логістичних коефіцієнтів регресії
Ось перелік коефіцієнтів логістичної регресії (перший - перехоплення) -1059.61966694592 -1.23890500515482 -8.57185269220438 -7.50413155570413 0 1.03152408392552 1.19874787949191 -4.88083274930613 -5.77172565873336 -1.00610998453393 Мені здається дивним, наскільки перехоплення настільки низьке, і у мене коефіцієнт, який насправді дорівнює 0. Я не зовсім впевнений, як би це інтерпретував. Чи означає 0, що конкретна змінна зовсім не впливає …

2
Перехресне підтвердження та порядкова логістична регресія
Я намагаюся зрозуміти перехресну валідацію для порядкової логістичної регресії. Мета гри - перевірити модель, яка використовується в аналізі ... Спочатку будую набір даних про іграшки: set.seed(1) N <- 10000 # predictors x1 <- runif(N) x2 <- runif(N) x3 <- runif(N) # coeffs in the model a <- c(-2,-1) x <- …

1
Часткова найменша регресія квадратів у R: чому ПЛС на стандартизованих даних не еквівалентна максимальній кореляції?
Я дуже новий в часткових найменших квадратиках (PLS) і намагаюся зрозуміти вихід R функції plsr()в plsпакеті. Давайте змоделюємо дані та запустимо PLS: library(pls) n <- 50 x1 <- rnorm(n); xx1 <- scale(x1) x2 <- rnorm(n); xx2 <- scale(x2) y <- x1 + x2 + rnorm(n,0,0.1); yy <- scale(y) p <- …

2
Статистичний тест на значення, що суттєво відстає від сукупності, означає: це Z-тест чи Т-тест?
Наскільки значущим є значення порівняно зі списком значень? У більшості випадків статистичне тестування включає порівняння вибірки, встановленої для сукупності. У моєму випадку вибірка складається на одне значення, і ми порівнюємо її з сукупністю. Я є дилетантом у тестуванні статистичної гіпотези, зіткнувшись із, мабуть, найбільш основною проблемою. Це не один тест, …

1
Кроки, щоб з'ясувати задній розподіл, коли це може бути досить простим, щоб мати аналітичну форму?
Про це також запитали в обчислювальній науці. Я намагаюся обчислити байєсівську оцінку деяких коефіцієнтів для авторегресії з 11 зразків даних: де - гауссова із середнім 0 та дисперсією Попередній розподіл на вектор - гауссовий із середнім та діагональною матрицею коваріації із діагональні записи, що дорівнює .Yi=μ+α⋅Yi−1+ϵiYi=μ+α⋅Yi−1+ϵi Y_{i} = \mu + …

1
Чи несприятливий набір тренувань негативно впливає на SVM?
Я намагаюся класифікувати повідомлення на різні категорії за допомогою SVM. Я склав список бажаних слів / символів із навчального набору. Для кожного вектора, який представляє повідомлення, я встановлюю відповідний рядок, 1якщо слово є таким: "корпус" є: [Мері, маленький, баранина, зірка, мерехтіння] перше повідомлення: "у Мері було трохи ягняти" -> [1 …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.