Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Про кофенетичну кореляцію кластеризації дендрограм
Розглянемо контекст кластеризації дендрограм. Назвемо оригінальні відмінності відстаней між особинами. Після побудови дендрограми ми визначаємо кофенетичну різницю між двома особинами як відстань між кластерами, до яких ці особи належать. Деякі люди вважають, що кореляція між вихідними відмінностями та кофенетичними відмінностями (звана кофенетичною кореляцією ) є "показником придатності" класифікації. Це звучить …

3
Середній час виживання для функції нормального виживання журналу
Я знайшов безліч формул, що показують, як знайти середній час виживання для експоненціального або розподілу Вейбулла, але я маю значно менше везіння для функцій нормального виживання журналу. З огляду на наступну функцію виживання: S( t ) = 1 - ϕ [ ln( t ) - μσ]S(t)=1−ϕ[ln⁡(t)−μσ]S(t) = 1 - \phi …
10 survival 

2
Критичні значення Вілкоксона-Манна-Вітні в R
Я помітив, що коли я намагаюся знайти критичні значення для Mann-Whitney U за допомогою R, значення завжди становлять 1 + критичне значення. Наприклад, для критичне значення (двохвосте) становить 8, тоді як для , ((двохвостий) ) критичне значення - 22 (перевірте таблиці ), але:α = .05 , n = 12 , …

2
Найкращий спосіб поєднання двійкової та безперервної відповіді
Я намагаюся придумати найкращий спосіб передбачити суму платежу для колекторського агентства. Залежна змінна значення є ненульовою лише тоді, коли здійснено платіж. Зрозуміло, що існує велика кількість нулів, оскільки більшість людей не можуть бути досягнуті або не можуть повернути борг. Існує також дуже сильна негативна кореляція між сумою боргу та ймовірністю …


4
Вміст нормального розподілу журналу в R проти SciPy
Я встановив логічну модель, використовуючи R із набором даних. Отримані параметри: meanlog = 4.2991610 sdlog = 0.5511349 Я хотів би перенести цю модель на Scipy, яку я ніколи раніше не використовував. Використовуючи Scipy, я зміг отримати форму та масштаб 1 та 3.1626716539637488e + 90 - дуже різні числа. Я також …
10 r  python  numpy  scipy 

3
Як моделювати упереджену монету зі зміщенням часу?
Моделі упереджених монет зазвичай мають один параметр . Один із способів оцінити з серії малюнків - це використовувати попередній бета-версію та обчислити задній розподіл з вірогідністю бінома.θθ=P(Head|θ)θ=P(Head|θ)\theta = P(\text{Head} | \theta)θθ\theta У моїх налаштуваннях через якийсь дивний фізичний процес мої властивості монети повільно змінюються і стає функцією часу . Мої …

3
Який найефективніший спосіб навчання даних з використанням найменшої пам'яті?
Це мої дані про навчання: 200 000 Приклади х 10 000 Особливості. Тож моя матриця даних про навчання - 200 000 х 10 000. Мені вдалося зберегти це у плоскому файлі без проблем із пам'яттю, зберігаючи кожен набір даних один за одним (один приклад за іншим), оскільки я генерую функції …


2
Виявлення кластерів "подібних" вихідних кодів
Припустимо, у мене 400 студентів (це у великому університеті), які повинні робити проект з інформатики, і що їм доведеться працювати поодинці (немає групи студентів). Як приклад проекту можна навести "реалізацію алгоритму швидкої трансформації фур'є у фортран" (я знаю, це не звучить сексуально, але це робить моє питання простішим). Я є …

2
Логістична регресія для багатокласових
Я отримав модель логістичної регресії для багатокласових, яку задає P(Y=j|X(i))=exp(θTjX(i))1+∑km=1exp(θTmX(i))P(Y=j|X(i))=exp⁡(θjTX(i))1+∑m=1kexp⁡(θmTX(i)) P(Y=j|X^{(i)}) = \frac{\exp(\theta_j^TX^{(i)})}{1+ \sum_{m=1}^{k}\exp(\theta_m^T X^{(i)})} де k - кількість класів тета - параметр, який слід оцінювати j - j-й клас Xi - дані навчання Ну одне, чого я не отримав - це те, як частина знаменника нормалізувала модель. Я маю …

1
Як ви використовуєте алгоритм ЕМ для обчислення MLE для латентної змінної рецептури нульової надутої моделі Пуассона?
Нульова завищені Пуассона моделі регресії визначається для зразка по і далі передбачається, що параметри та задовольняютьY i = { 0 з вірогідністю p i + ( 1 - p i ) e - λ i k з вірогідністю ( 1 - p i ) e - λ i λ k …

1
Асинхронний (нерегулярний) аналіз часових рядів
Я намагаюся проаналізувати відставання між часовими рядами двох цін на акції. У звичайному аналізі часових рядів ми можемо зробити Cross Correlaton, VECM (Granger Causality). Однак як поводитися з тим самим у нерегулярно розташованих часових рядах. Гіпотеза полягає в тому, що один з інструментів веде другий. У мене є дані для …

1
Чому я отримую різко різні результати для poly (raw = T) проти poly ()?
Я хочу моделювати дві різні змінні часу, деякі з яких сильно колінеарні в моїх даних (вік + когорта = період). Роблячи це, у мене виникли проблеми з lmerвзаємодією та взаємодією poly(), але, мабуть, це не обмежується lmer, я отримав однакові результати з nlmeIIRC. Очевидно, що мого розуміння того, що робить …

1
Чи достовірно спостерігається частота алелів, ніж прогнозована?
Питання : Як я можу побудувати тест, щоб визначити, чи спостерігається "гірська" -аллельна частота (рис. 1) значно нижча в центральних та південних горах, ніж прогнозована (рис. 2) за моделлю екологічного відбору (детальніше див. Нижче )? Проблема : Моя початкова думка полягала в тому, щоб регресувати модель залишків щодо широти: довготи …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.