Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як довести, що припущення колектора правильне?
У машинному навчанні часто передбачається, що набір даних лежить на гладкому низькомірному колекторі (припущення про колектор), але чи є якийсь спосіб довести, що при дотриманні певних умов виконано, то набір даних справді (приблизно) генерується від маломірного гладкого колектора? Наприклад, задана послідовність даних де (скажімо послідовність зображень обличчя під різними кутами) …

4
Наскільки корисний Minitab в реальному світі? [зачинено]
Закрито . Це питання ґрунтується на думці . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб на нього можна було відповісти фактами та цитатами, відредагувавши цю публікацію . Закрито 5 років тому . Зараз я студент статистики в рамках дуже хорошої програми. Ми використовуємо Minitab для різних …
9 sas  minitab 

3
Тест для відрізнення періодичних від майже періодичних даних
Припустимо, у мене є якась невідома функція з доменом , яку я знаю, щоб виконати деякі розумні умови, такі як наступність. Я знаю точні значення f (тому що дані походять від моделювання) у деяких рівновідставних точках відбору t_i = t_0 + iΔt з i∈ \ {1,…, n \} , які, …

2
Візуально узагальнення безладу відрізків спрямованих ліній
У мене є набір даних про мільйони сегментів спрямованих ліній. Відрізки ліній послідовні - це кліматична змінна (чутлива спека), із спостережуваними та імітованими значеннями з півгодинними інтервалами. Я намагаюся шукати шаблони в тому, як працює моделювання. Я дивлюся на графік розкидання величин по відношенню до моделювання та пов'язую їх з …

4
Розрахунок точності прогнозу
Ми використовуємо STL (реалізація R) для прогнозування даних часових рядів. Щодня ми проводимо щоденні прогнози. Ми хотіли б порівняти прогнозні значення з реальними значеннями та виявити середнє відхилення. Наприклад, ми склали прогноз на завтра і отримали прогнозні бали, ми хотіли б порівняти ці точки прогнозу з реальними даними, які ми …

1
Отримання векторів коінтеграції методом Йохансена
Я намагаюся зрозуміти краще метод Йохансена, тому я розробив приклад 3.1, наведений у книзі " Імовірність, заснована на висновках-коінтеграція-Авторегресія-Економетрія", де у нас є три процеси: Х1 т=∑i = 1тϵ1 i+ϵ2 тХ1т=∑i=1тϵ1i+ϵ2тX_{1t} = \sum_{i=1}^t \epsilon_{1i} + \epsilon_{2t} Х2 т= α∑i = 1тϵ1 i+ϵ3 тХ2т=α∑i=1тϵ1i+ϵ3т X_{2t} = \alpha \sum_{i=1}^t \epsilon_{1i} + \epsilon_{3t} …

4
Чи можна використовувати тест Манна-Вітні для постсоціальних порівнянь після Крускала-Уолліса?
У мене є симуляція, коли тварина поміщена у вороже середовище і приурочена до того, щоб побачити, як довго вона може вижити, використовуючи певний підхід до виживання. Існує три підходи, якими він може скористатися, щоб вижити. Я провів 300 моделювання тварини, використовуючи кожен підхід до виживання. Усі симуляції проводяться в одному …

1
Чому вам потрібно надати модель варіограми, коли ви крижите?
Я дуже новачок в просторовій статистиці і переглядаю безліч навчальних посібників, Але я насправді не розумію, чому вам потрібно надати модель варіограми, коли ви крижите. Я використовую пакет gstat в R, і це приклад, який вони дають: library(sp) data(meuse) coordinates(meuse) = ~x+y data(meuse.grid) str(meuse.grid) gridded(meuse.grid) = ~x+y m <- vgm(.59, …
9 spatial 

2
Що робити, коли CFA підходить для багатопозиційної шкали?
Я не впевнений, як діяти з цим CFA, який роблю в лавані. У мене є вибірка з 172 учасників (я знаю, що це не дуже багато для CFA) та 28 предметів із 7-бальною шкалою Лікерта, яка повинна навантажувати сім факторів. Я робив CFA з „mlm“ -едіаторами, але придатність для моделі …

2
Кластеризація галасливих даних або з аутлайнерами
У мене є шумні дані двох змінних на кшталт цієї. x1 <- rep(seq(0,1, 0.1), each = 3000) set.seed(123) y1 <- rep (c(0.2, 0.8, 0.3, 0.9, 0.65, 0.35,0.7,0.1,0.25, 0.3, 0.95), each = 3000) set.seed(1234) e1 = rnorm(length(x1), 0.07,0.07) set.seed(1223) e2 = rnorm(length(x1), 0.07,0.07) set.seed(1334) yn <- rnorm(20000, 0.5,0.9) set.seed(2344) xn <- …

1
Як генерувати дані про виживання із залежними від часу коваріатами за допомогою R
Я хочу генерувати час виживання з пропорційною моделлю небезпеки Кокса, яка містить коефіцієнт, залежний від часу. Модель є h(t|Xi)=h0(t)exp(γXi+αmi(t))h(t|Xi)=h0(t)exp⁡(γXi+αmi(t))h(t|X_i) =h_0(t) \exp(\gamma X_i + \alpha m_{i}(t)) де породжується з двочлена (1,0.5) і .XiXiX_imi(t)=β0+β1Xi+β2Xitmi(t)=β0+β1Xi+β2Xitm_{i}(t)=\beta_0 + \beta_1 X_{i} + \beta_2 X_{i} t Справжні значення параметрів використовуються якγ=1.5,β0=0,β1=−1,β2=−1.5,h0(t)=1γ=1.5,β0=0,β1=−1,β2=−1.5,h0(t)=1\gamma = 1.5, \beta_0 = 0, \beta_1 …

1
Стандартизація функцій при використанні LDA як етапу попередньої обробки
Якщо багатокласний лінійний дискримінантний аналіз (або я також іноді читаю множинний дискримінантний аналіз) використовується для зменшення розмірності (або перетворення після зменшення розмірності за допомогою PCA), я розумію, що в цілому "нормалізація Z-балів" (або стандартизація) функції не будуть потрібні, навіть якщо вони вимірюються на абсолютно різних масштабах, правда? Оскільки LDA містить …

1
Чому алгоритм ЕМ повинен бути ітеративним?
Припустимо, у вас є сукупність з одиниць, кожна з випадковою змінною . Ви спостерігаєте значення для будь-якої одиниці, для якої . Ми хочемо оцінити .NNNXi∼Poisson(λ)Xi∼Poisson(λ)X_i \sim \text{Poisson}(\lambda)n=N−n0n=N−n0n = N-n_0Xi>0Xi>0X_i > 0λλ\lambda Існують метод моментів та умовно-максимальна ймовірність способів отримання відповіді, але я хотів спробувати алгоритм ЕМ. Я отримую алгоритм ЕМ …

1
Розуміння сингулярної декомпозиції значення в контексті LSI
Моє запитання, як правило, щодо сингулярної декомпозиції значення (SVD), зокрема, щодо латентної семантичної індексації (LSI). Скажімо, у мене є що містить частоти 5 слів для 7 документів.Aword×documentAword×document A_{word \times document} A = matrix(data=c(2,0,8,6,0,3,1, 1,6,0,1,7,0,1, 5,0,7,4,0,5,6, 7,0,8,5,0,8,5, 0,10,0,0,7,0,0), ncol=7, byrow=TRUE) rownames(A) <- c('doctor','car','nurse','hospital','wheel') Я отримую матрицю розкладання для за допомогою SVD: …

2
Історія: роль статистики в астрономії
Нещодавно я сміливо стверджував перед групою досить розумних учнів восьмого класу, що астрономія зробила великий внесок у основи статистики, і багато статистичних концепцій було винайдено для використання в астрономії. Однак, дивлячись на підтримку, я був досить розчарований. Помилки, середнє значення та середнє відхилення від середнього можливо вперше спостерігалися в астрономії. …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.