Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Як співвіднести два часові ряди з прогалинами та різними часовими базами?
Я поставив це питання на StackOverflow, і рекомендував його задати тут. У мене є два часові ряди даних 3D-акселерометра, які мають різні часові основи (годинник запускався в різний час, з невеликим повзанням протягом часу вибірки), а також містять безліч прогалин різного розміру (через затримки, пов'язані з написанням, щоб розділити флеш-пристрої). …

2
Складний регресійний сюжет в R
Мені потрібно намалювати складну графіку для візуального аналізу даних. У мене є 2 змінні та велика кількість випадків (> 1000). Наприклад (число 100, якщо зробити дисперсію менш "нормальною"): x <- rnorm(100,mean=95,sd=50) y <- rnorm(100,mean=35,sd=20) d <- data.frame(x=x,y=y) 1) Мені потрібно побудувати необроблені дані з розміром точки, що відповідають відносній частоті …

4
Тестування статистичного програмного забезпечення
Які методи / підходи корисні при тестуванні статистичного програмного забезпечення? Мене особливо цікавлять програми, які параметрично оцінюють з максимальною ймовірністю. Порівнювати результати з результатами інших програм або опублікованих джерел не завжди можливо, оскільки більшість часу, коли я пишу власну програму, це тому, що потрібні мені обчислення ще не реалізовані в …

1
Альтернативна ділянка воронки без використання стандартної помилки (SE)
Перш ніж подати мета-аналіз, я хочу зробити сюжет воронки для перевірки на неоднорідність та зміщення публікації. Я маю розмір об'єднаного ефекту та розміри ефектів від кожного дослідження, які приймають значення від -1 до +1. Я маю розміри вибірки n1, n2 для пацієнтів та контролі кожного дослідження. Оскільки я не можу …

2
RNG, R, mclapply та кластер комп'ютерів
Я запускаю симуляцію на R та кластер комп’ютерів і маю наступну проблему. На кожному з X комп’ютерів я запускаю: fxT2 <- function(i) runif(10) nessay <- 100 c(mclapply(1:nessay, fxT2), recursive=TRUE) Є 32 комп’ютери, кожен з яких має 16 ядер. Однак приблизно 2% випадкових чисел однакові. Які стратегії ви б прийняли, щоб …

1
Як кількісно оцінити надмірність функцій?
У мене є три функції, які я використовую для вирішення проблеми класифікації. Спочатку ці функції давали булеві значення, тому я міг оцінити їх надмірність, дивлячись, наскільки набори позитивних і негативних класифікацій перетинаються. Тепер я розширив можливості для отримання реальних значень (балів) замість цього, і я хотів би ще раз проаналізувати …

4
Від електронної адреси до квазі-випадкового номера [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 2 роки тому . Моя мета: Я хотів би мати функцію, яка приймає адресу електронної пошти та видає квазі випадкове число 1, 2, 3 або 4. …

4
Ресурс для концепцій, що лежать в основі статистики, а не методи, що застосовуються у прикладній статистиці
Яка книга є найбільш ретельним трактуванням основних понять у статистиці? Я не прошу книги про деталі методів обчислень та процедур, мене в основному цікавить книга, яка всебічно пояснює основоположні поняття ... інтуїтивний / ілюстрований / візуальний підхід до основних ідей ... а не завантаження математичних рівнянь тощо. Розмір книги - …
10 references 

1
Використання пакету статистики в R для кластеризації kmeans
Мені важко зрозуміти один або два аспекти пакета кластерів. Я уважно слідкую за прикладом Quick-R , але не розумію одного чи двох аспектів аналізу. Я включив код, який я використовую для цього конкретного прикладу. ## Libraries library(stats) library(fpc) ## Data mydata = structure(list(a = c(461.4210925, 1549.524107, 936.42856, 0, 0, 0, …
10 r  clustering 

1
Задокументовані / відтворювані приклади успішних реальних застосувань економетричних методів?
Це питання може звучати дуже широко, але ось що я шукаю. Я знаю, що існує багато чудових книг про економетричні методи, і багато чудових статей про економетричні методи. Існують навіть відмінні відтворювані приклади економетрики, як описано в цьому перекладеному питанні . Насправді приклади в цьому питанні дуже близькі до того, …

2
Цензура / укорочення в JAGS
У мене питання про те, як укласти проблему цензури в JAGS. Я спостерігаю, як біваріантна суміш нормальна, коли значення X мають похибку вимірювання. Я б хотів моделювати справжні основні "засоби" спостережуваних цензурованих значень. ⌈xtrue+ϵ⌉=xobserved ϵ∼N(0,sd=.5)⌈xtrue+ϵ⌉=xobserved ϵ∼N(0,sd=.5)\begin{align*} \lceil x_{true}+\epsilon \rceil = x_{observed} \ \epsilon \sim N(0,sd=.5) \end{align*} Ось що я маю …

4
Побудова інтерфейсів MATLAB і R для C5.0 Ross Quinlan
Я розглядаю побудова інтерфейсів MATLAB і R для Ross Куінланом «s C5.0 (для тих , хто не знайомий з ним, C5.0 є алгоритм дерева рішень і пакет програмного забезпечення, розширення C4.5 ), і я намагаюся зрозуміти компоненти, які мені потрібно було б написати. Єдина документація, яку я знайшов для C5.0, …

2
Різниця між реалізацією регресії хребта в R та SAS
Я читав опис регресії хребта у прикладних лінійних статистичних моделях , розділ 5. Ед. 11. Регресія хребта виконується за наявними тут даними жирових речовин . Підручник відповідає результату в SAS, де зворотні перетворені коефіцієнти наведені в пристосованій моделі як: Y=−7.3978+0.5553X1+0.3681X2−0.1917X3Y=−7.3978+0.5553X1+0.3681X2−0.1917X3 Y=-7.3978+0.5553X_1+0.3681X_2-0.1917X_3 Це показано в SAS як: proc reg data = …

1
Накреслення кускової регресійної лінії
Чи існує спосіб побудови лінії регресії подібної кускової моделі, крім використання linesдля побудови кожного сегмента окремо, або використання geom_smooth(aes(group=Ind), method="lm", fill=FALSE)? m.sqft <- mean(sqft) model <- lm(price~sqft+I((sqft-m.sqft)*Ind)) # sqft, price: continuous variables, Ind: if sqft>mean(sqft) then 1 else 0 plot(sqft,price) abline(reg = model) Warning message: In abline(reg = model) : …

2
Хороший текст для перекомпонування?
Чи може група рекомендувати хороший вступний текст / ресурс до застосованих методів перестановки? Зокрема, мене цікавлять альтернативи класичним параметричним тестам (наприклад, t-тести, ANOVA, ANCOVA) для порівняння груп, коли припущення, такі як нормальність, явно порушуються. Приклад типу проблеми, з якою я хотів би ознайомитись з найкращим способом вирішення, може включати щось …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.