Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Тестування великого набору даних на предмет нормальності - наскільки і чи надійно це?
Я вивчаю частину мого набору даних, що містить 46840 подвійних значень, розміром від 1 до 1690, згрупованих у дві групи. Для того, щоб проаналізувати відмінності між цими групами, я почав з вивчення розподілу значень, щоб вибрати правильний тест. Дотримуючись інструкції з тестування на нормальність, я зробив qqplot, гістограму та boxplot. …

3
Розробка відповідної моделі часових рядів для прогнозування продажів на основі даних минулого місяця
Я працюю в Інтернеті вже два роки поспіль, тому маю щомісячні дані про продажі вже близько двох років. На мій бізнес на кожен місяць, безумовно, впливають сезонні перепади (краще на Різдво тощо), і, мабуть, деякі інші фактори, про які я не знаю. Для того, щоб краще прогнозувати майбутні продажі та …

2
Як виконати перехресну перевірку PCA для визначення кількості основних компонентів?
Я намагаюся написати власну функцію для аналізу основних компонентів, PCA (звичайно, там вже багато написано, але мені просто цікаво реалізувати речі власноруч). Основна проблема, з якою я зіткнулася, - це крос перехресної перевірки та обчислення прогнозованої суми квадратів (PRESS). Не має значення, яку перехресну валідацію я використовую, це питання головним …


2
Методи MCMC - спалювання зразків?
У методах MCMC я постійно читаю про burn-inчас або кількість зразків "burn". Що це саме, і навіщо це потрібно? Оновлення: Після того, як MCMC стабілізується, чи залишається він стабільним? Як поняття burn-inчасу пов'язане з поняттям часу перемішування?
12 sampling  mcmc 

4
Виконання PCA лише матрицею відстані
Я хочу об'єднати масивний набір даних, для якого у мене є лише попарні відстані. Я реалізував алгоритм k-medoids, але це займає занадто багато часу, тому я хотів би почати, зменшивши розмір моєї проблеми, застосувавши PCA. Однак єдиним способом, яким я знаю виконати цей метод, є використання матриці коваріації, якої у …

1
Порівняння коефіцієнтів регресії однієї моделі в різних наборах даних
Я оцінюю два (2) холодоагенти (гази), які використовувалися в одній і тій же системі охолодження. Я маю дані про насичену температуру всмоктування ( ), температуру конденсації ( ) та ампераж ( ) для оцінки. Є два (2) набори даних; 1-й холодоагент ( ) та 2-й холодоагент ( ). Я використовую …

1
Інтуїтивні приклади вибірки важливості
Мій досвід - інформатика. Я досить новий, щоб монтувати методи відбору проб Карло, і, хоча я розумію математику, мені важко придумати інтуїтивні приклади для вибірки важливості. Точніше, чи міг би хтось навести приклади: оригінальний розподіл, з якого неможливо взяти вибірку, але можна оцінити розподіл важливості, який можна взяти на вибірку …

2
Кращі практики створення "Охайних даних"
У минулому році Хедлі Вікхем написала зоряну статтю під назвою "Охайні дані" ( посилання ) про маніпулювання даними та введення даних у "оптимальне" стан для проведення аналізу. Однак мені було цікаво, які найкращі практики щодо представлення табличних даних у робочих умовах? Скажімо, ваш колега просить вас надати йому деякі дані. …
12 dataset  tables 

2
Чому Томас Байєс вважав теорему Байєса такою складною?
Це більше питання історії науки, але я сподіваюсь, що це тут тема. Я читав, що Томасу Бейсу вдалося лише відкрити теорему Байєса для особливого випадку рівномірного попереднього, і навіть тоді він боровся з цим, мабуть. Зважаючи на те, наскільки тривіальна загальна теорема Байєса в сучасному лікуванні, чому вона представляла виклик …

1
Точний тест Фішера та гіпергеометричне поширення
Я хотів краще зрозуміти точний тест Фішера, тому я розробив наступний іграшковий приклад, де f і m відповідає чоловічому та жіночому, а n і y відповідає такому "споживання соди", як це: > soda_gender f m n 0 5 y 5 0 Очевидно, це різке спрощення, але я не хотів, щоб …

3
Нормальне наближення до розподілу Пуассона
Тут у Вікіпедії написано: Для досить великих значень λλλ (скажімо λ>1000λ>1000λ>1000 ) нормальний розподіл із середнім λλλ та дисперсією λλλ (стандартне відхилення λ−−√λ\sqrt{\lambda} ) є відмінним наближенням до розподілу Пуассона. Якщо λλλ більше приблизно 10, то нормальний розподіл є хорошим наближенням, якщо проводиться відповідна корекція безперервності, тобто P(X≤x),P(X≤x),P(X ≤ x), …

1
Чи потрібна попередня обробка перед прогнозуванням за допомогою FinalModel of RandomForest з пакетом caret?
Я використовую пакет caret для навчання випадкового об'єкта Forest з 10x10CV. library(caret) tc <- trainControl("repeatedcv", number=10, repeats=10, classProbs=TRUE, savePred=T) RFFit <- train(Defect ~., data=trainingSet, method="rf", trControl=tc, preProc=c("center", "scale")) Після цього я тестую randomForest на testSet (нові дані) RF.testSet$Prediction <- predict(RFFit, newdata=testSet) Матриця плутанини показує мені, що модель не така вже …

3
Коли доцільно вибирати моделі, мінімізуючи AIC?
Принаймні встановлено, принаймні серед статистиків деякого вищого калібру, що моделі зі значеннями статистики AIC у межах певного порогового значення мінімального значення слід вважати відповідними як модель мінімізації статистики AIC. Наприклад, у [1, с.221] знаходимо Тоді найкращими будуть вважатися моделі з невеликим GCV або AIC. Звичайно, не слід просто сліпо мінімізувати …

2
Інтуїція за назвами "часткові" та "граничні" кореляції
Хтось має уявлення про те, чому умовна кореляція між двома змінними називається "частковою" кореляцією, а проста кореляція між ними (так, коли вона не обумовлена ​​жодною іншою змінною) називається "граничною" кореляцією? Яка інтуїція стоїть за словами "часткове" та "граничне"? Що вони роблять із "частинами" чи "полями"? Було б добре дізнатися відповідь, …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.