Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Оцінка R-квадратної та статистичної значущості за допомогою пеналізованої регресійної моделі
Я використовую пакет R штрафується отримати зморщені оцінки коефіцієнтів для набору даних , де у мене є багато провісників і мало знань, які з них мають важливе значення. Після того, як я вибрав параметри настройки L1 і L2, і я задоволений своїми коефіцієнтами, чи є статистично обгрунтований спосіб узагальнити підхід …

4
Алгоритми Метрополіс-Гастінгса використовуються на практиці
Я читав щоденник Крістіана Роберта сьогодні і мені дуже сподобався новий алгоритм «Метрополіс-Гастінгс», який він обговорював. Це здавалося простим і легким у виконанні. Щоразу, коли я кодую MCMC, я схильний дотримуватися дуже основних алгоритмів MH, таких як незалежні рухи або випадкові прогулянки за шкалою журналу. Які алгоритми МЗ люди звичайно …

3
Яка сума квадратних t змінних?
Нехай буде виведено iid з розподілу студента t з ступенями свободи, для середнього розміру (скажімо, менше 100). Визначте Чи розподілений майже як хі-квадрат з ступенями свободи? Чи є щось на зразок центральної граничної теореми для суми квадратних випадкових величин? n n T = ∑ 1 ≤ i ≤ k t …

2
Коригування для коваріатів при аналізі кривих ROC
Це запитання стосується оцінки бальних результатів у багатовимірному скринінг-анкеті для прогнозування бінарної кінцевої точки за наявності корельованих шкал. Мене запитали про зацікавленість контролю за супутніми підрезультатами при розробці показників обрізання за кожним виміром шкали вимірювання (особистісних рис), які можуть бути використані для обстеження на алкоголізм. Тобто в цьому конкретному випадку …
20 epidemiology  roc 

3
Як комбінувати довірчі інтервали для дисперсійної складової моделі змішаних ефектів при використанні множинної імпутації
Логіка багаторазової імпутації (ІМ) полягає в тому, щоб присвоїти пропущені значення не один раз, а декілька (як правило, М = 5) разів, в результаті чого було завершено набір даних M. Потім завершені набори даних аналізуються методами повних даних, за допомогою яких оцінювання М та їх стандартні помилки поєднуються за допомогою …

14
Програмне забезпечення для легкого, але надійного дослідження даних
У своїх спробах боротися з хаосом електронних таблиць, я часто євангелістський в пошуку більш надійних інструментів, таких як справжнє програмне забезпечення для статистики (R, Stata тощо). Нещодавно мене оскаржив цей погляд хтось, хто заявив, що вони просто не навчаться програмувати. Я хотів би надати їм інструменти аналізу даних, які не …

6
Хороший ресурс для розуміння ANOVA та ANCOVA?
Я провожу експерименти над документом і шукаю цікаву книгу / веб-сайт, щоб правильно зрозуміти, як працюють ANOVA та ANCOVA. У мене хороший математичний досвід, тому мені не обов’язково потрібно вульгаризоване пояснення. Я також хотів би знати, як визначити, коли використовувати ANOVA замість ANCOVA.

3
Застосування «хитрості ядра» до лінійних методів?
Трюк ядра використовується в декількох моделях машинного навчання (наприклад , SVM ). Вперше він був введений у статті "Теоретичні основи методу потенційної функції в навчанні розпізнавання образів" у 1964 році. Визначення вікіпедії говорить, що це так метод використання алгоритму лінійного класифікатора для вирішення нелінійної задачі шляхом відображення оригінальних нелінійних спостережень …

4
Які правильні значення для точності та відкликання у кращих випадках?
Точність визначається як: p = true positives / (true positives + false positives) Чи правильно, що як true positivesі false positivesпідхід 0, точність наближається до 1? Те саме запитання для відкликання: r = true positives / (true positives + false negatives) Зараз я впроваджую статистичний тест, де мені потрібно обчислити …
20 precision-recall  data-visualization  logarithm  references  r  networks  data-visualization  standard-deviation  probability  binomial  negative-binomial  r  categorical-data  aggregation  plyr  survival  python  regression  r  t-test  bayesian  logistic  data-transformation  confidence-interval  t-test  interpretation  distributions  data-visualization  pca  genetics  r  finance  maximum  probability  standard-deviation  probability  r  information-theory  references  computational-statistics  computing  references  engineering-statistics  t-test  hypothesis-testing  independence  definition  r  censoring  negative-binomial  poisson-distribution  variance  mixed-model  correlation  intraclass-correlation  aggregation  interpretation  effect-size  hypothesis-testing  goodness-of-fit  normality-assumption  small-sample  distributions  regression  normality-assumption  t-test  anova  confidence-interval  z-statistic  finance  hypothesis-testing  mean  model-selection  information-geometry  bayesian  frequentist  terminology  type-i-and-ii-errors  cross-validation  smoothing  splines  data-transformation  normality-assumption  variance-stabilizing  r  spss  stata  python  correlation  logistic  logit  link-function  regression  predictor  pca  factor-analysis  r  bayesian  maximum-likelihood  mcmc  conditional-probability  statistical-significance  chi-squared  proportion  estimation  error  shrinkage  application  steins-phenomenon 

5
Коли можна використовувати критерії, засновані на даних, для визначення моделі регресії?
Я чув, що коли багато специфікацій регресійної моделі (скажімо, в OLS) розглядаються як можливості для набору даних, це спричиняє багаторазові проблеми порівняння, а значення p та значення інтервалів вже не є надійними. Одним з крайніх прикладів цього є покрокова регресія. Коли я можу використовувати самі дані для уточнення моделі, а …

2
Яким чином випадковий ліс породжує випадковий ліс
Я не фахівець з випадкових лісів, але чітко розумію, що ключовим питанням випадкового лісу є (випадкове) генерування дерев. Чи можете ви пояснити мені, як генеруються дерева? (тобто Який використовуваний розподіл для генерації дерев?) Спасибі заздалегідь !

6
Чи мій синоптик точний?
Питання, яке мене хвилювало деякий час, на яке я не знаю, як вирішити: Щодня мій синоптик дає відсотковий шанс дощу (припустимо, його обчислюється до 9000 цифр, і він ніколи не повторював число). Кожного наступного дня він або дощить, або не дощить. У мене є дані років - шанс в порівнянні …

4
Яка щільна нижня межа часу збирання купона?
У класичній проблемі колекціонера купонів добре відомо, що час необхідний для заповнення набору випадково вибраних купонів, задовольняє , і .TTTnnnE[T]∼nlnnE[T]∼nln⁡nE[T] \sim n \ln n Var(T)∼n2Var(T)∼n2Var(T) \sim n^2Пр ( Т&gt; n lnn + c n ) &lt; e- cPr(T&gt;nln⁡n+cn)&lt;e−c\Pr(T > n \ln n + cn) < e^{-c} Ця верхня межа краща …

5
Post-hocs для тестів з предметів?
Який кращий метод проведення пост-хоку для тестів з предметів? Я бачив опубліковану роботу, де працює HSD Tukey, але огляд Keppel і Maxwell &amp; Delaney свідчить про те, що ймовірне порушення сферичності в цих конструкціях робить термін помилки невірним і такий підхід є проблематичним. Maxwell &amp; Delaney пропонують підхід до проблеми …

4
Чи підходить модель до даних, чи дані підходять до моделі?
Чи є концептуальна чи процедурна відмінність між пристосуванням моделі до даних та пристосуванням даних до моделі? Приклад першого формулювання можна побачити на https://courses.washington.edu/matlab1/ModelFitting.html , а другого - на https://reference.wolfram.com/applications/eda/FittingDataToLinearModelsByLeast-SquaresTechniques.html .

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.