Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Етапи, зроблені при факторному аналізі порівняно з кроками, виконаними в PCA
Я знаю, як виконати PCA (аналіз основних компонентів), але я хотів би знати кроки, які слід використовувати для факторного аналізу. Для виконання PCA розглянемо , наприклад, матрицю :AAA 3 1 -1 2 4 0 4 -2 -5 11 22 20 Я обчислив його кореляційну матрицю B = corr(A): 1.0000 0.9087 …

3
Який статистичний тест використовувати для тесту A / B?
У нас є дві когорти по 1000 зразків кожна. Ми вимірюємо 2 кількості в кожній когорті. Перший - це двійкова змінна. Другий - це дійсне число, яке слід за важким розподілом хвоста. Ми хочемо оцінити, яка когорта найкраще відповідає кожній метриці. Існує велика кількість статистичних тестів на вибір: люди пропонують …
12 ab-test 

3
Як нормалізувати дані невідомого розподілу
Я намагаюся знайти найбільш відповідний характерний розподіл даних повторних вимірювань певного типу. По суті, в моїй галузі геології ми часто використовуємо радіометричну датування мінералів із зразків (шматки гірської породи), щоб з’ясувати, як давно відбулася подія (порода охолоджувалася нижче порогової температури). Зазвичай для кожного зразка буде проведено кілька (3-10) вимірювань. Потім …

1
Чому б не завжди використовувати інтерфейси завантажувача?
Мені було цікаво, як виконуються завантажувальні інтерфейси завантаження (і BCa у бартикулярних) на нормально розподілених даних. Здається, багато роботи над вивченням їх роботи на різних типах розподілів, але не вдалося знайти нічого в нормально розподілених даних. Оскільки, здається, спочатку вивчити очевидну річ, я вважаю, що документи просто занадто старі. Я …

2
Чи можна робити імовірнісні твердження з інтервалами прогнозування?
Я прочитав безліч чудових дискусій на сайті щодо інтерпретації довірчих інтервалів та інтервалів прогнозування, але одна концепція все ще трохи спантеличує: Розглянемо рамку OLS, і ми отримали відповідну модель . Нам дали і попросили передбачити його відповідь. Ми обчислюємо і, як бонус, ми також надаємо 95% інтервал прогнозування навколо нашого …

1
Модель Лмера не зможе сходитися
Мої дані описані тут Що може спричинити "помилку () модель є сингулярною помилкою" в aov при встановленні повторних заходів ANOVA? Я намагаюся побачити ефект взаємодії, використовуючи, lmerтаким чином, мій базовий випадок: my_null.model <- lmer(value ~ Condition+Scenario+ (1|Player)+(1|Trial), data = my, REML=FALSE) my.model <- lmer(value ~ Condition*Scenario+ (1|Player)+(1|Trial), data = my, …
12 r  lme4-nlme 


5
Як виконати імпутацію значень у дуже великій кількості точок даних?
У мене дуже великий набір даних, і близько 5% випадкових значень відсутні. Ці змінні співвідносяться між собою. Наступний приклад набору даних R - це лише іграшковий приклад з манекено-корельованими даними. set.seed(123) # matrix of X variable xmat <- matrix(sample(-1:1, 2000000, replace = TRUE), ncol = 10000) colnames(xmat) <- paste ("M", …
12 r  random-forest  missing-data  data-imputation  multiple-imputation  large-data  definition  moving-window  self-study  categorical-data  econometrics  standard-error  regression-coefficients  normal-distribution  pdf  lognormal  regression  python  scikit-learn  interpolation  r  self-study  poisson-distribution  chi-squared  matlab  matrix  r  modeling  multinomial  mlogit  choice  monte-carlo  indicator-function  r  aic  garch  likelihood  r  regression  repeated-measures  simulation  multilevel-analysis  chi-squared  expected-value  multinomial  yates-correction  classification  regression  self-study  repeated-measures  references  residuals  confidence-interval  bootstrap  normality-assumption  resampling  entropy  cauchy  clustering  k-means  r  clustering  categorical-data  continuous-data  r  hypothesis-testing  nonparametric  probability  bayesian  pdf  distributions  exponential  repeated-measures  random-effects-model  non-independent  regression  error  regression-to-the-mean  correlation  group-differences  post-hoc  neural-networks  r  time-series  t-test  p-value  normalization  probability  moments  mgf  time-series  model  seasonality  r  anova  generalized-linear-model  proportion  percentage  nonparametric  ranks  weighted-regression  variogram  classification  neural-networks  fuzzy  variance  dimensionality-reduction  confidence-interval  proportion  z-test  r  self-study  pdf 

2
Варіантно-коваріаційна інтерпретація матриці
Припустимо, у нас є лінійна модель Model1і vcov(Model1)дає таку матрицю: (Intercept) latitude sea.distance altitude (Intercept) 28.898100 -23.6439000 -34.1523000 0.50790600 latitude -23.643900 19.7032500 28.4602500 -0.42471450 sea.distance -34.152300 28.4602500 42.4714500 -0.62612550 altitude 0.507906 -0.4247145 -0.6261255 0.00928242 Для цього прикладу, що насправді відображає ця матриця? Які припущення ми можемо сміливо зробити для нашої …

1
Звіт про результати лінійної моделі змішаних ефектів
Лінійні моделі змішаних ефектів часто не використовуються в моєму куточку біології, і мені потрібно подати статистичний тест, який я використовував у роботі, яку я намагаюся написати. Я знаю, що усвідомлення багаторівневого моделювання починає з'являтися в деяких областях біологічних наук ( Рішення залежності: використання багаторівневого аналізу для розміщення вкладених даних ), …

2
Чому цей розподіл рівномірний?
Ми досліджуємо байєсівські статистичні випробування, і натрапимо на дивне (на мене принаймні) явище. Розглянемо наступний випадок: нас цікавить вимірювання того, яке населення, А чи В, має більш високий коефіцієнт конверсії. Для перевірки встановлюємо , тобто ймовірність конверсії однакова в обох групах. Ми створюємо штучні дані за допомогою біноміальної моделі, наприкладpA=pBpA=pBp_A …

2
Інтелектуальний бал та визначення переможця
Є подкаст NPR під назвою Intelligence Squared. Кожен епізод - це трансляція прямої дискусії щодо суперечливого твердження, наприклад, "2-я поправка вже не має значення" або "Стверджувальна дія на кампусах коледжу приносить більше шкоди, ніж користі". Чотири представники дебатують - двоє за рух та двоє проти. Щоб визначити, яка сторона виграє, …
12 bayesian  rating 

1
Як я треную HMM для класифікації?
Тож я розумію, що коли ви тренуєте HMM для класифікації, стандартним підходом є: Розділіть ваші набори даних на набори даних для кожного класу Тренуйте один HMM за клас На тестовому наборі порівняйте вірогідність кожної моделі класифікувати кожне вікно Але як я треную HMM на кожному занятті? Чи просто я об'єдную …

1
Як виконати тест завантаження для порівняння засобів двох зразків?
У мене є два сильно перекошених зразка і я намагаюся використовувати завантажувальний аналіз, щоб порівняти їх засоби, використовуючи t-статистику. Яка правильна процедура зробити це? Процес, який я використовую Мене хвилює доцільність використання стандартної помилки вихідних / спостережуваних даних на останньому етапі, коли я знаю, що це нормально не поширюється. Ось …

3
Виводимо відхилення від boxplot
Мені було цікаво, як вивести дисперсію змінної за допомогою boxplot. Чи можна принаймні зробити висновок, якщо дві змінні мають однакову дисперсію, спостерігаючи за їх боксплотом?
12 variance  boxplot 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.