Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Чи найбільш опубліковані кореляції в соціальних науках недостовірні і що з цим робити? [зачинено]
Закрито . Це питання ґрунтується на думці . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб на нього можна було відповісти фактами та цитатами, відредагувавши цю публікацію . Закрито 2 роки тому . Незважаючи на важливі, але чутливі зусилля людей, спрямовані на "гетьчі", щоб розкрити практику роботи …

2
Дослідження відмінностей між групами населення
Скажімо, у нас є вибірка з двох груп: Aі B. Припустимо, що ці групи складаються з людей, і ми вирішимо описати людей за ознаками. Деякі з цих особливостей є категоричними (наприклад, вони їздять на роботу?), А деякі - числовими (наприклад, їх висота). Назвемо ці функції: . Ми збираємо сотні цих …

4
Чому факт, що 1 медіана нижчий, ніж інший медіани, не означає, що більшість у групі 1 менше, ніж більшість у групі 2?
Я вважав, що розроблені нижче скриньки можна інтерпретувати як "більшість чоловіків швидше, ніж більшість жінок" (у цьому наборі даних), насамперед тому, що середній час чоловіків був меншим, ніж середній час жінок. Але курс EdX на R та статистику вікторини сказав мені, що це неправильно. Будь ласка, допоможіть мені зрозуміти, чому …

1
Чому на латинських квадратах кажуть, що рядки, обробка та стовпці є ортогональними
Я завжди чув "ортогональні" в області геометрії (також зауважте, що я не є носієм англійської мови). Я не розумію наступного для латинських квадратів (цитата з текстової книги): Кожне лікування (ABCD) з’являється один раз у кожному ряду. Отже, обробка та ряди є ортогональними. ... Рядки та стовпці є ортогональними для обробки. …

1
Р-значення та ймовірність принципу
Це запитання виникло в класі: Якщо ми використовуємо p-значення для оцінки гіпотез експерименту, якої частини Принципу ймовірності ми не підкоряємося: Достатність чи обумовленість ? Моя інтуїція полягає в тому, щоб сказати, що достатність , оскільки обчислення р-значення покладається на незабезпечені результати експерименту, а Достатність, здається, більше справляється зі спостереженнями в …

2
Криві Каплана-Мейєра, схоже, говорять інакше, ніж регресія Кокса
У R я роблю аналіз даних про виживання хворих на рак. Я читав дуже корисні матеріали про аналіз виживання в CrossValided та інших місцях і думаю, що зрозумів, як інтерпретувати результати регресії Кокса. Однак один результат все одно мене помиляє ... Я порівнюю виживання проти статі. Криві Каплана-Мейєра явно корисні …

1
Чи корисні функціональний аналіз та гільбертові простори в машинному навчанні? Якщо так, то як?
Мені було цікаво, наскільки гільбертові простори та функціональний аналіз корисні для машинного навчання? Мені здалося, що машинне навчання - це поєднання статистики, інформатики та оптимізації. Як функціональний аналіз стосується цього?

2
Зворотна проблема з днем ​​народження при кількох зіткненнях
Припустимо, у вас був чужий рік з невідомою довжиною N. Якщо у вас є випадкова вибірка згаданих прибульців, і деякі з них діляться днями народження, чи можете ви використовувати ці дані для оцінки тривалості року? Наприклад, у вибірці 100, у вас може бути дві трійки (тобто два дні народження, які …

2
Який розподіл вірогідності цієї випадкової суми неіідних змінних Бернуллі?
Я намагаюся знайти розподіл ймовірності суми випадкової кількості змінних, які не однаково розподілені. Ось приклад: Джон працює в центрі обслуговування клієнтів. Він отримує дзвінки з проблемами і намагається їх вирішити. Ті, кого він не може вирішити, він передає їх своєму начальнику. Припустимо, що кількість дзвінків, які він отримує за день, …

4
Як визначити, чи значно відрізняються дві кореляції?
Я хочу визначити, який із двох наборів даних (B1, B2) краще співвідноситься (груші r) з іншим набором (A). У всіх наборах даних відсутні дані. Як я можу визначити, чи є істотна різниця отриманої кореляції чи ні? Наприклад, значення 8426 присутні як в А, так і в B1, r = 0,74. …

1
Коли використовувати регресію Демінга
Зараз я працюю над способом перетворення двох різних значень тесту на фосфор один в одного. Фон Існує безліч методів (видобутку) для вимірювання рослинного фосфору в ґрунті. У різних країнах застосовуються різні методи, отже для порівняння P-родючості у різних країнах необхідно обчислити значення P-тесту x на основі значення P-тесту у та …

1
Яка модель глибокого навчання може класифікувати категорії, які не є взаємовиключними
Приклади: у мене є речення в описі посади: "Старший інженер Java у Великобританії". Я хочу використовувати модель глибокого навчання, щоб передбачити її як 2 категорії: English і IT jobs. Якщо я використовую традиційну модель класифікації, вона може передбачити лише 1 мітку з softmaxфункцією на останньому шарі. Таким чином, я можу …
9 machine-learning  deep-learning  natural-language  tensorflow  sampling  distance  non-independent  application  regression  machine-learning  logistic  mixed-model  control-group  crossover  r  multivariate-analysis  ecology  procrustes-analysis  vegan  regression  hypothesis-testing  interpretation  chi-squared  bootstrap  r  bioinformatics  bayesian  exponential  beta-distribution  bernoulli-distribution  conjugate-prior  distributions  bayesian  prior  beta-distribution  covariance  naive-bayes  smoothing  laplace-smoothing  distributions  data-visualization  regression  probit  penalized  estimation  unbiased-estimator  fisher-information  unbalanced-classes  bayesian  model-selection  aic  multiple-regression  cross-validation  regression-coefficients  nonlinear-regression  standardization  naive-bayes  trend  machine-learning  clustering  unsupervised-learning  wilcoxon-mann-whitney  z-score  econometrics  generalized-moments  method-of-moments  machine-learning  conv-neural-network  image-processing  ocr  machine-learning  neural-networks  conv-neural-network  tensorflow  r  logistic  scoring-rules  probability  self-study  pdf  cdf  classification  svm  resampling  forecasting  rms  volatility-forecasting  diebold-mariano  neural-networks  prediction-interval  uncertainty 

3
Визначення статистичної значущості коефіцієнта лінійної регресії за наявності мультиколінеарності
Припустимо, у мене є маса міст з різною чисельністю населення, і я хотів побачити, чи існує позитивна лінійна залежність між кількістю магазинів алкогольних напоїв у місті та кількістю ДУІ. Де я визначаю, чи є ця залежність значною чи ні, спираючись на t-тест розрахункового коефіцієнта регресії. Тепер явно поп. розмір міста …

1
Чи стає Наївний Бейс більш популярним? Чому?
Це результат трендів Google, отриманий для фрази "Naive Bayes" з січня 2004 по квітень 2017 року ( посилання ). Відповідно до цієї цифри, коефіцієнт пошуку для "Naive Bayes" у квітні 2017 року приблизно на 25 відсотків перевищує максимальний за весь часовий період. Чи означає це, що цей простий і старий …

2
Декомпозиція дисперсії зміщення: термін для очікуваної помилки прогнозу в квадраті за вирахуванням помилки
Хасті та ін. "Елементи статистичного навчання" (2009) розглядають процес формування даних Y= f( X) + εY=f(X)+ε Y = f(X) + \varepsilon з E (ε)=0E(ε)=0\mathbb{E}(\varepsilon)=0 і Var ( ε ) =σ2εVar(ε)=σε2\text{Var}(\varepsilon)=\sigma^2_{\varepsilon}. Вони представляють наступне розмежування дисперсійної дисперсії очікуваної помилки прогнозу в квадраті в точці х0x0x_0 (с. 223, формула 7.9): Помилка (х0)= …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.