Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Чи існує стандартний метод вирішення проблеми переключення міток при оцінці моделей сумішей?
Перемикання міток (тобто задній розподіл інваріантно для переключення міток компонентів) є проблематичним питанням при використанні MCMC для оцінки моделей сумішей. Чи існує стандартна (як у широко прийнятій) методологія для вирішення цього питання? Якщо немає стандартного підходу, то які плюси та мінуси провідних підходів до вирішення проблеми переключення міток?
15 bayesian  mcmc  mixture 

3
Як ви визначаєте розмір вибірки при опитуванні великої кількості населення?
В даний час в Австралії проводяться вибори, і зрозуміло, що ЗМІ щодня повідомляють про нові результати політичного опитування. У 22 мільйонах країн, який відсоток населення потрібно взяти на вибірку, щоб отримати статистично достовірний результат? Чи можливо, що використання занадто великої вибірки може вплинути на результати, або статистична обгрунтованість монотонно зростає …

10
Який найкращий класичний класифікатор 2-х класів для вашої програми? [зачинено]
Закрито . Це питання ґрунтується на думці . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб на нього можна було відповісти фактами та цитатами, відредагувавши цю публікацію . Закрито 3 роки тому . Правила: один класифікатор на відповідь голосуйте, якщо ви згодні знижувати / видаляти дублікати. помістіть …

8
Альтернативна графіка для графіків "обробляти смугу"
У моєму дослідженні популярним способом відображення даних є використання комбінації діаграми з "ручками". Наприклад, "Ручки" чергуються між стандартними помилками та стандартними відхиленнями залежно від автора. Зазвичай розміри вибірки для кожного «бруска» досить невеликі - близько шести. Ці сюжети здаються особливо популярними в біологічних науках - див. Перші приклади BMC Biology, …

5
Чому в школах США та Великобританії викладають різні методи обчислення стандартного відхилення?
Як я розумію, школи у Великобританії вчать, що стандартне відхилення можна знайти за допомогою: В той час як американські школи вчать: (на базовому рівні все одно). Це спричинило ряд проблем моїх студентів у минулому, коли вони шукали в Інтернеті, але знайшли неправильне пояснення. Чому різниця? За допомогою простих наборів даних …

5
Чи можна використовувати декілька регресій для прогнозування одного основного компонента (ПК) від кількох інших ПК?
Нещодавно користувач у списку розсилки R-help запитав про надійність використання балів PCA в регресії. Користувач намагається використовувати деякі результати на ПК, щоб пояснити зміни в іншому ПК (див. Повну дискусію тут ). Відповідь була: ні, це не звучить, оскільки ПК є ортогональними один для одного. Чи може хтось пояснити трохи …
15 regression  pca 

4
Чому нам потрібен оцінювач, щоб бути послідовним?
Я думаю, я вже зрозумів математичне визначення послідовного оцінювача. Виправте мене, якщо я помиляюся: WnWnW_n - послідовний оцінювач дляθθ\theta якщо∀ϵ>0∀ϵ>0\forall \epsilon>0 limn→∞P(|Wn−θ|>ϵ)=0,∀θ∈Θlimn→∞P(|Wn−θ|>ϵ)=0,∀θ∈Θ\lim_{n\to\infty} P(|W_n - \theta|> \epsilon) = 0, \quad \forall\theta \in \Theta Де - параметричний простір. Але я хочу зрозуміти необхідність того, щоб оцінювач був послідовним. Чому невідповідний оцінювач поганий? …

5
Як поводитися одночасно з багатьма серіями разів?
У мене є набір даних, що включає попит на кілька товарів (1200 товарів) за 25 періодів, і мені потрібно передбачити попит кожного товару на наступний період. Спочатку я хотів використовувати ARIMA та тренувати модель для кожного продукту, але через кількість продуктів та налаштування параметрів (p, d, q) це забирає багато …

5
Чому припущення нормальності в лінійній регресії
Моє запитання дуже просте: чому ми обираємо нормальне як розподіл, за яким слід термін помилки, припускаючи лінійну регресію? Чому ми не обираємо інших, таких як уніформа, т чи інше?

2
Що таке розподіл по функціях?
Я читаю підручник Гауссовий процес для машинного навчання CE Расмуссена та CKI Williams, і у мене виникають проблеми з розумінням того, що означає розподіл за функціями . У підручнику наводиться приклад того, що слід уявити функцію як дуже довгий вектор (насправді вона повинна бути нескінченно довгою?). Тому я уявляю, що …

4
Що таке * штучна нейронна мережа?
Коли ми заглиблюємось у літературу про нейронні мережі , ми дістаємо ідентифікацію інших методів з нейроморфними топологіями ("Нейромережеві" архітектури). І я не кажу про теорему універсального наближення . Приклади наведені нижче. Потім мене змушує замислитися: що таке визначення штучної нейронної мережі? Здається, його топологія охоплює все. Приклади: Однією з перших …

5
Яка потреба припущень у лінійній регресії?
При лінійній регресії робимо наступні припущення Середнє значення відповіді, E(Yi)E(Yi)E(Y_i) , на кожен набір значень предикторів (x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) - це лінійна функція предикторів. Помилки, εiεiε_i , є незалежними. Похибки, εiεiε_i , для кожного набору значень предикторів (x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) , як правило, розподіляються. Похибки εiεiε_i для кожного набору значень предикторів (x1i,x2i,…)(x1i,x2i,…)(x_{1i}, …

1
Мінімізація упередженості в пояснювальному моделюванні, чому? (Галіта Шмулі «Пояснити або передбачити»)
Це питання посилається на статтю Галіта Шмулі "Пояснити чи передбачити" . Зокрема, у розділі 1.5 "Пояснення та передбачення різні" професор Шмуелі пише: У роз'яснювальному моделюванні основна увага приділяється мінімізації зміщення для отримання найбільш точного подання основної теорії. Це спантеличувало мене кожного разу, коли я читав статтю. У якому сенсі мінімізація …

4
Доказ рівнозначних формул регресії хребта
Я читав найпопулярніші книги в статистичному навчанні 1- Елементи статистичного навчання. 2- Вступ до статистичного навчання . Обидва згадують, що регресія хребта має дві формули, рівнозначні. Чи є зрозумілий математичний доказ цього результату? Я також пройшов Cross Valified , але я не можу знайти певного доказу там. Крім того, буде …

2
Нейронні мережі проти всього іншого
Я не знайшов задовільної відповіді на це від Google . Звичайно, якщо у мене є дані мільйонів, то глибоке навчання - це спосіб. І я читав, що коли у мене немає великих даних, то, можливо, краще використовувати інші методи в машинному навчанні. Причина - це надмірна відповідність. Машинне навчання: тобто …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.