Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Чи завжди перехід від безперервних даних до категоричних завжди помиляється?
Коли я читаю про те, як налаштувати ваші дані, одне, що мені часто траплялося, - це те, що перетворення деяких безперервних даних у категоричні дані не є хорошою ідеєю, оскільки ви дуже добре можете зробити неправильний висновок, якщо пороги погано визначені. Однак на даний момент у мене є деякі дані …

3
Коли інтервал довіри "має сенс", але відповідний достовірний інтервал не робить?
Часто буває так, що довірчий інтервал з покриттям 95% дуже схожий на достовірний інтервал, який містить 95% задньої щільності. Це відбувається, коли попередній є рівномірним або майже однорідним в останньому випадку. Таким чином, довірчий інтервал часто можна використовувати для наближення достовірного інтервалу і навпаки. Важливо, що з цього можна зробити …

2
Приклади статистики, яка не залежить від розподілу вибірки?
Це визначення статистики у wikipedia Більш формально, статистична теорія визначає статистику як функцію вибірки, де сама функція не залежить від розподілу вибірки; тобто функцію можна заявити перед реалізацією даних. Термін статистика використовується як для функції, так і для значення функції на даному вибірці. Я думаю, що я розумію більшість цього …

2
Чи можна використовувати моменти розподілу для вибірки розподілу?
Я помічаю в статистиці / методах машинного навчання, розподіл часто наближається до Гаусса, а потім Гаусса використовується для вибірки. Вони починаються з обчислення перших двох моментів розподілу, і використовують їх для оцінки μμ\mu і σ2σ2\sigma^2 . Тоді вони можуть взяти зразок у того гаусса. Мені здається, чим більше моментів я …

2
Чи розподіл Коші якось є "непередбачуваним" розподілом?
Чи розподіл Коші якось є "непередбачуваним" розподілом? Я намагався робити cs <- function(n) { return(rcauchy(n,0,1)) } в R для безлічі n значень і помітили, що вони час від часу генерують досить непередбачувані значення. Порівняйте це з напр as <- function(n) { return(rnorm(n,0,1)) } що завжди видає "компактну" хмару точок. За …


5
Як я можу обчислити, чи має моя лінійна регресія статистично значущу відмінність від відомої теоретичної лінії?
У мене є деякі дані, які відповідають приблизно лінійній лінії: Коли я роблю лінійну регресію цих значень, я отримую лінійне рівняння: у= 0,997 х - 0,0136у=0,997х-0,0136y = 0.997x-0.0136 В ідеальному світі рівняння повинно бути .у= ху=хy = x Ясна річ, мої лінійні значення близькі до ідеального, але не зовсім. Моє …

2
Чому Сімпсони (телесеріал) настільки очевидно успішні у «передбаченні» майбутнього? [зачинено]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 2 роки тому . Це широко коментується в жовтій і не настільки жовтій пресі, що Сімпсони (телесеріал) не раз прогнозували майбутнє. Вичерпні онлайн-статті про це є …

1
Глибина дерева рішень
Оскільки алгоритм дерева рішень розділяється на атрибут на кожному кроці, максимальна глибина дерева рішень дорівнює кількості атрибутів даних. Це правильно?

1
Які алгоритми пакетування гідні наступників Random Forest?
Щодо прискорення алгоритмів, я б сказав, що вони розвивалися досить добре. На початку 1995 року була представлена ​​AdaBoost, потім через деякий час це була градієнтна машина для підсилення (GBM). Нещодавно, близько 2015 року, було представлено XGBoost, який є точним, справляється з оснащенням і став переможцем кількох змагань Kaggle. У 2017 …

6
Більш важлива статистика: "90 відсотків усіх жінок вижили" або "90 відсотків усіх тих, хто вижив, були жінки"?
Розглянемо наступні твердження про Титанік: Припущення 1: На кораблі були лише чоловіки та жінки Припущення 2: Була велика кількість чоловіків, а також жінок Заява 1: 90 відсотків усіх жінок вижили Заява 2: 90 відсотків усіх, хто вижив, були жінками Перший вказує на те, що врятування жінок, ймовірно, було пріоритетним (незалежно …

3
Поради щодо співпраці з прикладними вченими
Я аспірант зі статистики і як такий брав участь у парі співпраці з прикладними вченими (економістами, лісниками,…). Ці співпраці - це забава (більшість часу), і я багато вчиться, але є і деякі ускладнення, наприклад: Іноді мій погляд на те, що є хорошою статистичною моделлю, відрізняється від досвіду моїх співробітників та …
14 references 

1
Чому ми не використовуємо непостійні показники навчання для гідного градієнта для речей, відмінних від нейронних мереж?
Література поглибленого вивчення повна розумних хитрощів із використанням непостійних темпів навчання в градієнтному узвозі. Такі речі, як експоненціальний розпад, RMSprop, Adagrad тощо, легко здійснити і доступні у кожному глибокому навчальному пакеті, проте вони, як видається, не існують поза нейронних мереж. Чи є для цього причина? Якщо люди просто не хвилюються, …

6
Нітпікінг про активне / пасивне використання "корельованих"
Я вагаюся, чи запитувати це тут у статистиці StackExchange або в мовознавстві / англійській мові, але я вважаю, що тут може бути більше користувачів, які не сприймають мови, ніж користувачів, які користуються статистикою на іншому форумі;) Я часто читаю доповіді, в яких згадується про кореляцію як дієслово в активному голосі, …

4
Прогностичні моделі: статистика не може перемогти машинне навчання? [зачинено]
Закрито . Це питання має бути більш зосередженим . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно зосередило увагу на одній проблемі, лише відредагувавши цю публікацію . Закрито 2 роки тому . Зараз я переглядаю магістерську програму, зосереджену на статистиці / економетриці. У мого майстра всі …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.