Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як почати будувати регресійну модель, коли найбільш сильно асоційований предиктор - двійковий
У мене є набір даних, що містить 365 спостереження за трьома змінними, а саме pm, tempі rain. Тепер я хочу перевірити поведінку pmу відповідь на зміни інших двох змінних. Мої змінні: pm10 = Відповідь (залежно) temp = предиктор (незалежний) rain = предиктор (незалежний) Далі наведена кореляційна матриця для моїх даних: …

3
Контрприклади, коли медіана знаходиться поза [Середній режим]
Ця стаття вище моєї ліги, але вона говорить про тему, яка мене цікавить, взаємозв'язок між середнім, режимом та медіаною. Він говорить : Поширена думка, що медіана унімодального розподілу "зазвичай" між середнім і модним. Однак це не завжди так ... Моє запитання : чи може хтось навести приклади безперервних одномодальних (ідеально …
11 mean  median  mode 

3
Оцінка параметрів Байєса або тестування гіпотез Байєса
Здається, що в байєсівській спільноті триває суперечка щодо того, чи слід робити оцінку параметрів Байєса чи тестування гіпотези Байєса. Мені цікаво просити думки з цього приводу. Які відносні сильні та слабкі сторони цих підходів? У яких контекстах один є більш відповідним, ніж інший? Чи слід робити оцінку параметрів і тестування …

1
Обчислення довірчих інтервалів для режиму?
Я шукаю посилання на обчислення довірчих інтервалів для режиму (загалом). Завантаження завантажувача може здатися першим природним вибором, але, як обговорюється Романо (1988), стандартний завантажувальний пристрій виходить з ладу для режиму, і він не пропонує простого рішення. Чи щось змінилося після цього документу? Який найкращий спосіб обчислити довірчі інтервали для режиму? …

3
Діапазон значень косості та куртозу для нормального розподілу
Хочу знати, що таке діапазон значень косості та куртозу, за якими дані вважаються нормально розподіленими. Я прочитав багато аргументів і в основному отримав змішані відповіді. Деякі кажуть, що для корутозу та для куртозу прийнятний діапазон для нормального поширення. Деякі кажуть для є прийнятним діапазоном. Тут я знайшов детальну дискусію: Який …

3
Надійність приталеної кривої?
Я хотів би оцінити невизначеність або надійність встановленої кривої. Я навмисно не називаю точну математичну величину, яку шукаю, оскільки не знаю, що це. Тут (енергія) - залежна змінна (відповідь), а V (об'єм) - незалежна змінна. Я хотів би знайти криву енергії-об’єму ( E ( V )) деякого матеріалу. Тому я …

2
Розуміння Гельмана та Карліна "Поза потужністю: ..." (2014)
Я читаю Гельмана та Карліна "Поза межами обчислень потужності: Оцінка помилок типу S (знак) та типу M (величина)" (2014). Я намагаюся зрозуміти головну ідею, основний зліт, але я розгублений. Хтось може допомогти мені перегнати суть? У статті йде щось подібне (якщо я правильно це зрозумів). Статистичні дослідження в психології часто …

1
Терміни "відрізати" та "відрізати хвіст" щодо функцій ACF, PACF
Я намагаюся зрозуміти сенс відсікання та хвостів у сюжетних часових рядках ACF та PACF. Що означає "Відсікання після відставання"? Це про ліміт? Що означає "Хвостики"? У наведеному вище прикладі книга, яку я використовую для вивчення, говорить про те, що це процес AR. Але я не можу розібратися в значеннях "відрізати" …

2
Яка ймовірність намалювати чотири з виду, коли з колоди 52 витягнуто 20 карт?
Вчора ми з домогосподарками грали в карткові ігри, і хтось спливав це питання. Ми намагалися вирішити проблему, але не змогли її розібратися. Сьогодні вранці я прокинувся і все ще цікавлюсь, як це вирішити. Будь ласка, допоможіть мені?

4
Що є більш підходящим способом створення набору для витримки: видалити деякі предмети або видалити спостереження з кожного предмета?
У мене є набір даних з 26 функціями та 31000 рядків. Це набір даних 38 предметів. Це для біометричної системи. Тому я хочу вміти виявляти суб'єктів. Щоб мати набір для тестування, я знаю, що я повинен видалити деякі значення. Отже, що краще робити і чому? (a) тримати 30 предметів як …

1
Чому великий вибір K знижує показник перехресної перевірки?
Граючи з набором даних Boston Housing Dataset та RandomForestRegressor(з параметрами за замовчуванням) у scikit-learn, я помітив щось дивне: середній бал перехресної перевірки зменшився, оскільки я збільшив кількість складок понад 10. Моя стратегія крос-валідації була така: cv_met = ShuffleSplit(n_splits=k, test_size=1/k) scores = cross_val_score(est, X, y, cv=cv_met) ... де num_cvsбуло різноманітно. Я …

3
Які переваги експоненціального генератора випадкових випадків використовують метод Аренса і Дітера (1972), а не шляхом зворотного перетворення?
Моє питання надихає вбудований генератор експоненціальних випадкових чисел R , функція rexp(). Намагаючись генерувати експоненціально розподілені випадкові числа, багато підручників рекомендують метод зворотного перетворення, як описано на цій сторінці Вікіпедії . Я усвідомлюю, що є інші методи для виконання цього завдання. Зокрема, у вихідному коді R використовується алгоритм, викладений у …

4
Сума незалежних лонормальних випадкових величин здається ненормальною?
Я намагаюся зрозуміти, чому сума двох (або більше) лонормальних випадкових величин наближається до лонормального розподілу, коли ви збільшуєте кількість спостережень. Я подивився в Інтернеті і не знайшов жодного результату щодо цього. Зрозуміло, що якщо і є незалежними логічними нормами, то за властивостями експонентів та гауссових випадкових величин також є ненормальним. …

2
Доказ теореми центральної межі не використовує характерних функцій
Чи є докази, що CLT не використовує характерні функції, більш простий метод? Може, методи Тихомирова чи Штейна? Щось самостійне, що ви можете пояснити студенту університету (перший курс математики чи фізики) і займає менше однієї сторінки?

1
Вибір моделі Mclust
Пакет R mclustвикористовує BIC як критерій вибору моделі кластера. З мого розуміння, модель з найнижчою BIC повинна бути обрана порівняно з іншими моделями (якщо виключно дбаєш лише про BIC). Однак, коли значення BIC усі негативні, Mclustфункція за замовчуванням відповідає моделі з найвищим значенням BIC. Моє загальне розуміння з різних випробувань …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.