Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Як інтерпретувати диференційну ентропію?
Нещодавно я прочитав цю статтю про ентропію дискретного розподілу ймовірностей. Він описує приємний спосіб мислення про ентропію як очікувану кількість бітів (принаймні, при використанні у вашому визначенні ентропії), необхідного для кодування повідомлення, коли ваше кодування є оптимальним, враховуючи розподіл ймовірності вживаних вами слів.log2log2\log_2 Однак, поширюючись на безперервний випадок, як тут, …

2
Що таке "базова лінія" в кривій точності відкликання
Я намагаюся зрозуміти криву точності відкликання, я розумію, що таке точність і відкликання, але те, що я не розумію, це "базове" значення. Я читав це посилання https://classeval.wordpress.com/introduction/introduction-to-the-precision-recall-plot/ і я не розумію базову частину, як показано в "Кривій точності нагадування ідеального класифікатора", що це робить? і як це ми обчислимо? Це …

3
Чому завжди існує принаймні одна політика, яка краща або рівна всім іншим політикам?
Навчання зміцненню: вступ. Друге видання, у стадії розробки , Річард С. Саттон та Ендрю Г. Барто (с) 2012, стор 67-68. Розв’язання навчального завдання з підкріпленням означає, приблизно, пошук політики, яка досягає великої винагороди за довгостроковий період. Для кінцевих MDP ми можемо точно визначити оптимальну політику наступним чином. Функції значення визначають …

3
Корисність теореми Фріш-Ва
Я повинен викладати теорему Фріша Во з економетрики, яку я не вивчав. Я зрозумів математику, яка стоїть за ним, і я сподіваюся, що ідея "коефіцієнт, який ви отримуєте для конкретного коефіцієнта з декількох лінійних моделей, дорівнює коефіцієнту простої регресійної моделі, якщо ви" усунете "вплив інших регресорів". Тож теоретична ідея є …

5
Чи краще робити дослідницький аналіз даних лише на базі даних тренувань?
Я роблю дослідницький аналіз даних (EDA) на наборі даних. Тоді я виберу деякі функції, щоб передбачити залежну змінну. Питання: Чи варто робити ЗНО на моєму навчальному наборі даних? Або я повинен приєднатися до наборів даних про навчання та тестування разом, а потім робити ЗНО на них обох та вибирати функції …

2
Середня ROC для повторної 10-кратної перехресної перевірки з оцінками ймовірності
Я планую використовувати повторну (10 разів) стратифіковану 10-кратну перехресну перевірку приблизно на 10000 випадків за допомогою алгоритму машинного навчання. Кожен раз, коли повторення буде проводитися з різними випадковими насінням. У цьому процесі я створюю 10 екземплярів оцінки ймовірностей для кожного випадку. 1 екземпляр оцінки ймовірності для кожного з 10 повторень …
15 roc 

1
Випадкова проблема параметрів
Я завжди борюся за те, щоб отримати справжню суть проблеми випадкових параметрів. Я кілька разів читав, що оцінювачі фіксованих ефектів нелінійних моделей даних на панелі можуть бути сильно упередженими через "добре відому" проблему випадкових параметрів. Коли я прошу чіткого пояснення цієї проблеми, типовою відповіддю є: Припустимо, що дані панелі мають …

2
Як оновлюються ваги в методі пакетного навчання в нейронних мережах?
Може хтось скажіть, будь ласка, як я повинен будувати нейронну мережу за допомогою пакетного методу? Я читав, що в пакетному режимі для всіх зразків навчального набору ми обчислюємо помилку, дельту і, таким чином, дельта ваги для кожного нейрона в мережі, а потім замість негайного оновлення ваг ми їх накопичуємо, а …

3
Метрики для оцінки алгоритмів ранжування
Мені цікаво переглянути декілька різних показників алгоритмів ранжування - на сторінці вікіпедії «Навчання до ранжування» є декілька, зокрема: • середня середня точність (MAP); • DCG та NDCG; • Precision @ n, NDCG @ n, де "@n" позначає, що показники оцінюються лише на n n документах; • середній зворотний ранг; • …

1
Включення умов взаємодії у випадковій лісі
Припустимо, у нас є відповідь Y та предиктори X1, ...., Xn. Якби ми намагалися вписати Y за допомогою лінійної моделі X1, ...., Xn, і просто так сталося, що справжня залежність між Y і X1, ..., Xn не була лінійною, ми могли б бути в змозі щоб виправити модель, трансформуючи X …

1
Що таке "цільове максимальне очікування ймовірності"?
Я намагаюся зрозуміти деякі статті Марка ван дер Лаана. Він теоретичний статистик в Берклі, який працює над проблемами, які суттєво перегукуються з машинним навчанням. Одна з проблем для мене (крім глибокої математики) полягає в тому, що він часто закінчує опис звичних підходів до машинного навчання, використовуючи зовсім іншу термінологію. Одне …

2
Яке визначення точності Top-n?
Я читаю науковий документ про класифікацію зображень. В експериментальних результатах вони говорять про точність топ-1 і топ-5, але я ніколи не чув про цей термін і не можу знайти його за допомогою google. Чи може хтось дати мені визначення або вказати мені кудись? :)

4
Які змінні пояснюють, які компоненти PCA, і навпаки?
Використовуючи ці дані: head(USArrests) nrow(USArrests) Я можу зробити PCA так: plot(USArrests) otherPCA <- princomp(USArrests) Я можу отримати нові компоненти otherPCA$scores і частка дисперсії, поясненої компонентами з summary(otherPCA) Але що робити, якщо я хочу знати, які змінні в основному пояснюються основними компонентами? І навпаки: пояснюється, наприклад, PC1 або PC2 murder? Як …

2
Як інтерпретувати негативний ACF (функція автокореляції)?
Тож я склав схему повернення нафти ACF / PACF і очікував побачити позитивну автокореляцію, але, на мій подив, я отримав лише негативну значну автокореляцію. Як слід інтерпретувати вищевказаний графік? Вони, схоже, вказують на те, що спостерігається тенденція до збільшення віддачі нафти, коли вона знижувалася раніше, і навпаки, таким чином коливальна …

3
Перевірте, чи багатовимірні розподіли однакові
Скажімо, у мене є дві або більше вибіркових сукупностей n-мірних векторів безперервного значення. Чи є непараметричний спосіб перевірити, чи є ці зразки з одного розподілу? Якщо так, чи є для цього функція в R або python?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.