Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Чому ми просто не вивчимо гіпер параметри?
Я реалізовував досить популярний документ " ПОЯСНЕННЯ ТА ПІДПРИЄМСТВО ДОСЛІДНИХ ПРИКЛАДІВ ", і в роботі він тренує протиборчу цільову функцію J '' (θ) = αJ (θ) + (1 - α) J '(θ). Це трактує α як гіперпараметр. α може бути 0,1, 0,2, 0,3 і т.д. Незалежно від цього конкретного документу, …

2
У чому полягає інтуїція, що стоїть за відмінностями другого порядку?
Іноді може бути необхідним різнити часовий серій, щоб зробити його нерухомим. Однак я не розумію, як диференціювання другого порядку може допомогти зробити його нерухомим, коли розмежування першого порядку недостатньо. Чи можете ви дати зрозуміле пояснення для розмежування другого порядку та випадків, коли це потрібно?

2
Чи не було б кілька фільтрів у згортковому шарі вивчити один і той же параметр під час тренування?
Виходячи з того, що я дізнався, ми використовуємо кілька фільтрів у конвеєрному шарі CNN для вивчення різних детекторів функцій. Але оскільки ці фільтри застосовуються аналогічно (тобто ковзають і примножуються до областей введення), чи не просто вони засвоїли б однакові параметри під час тренування? Отже, використання декількох фільтрів буде зайвим?

1
Як обчислити показники достовірності в регресії (з випадковими лісами / XGBoost) для кожного прогнозу в R?
Чи є спосіб отримати оцінку достовірності (ми можемо назвати це також достовірністю або ймовірністю) для кожного прогнозованого значення при використанні таких алгоритмів, як Random Forests або Extreme Gradient Boosting (XGBoost)? Скажімо, цей показник довіри варіюватиметься від 0 до 1 і показує, наскільки я впевнений у певному прогнозі . З того, …

3
Проблеми з кодуванням із гарячим кодом та фіктивним кодуванням
Мені відомо про той факт, що категоричні змінні з k рівнями повинні бути кодовані змінними k-1 у фіктивній кодування (аналогічно для багатозначних категоріальних змінних). Мені було цікаво, якою проблемою є однокольорове кодування (тобто замість цього k змінних) через кодове кодування для різних методів регресії, в основному лінійної регресії, пеналізованої лінійної …

2
Стандартизація та нормалізація для регресії Лассо / Рідж
Я знаю, що є загальноприйнятою практикою стандартизувати особливості регресії хребта та ласо, однак, чи було б колись практичніше нормалізувати функції за шкалою (0,1) як альтернативу стандартизації z-балів для цих методів регресії?

2
Плюси і мінуси завантаження
Щойно я дізнався про концепцію завантажувального завантаження, і надумалося наївне запитання: якщо ми завжди можемо генерувати численні зразки завантажувальних даних з наших даних, навіщо взагалі турбуватися отримувати більше "реальних" даних? Я думаю, що у мене є пояснення, будь ласка, скажіть мені, чи я прав: я думаю, що процес завантаження зменшує …

3
CIFAR-10 Не може перевищити 60% точності, Керас із Tensorflow backkend [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закритий минулого року . Навчання після 15 епох на наборі даних CIFAR-10, схоже, втрати валідації більше не зменшуються, припадаючи на 1,4 (з 60% точністю перевірки). Я перемістив …

2
Чи можемо ми прийняти нуль у тестах на непридатність?
У звичайному t-тесті засобів, використовуючи звичайні методи тестування гіпотез, ми або відхиляємо нуль, або не відхиляємо нуль, але ми ніколи не приймаємо нуль. Однією з причин цього є те, що якби ми отримали більше доказів, той самий розмір ефекту став би значним. Але що відбувається в тесті на негідність? Це …

1
Чи слід обрати регресора або класифікатора випадкових лісів?
Я вміщую набір даних з двійковим цільовим класом випадковим лісом. У python я можу це зробити або випадковим лісовим класифікатором, або випадковим лісовим регресором. Я можу отримати класифікацію безпосередньо від randomforestclassifier або я можу спершу запустити randomforestregressor і отримати набір оціночних балів (безперервне значення). Тоді я можу знайти значення відсікання …

3
Чому оцінювач OLS коефіцієнта AR (1) упереджений?
Я намагаюся зрозуміти, чому OLS дає необ’єктивну оцінку процесу AR (1). Розглянемо У цій моделі порушена сувора екзогенність, тобто та співвідносяться, але та є некорельованими. Але якщо це правда, то чому не виконується наступне просте виведення? утϵт= α + βуt - 1+ϵт,∼я i dN( 0 , 1 ) .yt=α+βyt−1+ϵt,ϵt∼iidN(0,1). \begin{aligned} …

4
Чи є AUC вірогідною коректною класифікацією випадково вибраного екземпляра від кожного класу?
Я читав цей підпис у папері і ніколи більше не бачив AUC, описаного таким чином. Це правда? Чи є доказ чи простий спосіб це побачити? На рис. 2 показана точність прогнозування дихотомічних змінних, виражена у частині площі під кривою функціонування приймача (AUC), що еквівалентно ймовірності правильного класифікації двох випадково вибраних …

3
Використовувати Holt-Winters або ARIMA?
Моє запитання полягає в концептуальній різниці між Holt-Winters та ARIMA. Наскільки я розумію, Холт-Вінтерс - це особливий випадок ARIMA. Але коли один алгоритм віддається перевагу іншому? Можливо, Хольт-Вінтерс є поступовим і тому служить вбудованим (швидшим) алгоритмом? Чекаю на деяке розуміння тут.

3
У чому переваги поетапної регресії?
Я експериментую з поступовою регресією заради різноманітності в моєму підході до проблеми. Отже, у мене є 2 питання: У чому переваги поетапної регресії? Які його конкретні сильні сторони? Що ви думаєте про гібридний підхід, коли ви використовуєте поетапну регресію для вибору функцій, а потім застосовуєте звичайну регресію, збираючи всі вибрані …

2
Поводження з невідомими словами в задачах моделювання мови за допомогою LSTM
Для завдання з обробки природних мов (NLP) часто використовуються вектори word2vec як вбудовування для слів. Однак може бути багато невідомих слів, які не фіксуються векторами word2vec просто тому, що ці слова бачать недостатньо часто в навчальних даних (у багатьох реалізаціях використовується мінімальна кількість, перш ніж додати слово до словника). Особливо …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.