Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

4
Використання TensorFlow з процесором Intel
Я новачок у глибокому навчанні. Чи є зараз можливість використовувати TensorFlow з графічними процесорами Intel? Якщо так, будь ласка, вкажіть мене в правильному напрямку. Якщо ні, то, будь ласка, повідомте мені, яку рамку, якщо вона є, (Keras, Theano тощо), яку я можу використовувати для мого інтегрального графічного контролера Intel Corporation …
20 tensorflow  keras  theano  gpu 

1
Прогнозування часових рядів за допомогою LSTM: Важливість зробити стаціонарні часові ряди
У цьому посиланні на "Стаціонарність та диференціювання " було зазначено, що такі моделі, як ARIMA, потребують стаціонарного часового ряду для прогнозування, оскільки його статистичні властивості, такі як середнє значення, дисперсія, автокореляція тощо, є постійними у часі. Оскільки RNN мають кращу здатність до вивчення нелінійних зв’язків ( як зазначено тут: Обіцяння …

3
StandardScaler до і після поділу даних
Коли я читав про використання StandardScaler, більшість рекомендацій говорили про те, що слід використовувати, StandardScaler перш ніж розділяти дані на поїзд / тест, але коли я перевіряв деякі коди, розміщені в Інтернеті (за допомогою sklearn), було два основних напрямки. 1- Використання StandardScalerвсіх даних. Напр from sklearn.preprocessing import StandardScaler sc = …

1
Чи слід масштабувати один гарячий вектор числовими атрибутами
У випадку поєднання категоричних та числових атрибутів я зазвичай перетворюю категоричні атрибути в один гарячий вектор. Моє запитання: чи залишаю я ці вектори такими, які є, і масштабувати числові атрибути шляхом стандартизації / нормалізації, або я повинен масштабувати один гарячий вектор разом із числовими атрибутами?

4
Незбалансовані багатокласові дані з XGBoost
У мене є 3 класи з цим розподілом: Class 0: 0.1169 Class 1: 0.7668 Class 2: 0.1163 І я використовую xgboostдля класифікації. Я знаю, що є параметр, який називається scale_pos_weight. Але як це обробляється для "багатокласового" випадку і як я можу його правильно встановити?

1
Як вирішити архітектуру нейронної мережі?
Мені було цікаво, як нам вирішити, скільки вузлів у прихованих шарах і скільки прихованих шарів поставити, коли ми будуємо архітектуру нейронної мережі. Я розумію, що рівень введення та виведення залежить від навчального набору, який ми маємо, але як ми вирішуємо прихований шар та загальну архітектуру взагалі?

2
Що сприяє альфа- та бета-гіперпараметрам при розподілі прихованого диріхле?
LDA має два гіперпараметри, налаштування їх змінює індуковані теми. Що сприяє розвитку альфа-бета-гіперпараметрів при ЛДА? Як змінюється тема, якщо один чи інший гіперпараметр збільшується чи зменшується? Чому вони гіперпараметри, а не лише параметри?

1
Що таке відстань Хеллінгера і коли її використовувати?
Мені цікаво дізнатися, що насправді відбувається на відстані Хеллінгера (простими словами). Крім того, мені також цікаво знати, які існують проблеми, якими ми можемо скористатися Відстань Хеллінгера? Які переваги використання дистанції Hellinger?

2
Як отримати p-значення та впевнений інтервал у LogisticRegression за допомогою sklearn?
Я будую багаточленну логістичну регресію зі sklearn (LogisticRegression). Але після її завершення, як я можу отримати p-значення та впевнений інтервал своєї моделі? Здається лише, що sklearn забезпечує лише коефіцієнт та перехоплення. Дуже дякую.

3
Як виконати інженерію функцій на невідомих функціях?
Я беру участь у змаганнях з кагл. Набір даних має близько 100 функцій і всі невідомі (з точки зору того, що насправді вони представляють). В основному це просто цифри. Люди виконують багато інженерних можливостей щодо цих функцій. Мені цікаво, як саме можна вміти виконувати інженерну програму на невідомих функціях? Може …

3
Як генерувати синтетичний набір даних за допомогою моделі машинного навчання, засвоєної з оригінальним набором даних?
Взагалі модель машинного навчання побудована на наборах даних. Мені хотілося б знати, чи є який-небудь спосіб генерувати синтетичний набір даних за допомогою такої підготовленої моделі машинного навчання із збереженням оригінальних характеристик набору даних? [оригінальні дані -> побудувати модель машинного навчання -> використовувати модель ml для отримання синтетичних даних .... !!!] …

2
Категоризація тексту: поєднання різного роду ознак
Проблема, яку я вирішую, - класифікація коротких текстів на кілька класів. Мій сучасний підхід полягає у використанні зважених термінальних частот tf-idf та вивченні простого лінійного класифікатора (логістична регресія). Це працює досить добре (близько 90% макро F-1 на тестовому наборі, майже 100% на навчальному наборі). Великою проблемою є невидимі слова / …

3
Як створити складну радіолокаційну діаграму?
Отже, я хочу створити Radar Chart профілю гравця приблизно так: Не тільки масштаб кожної змінної різний, але також я хочу змінити шкалу для деяких статистичних даних, таких як "розкуркулений" стат, де менше насправді означає добро. Одним із варіантів шкали змінної для кожної статистики може бути встановлення еталону та обчислення балу …

3
Як скласти список споріднених слів на основі початкових ключових слів?
Нещодавно я побачив класну функцію, яка колись була доступна в Google Таблицях: ви починаєте із написання кількох пов’язаних ключових слів у послідовних клітинках, скажімо: "синій", "зелений", "жовтий", і вона автоматично генерує подібні ключові слова (у цьому випадку , інші кольори). Дивіться більше прикладів цього відео на YouTube . Я хотів …

2
Чи можете ви пояснити різницю між SVC та LinearSVC у scikit-learn?
Нещодавно я почав вчитися працювати sklearnі щойно натрапив на цей своєрідний результат. Я використовував digitsнаявний набір даних, sklearnщоб спробувати різні моделі та методи оцінки. Коли я тестував модель підтримки Vector Vector на даних, я виявив, що існує два різних класи sklearnдля класифікації SVM: SVCі LinearSVC, коли перший використовує підхід один …
19 svm  scikit-learn 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.