Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

1
Градієнт підсилюючого дерева: "чим більше змінною, тим краще"?
З підручника XGBoost, я думаю, що коли кожне дерево росте, всі змінні скануються, щоб їх було вибрано для розбиття вузлів, і буде вибрано той, який має максимальний розріз посилення. Отже, моє запитання полягає в тому, що якщо я додаю деякі змінні шуму в набір даних, чи вплинуть ці змінні шуми …

4
Машинне навчання проти глибокого навчання
Мене трохи бентежить різниця між термінами "машинне навчання" та "глибоке навчання". Я погуглив його і прочитав багато статей, але мені це все ще не дуже зрозуміло. Відоме визначення машинного навчання Тома Мітчелла: Комп'ютерна програма називається витягти з досвіду Е щодо деякого класу задач T і вимірювання продуктивності P , якщо …

4
Міра ефективності: Чому це називається відкликанням?
точність - це частка отриманих екземплярів, які є релевантними, тоді як виклик (також відомий як чутливість) - це частка відповідних екземплярів, які витягуються. Я знаю їх значення, але не знаю, чому це називається відкликанням ? Я не є носієм англійської мови. Я знаю, що згадати означає, пам'ятайте, тоді я не …

4
Переповнення / недостатність розміру даних
На графіку нижче x-ось => Розмір набору даних y-ось => Оцінка перехресної перевірки Червона лінія призначена для навчальних даних Зелена лінія призначена для тестування даних У підручнику, про який я говорю, автор говорить, що точка, де червона та зелена лінія перетинаються, означають, Збір більше даних навряд чи збільшить ефективність узагальнення, …

1
Виведення лінійної регресії XGBoost невірно
Я новачок у XGBoost, тому пробачте про своє незнання. Ось код python: import pandas as pd import xgboost as xgb df = pd.DataFrame({'x':[1,2,3], 'y':[10,20,30]}) X_train = df.drop('y',axis=1) Y_train = df['y'] T_train_xgb = xgb.DMatrix(X_train, Y_train) params = {"objective": "reg:linear"} gbm = xgb.train(dtrain=T_train_xgb,params=params) Y_pred = gbm.predict(xgb.DMatrix(pd.DataFrame({'x':[4,5]}))) print Y_pred Вихід: [ 24.126194 24.126194] …

1
Інтуїція для параметра регуляризації в SVM
Як зміна параметра регуляризації у SVM змінює межу рішення для нероздільного набору даних? Візуальна відповідь та / або якийсь коментар щодо обмежувальної поведінки (для великих і малих регуляризацій) була б дуже корисною.
11 svm 

1
Що відбувається, коли ми тренуємо лінійний SVM на нелінійно відокремлюваних даних?
Що відбувається, коли ми тренуємо основну машину підтримки вектора (лінійне ядро ​​та відсутність м'якого запасу) на нелінійно відокремлюваних даних? Проблема оптимізації неможлива, тому що повертає алгоритм мінімізації?

6
Чи достатньо Excel для наукових даних?
Я зараз готуюсь викладати вступний курс з наукових даних з використанням мови програмування R. Моя аудиторія - студенти, що спеціалізуються на бізнес-предметах. Типовий недорогий бізнес не має досвіду комп'ютерного програмування, але він взяв кілька класів, які використовують Excel. Особисто мені дуже зручно користуватися R (або іншими мовами програмування), тому що …

1
Вплив НЕ зміни ваги фільтрів CNN під час заднього ходу
Який ефект НЕ змінює ваги фільтрів CNN під час зворотного розповсюдження? Я змінив лише повністю пов'язані ваги шару під час тренування на наборі даних MNIST і все-таки досяг майже 99-відсоткової точності.

2
Лінійна регресія та масштабування даних
Наступний графік показує коефіцієнти, отримані при лінійній регресії (з mpgцільовою змінною та всі інші як предиктори). Для набору даних mtcars ( тут і тут ) як із масштабуванням даних, так і без них: Як я інтерпретую ці результати? Змінні hpта dispзначущі лише в тому випадку, якщо дані масштабуються. Це amі …

3
Кращі мови для наукових обчислень [закрито]
Закрито . Це питання має бути більш зосередженим . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно зосередило увагу на одній проблемі, лише відредагувавши цю публікацію . Закрито 5 років тому . Здається, що більшість мов мають деяку кількість бібліотек наукових обчислень. Python має Scipy Rust …
10 efficiency  statistics  tools  knowledge-base  machine-learning  neural-network  deep-learning  optimization  hyperparameter  machine-learning  time-series  categorical-data  logistic-regression  python  visualization  bigdata  efficiency  classification  binary  svm  random-forest  logistic-regression  data-mining  sql  experiments  bigdata  efficiency  performance  scalability  distributed  bigdata  nlp  statistics  education  knowledge-base  definitions  machine-learning  recommender-system  evaluation  efficiency  algorithms  parameter  efficiency  scalability  sql  statistics  visualization  knowledge-base  education  machine-learning  r  python  r  text-mining  sentiment-analysis  machine-learning  machine-learning  python  neural-network  statistics  reference-request  machine-learning  data-mining  python  classification  data-mining  bigdata  usecase  apache-hadoop  map-reduce  aws  education  feature-selection  machine-learning  machine-learning  sports  data-formats  hierarchical-data-format  bigdata  apache-hadoop  bigdata  apache-hadoop  python  visualization  knowledge-base  classification  confusion-matrix  accuracy  bigdata  apache-hadoop  bigdata  efficiency  apache-hadoop  distributed  machine-translation  nlp  metadata  data-cleaning  text-mining  python  pandas  machine-learning  python  pandas  scikit-learn  bigdata  machine-learning  databases  clustering  data-mining  recommender-system 

3
Як я можу класифікувати категоричні дані, які не виправлені?
У мене є проблема класифікації як категоричних, так і числових даних. Проблема, з якою я стикаюся, полягає в тому, що мої категоричні дані не виправлені, це означає, що новий кандидат, ярлик якого я хочу передбачити, може мати нову категорію, яку раніше не спостерігали. Наприклад, якщо мої категоричні дані були sexєдино …

3
Рання зупинка на втраті перевірки чи на точності?
В даний час я навчаю нейронну мережу, і не можу вирішити, що використовувати для реалізації своїх критеріїв раннього припинення: втрата валідації або такі показники, як точність / f1score / auc / незалежно від обчислених наборів перевірки. У своєму дослідженні я натрапив на статті, що захищають обидві точки зору. Здається, Керас …

3
XGboost - вибір за моделлю
Я використовую XGboost для прогнозування цільової змінної на 2 класи щодо страхових претензій. У мене є модель (навчання з перехресною валідацією, налаштування гіпер параметрів і т. Д.), Які я запускаю на іншому наборі даних. Моє запитання: чи є спосіб дізнатися, чому дана претензія вплинула на один клас, тобто особливості, що …
10 xgboost 

1
Використання RNN (LSTM) для системи розпізнавання жестів
Я намагаюся створити систему розпізнавання жестів для класифікації жестів ASL (американської мови жестів ) , тому мій вхід повинен бути послідовністю кадрів або з камери, або з відеофайлу, тоді він визначає послідовність і відображає її у відповідній клас (спати, допомагати, їсти, бігати тощо) Справа в тому, що я вже створив …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.