Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

8
Чи підходить Python для великих даних
Я читаю в цьому дописі, чи підходить мова R для Big Data, яка становить великі дані 5TB, і хоча це добре допомагає надавати інформацію про доцільність роботи з даними такого типу, в Rній надається дуже мало інформації Python. Мені було цікаво, чи Pythonможна працювати і з такою кількістю даних.
14 bigdata  python 

4
Інтервал прогнозування навколо прогнозу часових рядів LSTM
Чи існує метод обчислення інтервалу прогнозування (розподілу ймовірностей) навколо прогнозу часових рядів з нейронної мережі LSTM (або іншої періодичної)? Скажімо, наприклад, я прогнозую 10 зразків у майбутнє (t + 1 до t + 10), виходячи з останніх 10 спостережуваних вибірок (t-9 до t), я б очікував, що прогноз при t …

2
Як підходять парні моделі ранжирування в xgBoost?
Наскільки я знаю, щоб навчити навчання класифікувати моделі, у наборі даних потрібно мати три речі: етикетка або відповідність група або ідентифікатор запиту вектор функції Наприклад, набір даних Microsoft Learning to Rank використовує цей формат (мітка, ідентифікатор групи та функції). 1 qid:10 1:0.031310 2:0.666667 ... 0 qid:10 1:0.078682 2:0.166667 ... Я …
14 search  ranking  xgboost  gbm 

4
Як масштабувати масив підписаних цілих чисел для діапазону від 0 до 1?
Я використовую Brain для тренування нейронної мережі на наборі функцій, що включає як позитивні, так і негативні значення. Але для мозку потрібні вхідні значення від 0 до 1. Який найкращий спосіб нормалізувати мої дані?

3
Що означає вихід моделі model.predict від Keras?
Я створив модель LSTM для передбачення повторюваних питань на офіційному наборі даних Quora. Тестові мітки дорівнюють 0 або 1. 1 означає, що пара запитань є дублікатом. Після побудови моделі за допомогою model.fitя тестую модель, використовуючи model.predictдані тесту. Вихід - це масив значень, таких як нижче: [ 0.00514298] [ 0.15161049] [ …


4
Кількість епох у впровадженні Gensim Word2Vec
У реалізації Word2Vec є iterпараметрgensim клас gensim.models.word2vec.Word2Vec (речення = Немає, розмір = 100, альфа = 0,025, вікно = 5, min_count = 5, max_vocab_size = Немає, зразок = 0, насіння = 1, робітники = 1, min_alpha = 0,0001, sg = 1, hs = 1, мінус = 0, cbow_mean = 0, hashfxn …

2
Як ви застосовуєте SMOTE для класифікації тексту?
Техніка синтезу синтетичних меншин (SMOTE) - техніка пересимплінгу, яка використовується при незбалансованій задачі набору даних. Поки що у мене є ідея, як це застосувати до загальних, структурованих даних. Але чи можна застосувати його до проблеми класифікації тексту? Яка частина даних вам потрібна для вибірки? Є вже інше питання щодо цього, …

3
Рамка даних Pandas до DMatrix
Я намагаюся запустити xgboost в scikit learn. І я використовую лише Pandas для завантаження даних у рамки даних. Як я повинен використовувати pandas df з xgboost. Мене бентежить рутина DMatrix, необхідна для запуску xgboost algo.

4
AlphaGo (та інші ігрові програми, що використовують підкріплення) без людських баз даних
Я не фахівець з цього питання, і моє питання, мабуть, дуже наївне. Це випливає з есе для розуміння повноважень та обмежень навчання підкріплення, що використовується в програмі AlphaGo. Програма AlphaGo була побудована, використовуючи, серед іншого (Монте-Карло розвідка дерев тощо), нейронні мережі, які навчаються з величезної бази ігор, що граються людьми, …


2
Чому генетичні алгоритми не використовуються для оптимізації нейронних мереж?
З мого розуміння, генетичні алгоритми є потужним інструментом оптимізації багато об'єктів. Крім того, навчання нейронних мереж (особливо глибоких) є важким та має багато питань (невипуклі функції витрат - локальні мінімуми, зниклі та вибухові градієнти тощо). Крім того, я вважаю, що концептуальна підготовка NN з GA є можливою. Мені було цікаво, …


2
Чому б не завжди використовувати техніку оптимізації ADAM?
Здається, оптимізатор адаптивного оцінювання моменту (Адама) майже завжди працює краще (швидше і надійніше досягаючи глобального мінімуму), коли мінімізує функцію витрат на навчання нейронних мереж. Чому б не завжди використовувати Адама? Навіщо навіть турбуватися використанням RMSProp або оптимізаторів імпульсу?

1
XGBRegressor проти xgboost.train величезна різниця швидкостей?
Якщо я треную свою модель, використовуючи наступний код: import xgboost as xg params = {'max_depth':3, 'min_child_weight':10, 'learning_rate':0.3, 'subsample':0.5, 'colsample_bytree':0.6, 'obj':'reg:linear', 'n_estimators':1000, 'eta':0.3} features = df[feature_columns] target = df[target_columns] dmatrix = xg.DMatrix(features.values, target.values, feature_names=features.columns.values) clf = xg.train(params, dmatrix) він закінчується приблизно за 1 хвилину. Якщо я треную свою модель, використовуючи метод …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.