Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

1
Скільки клітин LSTM я повинен використовувати?
Чи є якісь правила (чи фактичні правила), що стосуються мінімальної, максимальної та "розумної" кількості комірок LSTM, які я повинен використовувати? Зокрема, я стосуюсь BasicLSTMCell від TensorFlow та num_unitsвласності. Будь ласка, припустіть, що у мене проблема класифікації, визначена: t - number of time steps n - length of input vector in …
12 rnn  machine-learning  r  predictive-modeling  random-forest  python  language-model  sentiment-analysis  encoding  machine-learning  deep-learning  neural-network  dataset  caffe  classification  xgboost  multiclass-classification  unbalanced-classes  time-series  descriptive-statistics  python  r  clustering  machine-learning  python  deep-learning  tensorflow  machine-learning  python  predictive-modeling  probability  scikit-learn  svm  machine-learning  python  classification  gradient-descent  regression  research  python  neural-network  deep-learning  convnet  keras  python  tensorflow  machine-learning  deep-learning  tensorflow  python  r  bigdata  visualization  rstudio  pandas  pyspark  dataset  time-series  multilabel-classification  machine-learning  neural-network  ensemble-modeling  kaggle  machine-learning  linear-regression  cnn  convnet  machine-learning  tensorflow  association-rules  machine-learning  predictive-modeling  training  model-selection  neural-network  keras  deep-learning  deep-learning  convnet  image-classification  predictive-modeling  prediction  machine-learning  python  classification  predictive-modeling  scikit-learn  machine-learning  python  random-forest  sampling  training  recommender-system  books  python  neural-network  nlp  deep-learning  tensorflow  python  matlab  information-retrieval  search  search-engine  deep-learning  convnet  keras  machine-learning  python  cross-validation  sampling  machine-learning 

2
Як обчислити розмір VC?
Я вивчаю машинне навчання, і я хотів би знати, як обчислити розмір VC. Наприклад: h ( x ) = { 10якщо a≤x≤bще h(x)={1if a≤x≤b0else h(x)=\begin{cases} 1 &\mbox{if } a\leq x \leq b \\ 0 & \mbox{else } \end{cases} , з параметрами( a , b ) ∈ R2(a,b)∈R2(a,b) ∈ R^2 . …

2
Як з'єднати два кадри даних у Python Pandas?
У мене є два кадри даних df1 і df2, і я хотів би об'єднати їх в один кадр даних. Це так, ніби df1 і df2 були створені, розділивши один кадр даних по центру вертикально, як розривання аркуша паперу, який містить список навпіл, так що половина стовпців йде на одному папері, …
12 pandas 

2
Чи все ще FPGrowth вважається "найсучаснішим" при частому видобутку шаблонів?
Наскільки я знаю, що розробляються алгоритми для вирішення проблеми частого видобутку шаблонів (FPM), шлях удосконалення має деякі основні контрольні точки. По-перше, алгоритм Апріорі був запропонований в 1993 році Agrawal et al. разом із формалізацією проблеми. Алгоритм зміг зняти деякі набори з 2^n - 1наборів (powerset), використовуючи решітку для підтримки даних. …

2
Ефективне зменшення розмірності для великих наборів даних
У мене є набір даних з ~ 1M рядками та ~ 500K розрідженими функціями. Я хочу зменшити розмірність десь в порядку щільних особливостей 1К-5К. sklearn.decomposition.PCAне працює над обмеженими даними, і я намагався використовувати, sklearn.decomposition.TruncatedSVDале досить швидко отримав помилку пам'яті. Які мої варіанти ефективного зменшення розмірності в цьому масштабі?

1
Параметр scikit-learn n_jobs про використання процесора та пам'яті
У більшості оцінювачів на scikit-learn є n_jobsпараметр в fit/ predictметодах для створення паралельних завдань з використанням joblib. Я помітив, що налаштування його -1створює лише 1 Python-процес і збільшує кількість ядер, в результаті чого використання процесора досягає 2500% вгорі. Це сильно відрізняється від встановлення його на якесь додатне ціле число> 1, …

2
Як я можу відповідати категоричним типам даних для випадкової класифікації лісів?
Мені потрібно знайти точність набору даних, застосовуючи алгоритм Random Forest. Але мій тип мого набору даних є і категоричним, і числовим. Коли я намагався вкласти ці дані, я отримую помилку. 'Вхід містить NaN, нескінченність або занадто велике значення для dtype (' float32 ')'. Можливо, проблема полягає в об'єктних типах даних. …

3
Замініть всі числові значення у фреймі даних pyspark на постійне значення
Розглянемо фрейм даних Pyspark, що складається з 'null' елементів та числових елементів. Взагалі числові елементи мають різні значення. Як можна замінити всі числові значення фрейму даних на постійне числове значення (наприклад, значення 1)? Спасибі заздалегідь! Приклад для фрейму даних pyspark: 123c10.04−1nullc21null1.2c31.35−1.2nullc1c2c310.0411.352−1null−1.23null1.2null \begin{array}{c|lcr} & \text{c1} & \text{c2} & \text{c3} \\ \hline …

2
Що таке гаряче кодування в tensorflow?
Зараз я проходжу курс з tensorflow, в якому вони використовували tf.one_hot (індекси, глибина). Тепер я не розумію, як ці індекси змінюються на цю двійкову послідовність. Може хтось, будь ласка, пояснить мені точний процес ???

4
Як буде працювати принцип Оккама Бритва в машинному навчанні
Наступне питання, відображене на зображенні, було задано під час одного з іспитів. Я не впевнений, правильно я зрозумів принцип бритви Оккама чи ні. Відповідно до меж розподілу та прийняття рішень, наведених у запитанні та після бритви Оккама, відповідь межами B в обох випадках має бути відповіддю. Тому що відповідно до …

3
Чи є якісні нестандартні мовні моделі для python?
Я прототипую додаток, і мені потрібна мовна модель, щоб обчислити здивування в деяких створених пропозиціях. Чи є якась навчена мовна модель в python, яку я можу легко використовувати? Щось на кшталт простого model = LanguageModel('en') p1 = model.perplexity('This is a well constructed sentence') p2 = model.perplexity('Bunny lamp robert junior pancake') …
11 python  nlp  language-model  r  statistics  linear-regression  machine-learning  classification  random-forest  xgboost  python  sampling  data-mining  orange  predictive-modeling  recommender-system  statistics  dimensionality-reduction  pca  machine-learning  python  deep-learning  keras  reinforcement-learning  neural-network  image-classification  r  dplyr  deep-learning  keras  tensorflow  lstm  dropout  machine-learning  sampling  categorical-data  data-imputation  machine-learning  deep-learning  machine-learning-model  dropout  deep-network  pandas  data-cleaning  data-science-model  aggregation  python  neural-network  reinforcement-learning  policy-gradients  r  dataframe  dataset  statistics  prediction  forecasting  r  k-means  python  scikit-learn  labels  python  orange  cloud-computing  machine-learning  neural-network  deep-learning  rnn  recurrent-neural-net  logistic-regression  missing-data  deep-learning  autoencoder  apache-hadoop  time-series  data  preprocessing  classification  predictive-modeling  time-series  machine-learning  python  feature-selection  autoencoder  deep-learning  keras  tensorflow  lstm  word-embeddings  predictive-modeling  prediction  machine-learning-model  machine-learning  classification  binary  theory  machine-learning  neural-network  time-series  lstm  rnn  neural-network  deep-learning  keras  tensorflow  convnet  computer-vision 

1
Як передбачити майбутні значення часового горизонту за допомогою Кераса?
Я щойно створив цю нейронну мережу LSTM разом з Керасом import numpy as np import pandas as pd from sklearn import preprocessing from keras.layers.core import Dense, Dropout, Activation from keras.activations import linear from keras.layers.recurrent import LSTM from keras.models import Sequential from matplotlib import pyplot #read and prepare data from datafile …

1
Використовуючи попередньо підготовлений класифікатор CNN та застосуйте його до іншого набору даних зображення
Як би ви оптимізувати з заздалегідь навчених neural network застосовувати його в окрему проблему? Ви б просто додали більше шарів до попередньо підготовленої моделі та протестували її на своєму наборі даних? Наприклад, якщо завданням було використання CNN для класифікації шпалерних груп , я впевнений, що це не буде працювати безпосередньо …

2
Чи 100-відсоткова точність моделі на даних, що не мають вибірки, є надмірною?
Я щойно закінчив машинне навчання курсу R на когнітивному класі.ai і почав експериментувати з випадковими лісами. Я зробив модель, використовуючи бібліотеку "randomForest" у Р. Модель класифікується на два класи, добрий та поганий. Я знаю, що коли модель є надмірною, вона добре працює на даних із власного набору тренувань, але погано …

3
Нейронні мережі - Знайдіть більшість подібних зображень
Я працюю з Python, scikit-learn та керами. У мене є 3000 тисяч зображень наручних годинників, таких як: Watch_1 , Watch_2 , Watch_3 . Я хочу написати програму, яка отримує на вхід фото реального годинника, який може бути зроблений за менш ідеальних умов, ніж фотографії вище (різний колір тла, темніша блискавка …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.