Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

5
Виявлення котів візуально за допомогою виявлення аномалії
У мене є проект хобі, котрий я збираюся зробити як спосіб підвищення мого поки що обмеженого досвіду машинного навчання. Я взяв і закінчив MOOC Coursera з цієї теми. Моє запитання щодо можливості здійснення проекту. Завдання полягає в наступному: Сусідські коти час від часу відвідують мій сад, що мені не подобається, …

2
Використовуйте ліблінеар на великих даних для семантичного аналізу
Я використовую Libsvm для підготовки даних та прогнозування класифікації на проблему семантичного аналізу . Але у нього є випуск ефективності для масштабних даних, оскільки семантичний аналіз стосується проблеми n-виміру . Минулого року вийшов Liblinear , і це може вирішити вузькі місця. Але це коштувало занадто багато пам'яті . Чи MapReduce …

5
Дані в наших реляційних СУБД стають великими, настав час перейти на NoSQL?
Ми створили додаток у соціальній мережі для цілей eLearning. Це експериментальний проект, який ми досліджуємо в нашій лабораторії. Він деякий час використовується в деяких випадках, і дані в наших реляційних СУБД (SQL Server 2008) набувають значних масштабів. Зараз це кілька гігабайт, і таблиці сильно пов’язані між собою. Продуктивність все ще …

1
Як працює параметр validation_split параметру функції Keras?
Розподіл валідації в функції Кераса Послідовна модель фіксується таким чином : https://keras.io/models/sequences/ : validation_split: плаваю між 0 і 1. Фракція навчальних даних, які використовуватимуться як дані перевірки. Модель буде виділяти цю частину навчальних даних, не буде тренуватись на ній, а також оцінюватиме втрати та будь-які показники моделі на цих даних …

4
Якісь "великі правила" щодо кількості функцій проти кількості примірників? (невеликі набори даних)
Мені цікаво, чи є евристика за кількістю ознак проти кількості спостережень. Очевидно, якщо низка особливостей дорівнює кількості спостережень, модель буде перевершувати. За допомогою розріджених методів (LASSO, еластична сітка) ми можемо усунути кілька функцій, щоб зменшити модель. Моє запитання (теоретично): перед тим, як використовувати метрики для оцінки вибору моделі, чи існують …

3
Як обчислити вплив міні-пакетної пам'яті при навчанні моделей глибокого навчання?
Я намагаюся обчислити об'єм пам'яті, необхідний GPU для підготовки моєї моделі на основі цієї замітки Андрія Карфати: http://cs231n.github.io/convolutional-networks/#computational-considerations Моя мережа має 532,752 активації та 19,072,984 параметрів (ваги та ухили). Це всі 32-бітні значення поплавків, тому кожен займає 4 байти в пам'яті. Моє вхідне зображення - 180х50х1 (ширина х висота х …

2
Рекомендовані фільми з додатковими функціями за допомогою спільної фільтрації
Я намагаюся побудувати систему рекомендацій за допомогою спільної фільтрації. У мене є звичайна [user, movie, rating]інформація. Я хотів би включити додаткову функцію, наприклад "мова" або "тривалість фільму". Я не впевнений, які методики я міг би використати для такої проблеми. Пропонуйте, будь ласка, посилання або пакети в python / R.

2
Як підвищити точність класифікаторів?
Я використовую OpenCV letter_recog.cpp приклад для експерименту над випадковими деревами та іншими класифікаторами. У цьому прикладі є реалізація шести класифікаторів - випадкових дерев, підсилюючих, MLP, kNN, наївних Bayes та SVM. Використовується набір даних розпізнавання листів UCI з 20000 екземплярами та 16 функціями, які я розділив навпіл для тренувань та тестування. …

5
Виберіть алгоритм двійкової класифікації
У мене проблема бінарної класифікації: Приблизно 1000 зразків у навчальному наборі 10 атрибутів, включаючи двійкові, числові та категоричні Який алгоритм є найкращим вибором для такого типу проблем? За замовчуванням я розпочну з SVM (попередній з номінальними значеннями атрибутів, перетвореними на бінарні функції), оскільки він вважається найкращим для відносно чистих і …

5
збільшують теплову карту для новонароджених
Я створюю corr()df з оригінального df. corr()ДФ вийшов 70 X 70 і неможливо уявити собі Heatmap ... sns.heatmap(df). Якщо я спробую відобразити corr = df.corr()таблицю, таблиця не відповідає екрану, і я бачу всі кореляції. Це спосіб або надрукувати весь, dfнезалежно від його розміру, або контролювати розмір теплової карти?
17 visualization  pandas  plotting  machine-learning  neural-network  svm  decision-trees  svm  efficiency  python  linear-regression  machine-learning  nlp  topic-model  lda  named-entity-recognition  naive-bayes-classifier  association-rules  fuzzy-logic  kaggle  deep-learning  tensorflow  inception  classification  feature-selection  feature-engineering  machine-learning  scikit-learn  tensorflow  keras  encoding  nlp  text-mining  nlp  rnn  python  neural-network  feature-extraction  machine-learning  predictive-modeling  python  r  linear-regression  clustering  r  ggplot2  neural-network  neural-network  training  python  neural-network  deep-learning  rnn  predictive-modeling  databases  sql  programming  distribution  dataset  cross-validation  neural-network  deep-learning  rnn  machine-learning  machine-learning  python  deep-learning  data-mining  tensorflow  visualization  tools  sql  embeddings  orange  feature-extraction  unsupervised-learning  gan  machine-learning  python  data-mining  pandas  machine-learning  data-mining  bigdata  apache-spark  apache-hadoop  deep-learning  python  convnet  keras  aggregation  clustering  k-means  r  random-forest  decision-trees  reference-request  visualization  data  pandas  plotting  neural-network  keras  rnn  theano  deep-learning  tensorflow  inception  predictive-modeling  deep-learning  regression  sentiment-analysis  nlp  encoding  deep-learning  python  scikit-learn  lda  convnet  keras  predictive-modeling  regression  overfitting  regression  svm  prediction  machine-learning  similarity  word2vec  information-retrieval  word-embeddings  neural-network  deep-learning  rnn 

1
Глибока нейромережа - зворотна пропорція з ReLU
У мене виникають певні труднощі з отриманням зворотного розповсюдження з ReLU, і я провів деяку роботу, але я не впевнений, чи я на правильному шляху. Функція витрат: 12(y−y^)212(y−y^)2\frac{1}{2}(y-\hat y)^2деyyyявляє собою реальне значення, і у являє собою передбачене значення. Припустимо також, щоx> 0 завжди.y^y^\hat yxxx 1 шар ReLU, де вага на …

4
Яка перевага розбиття файлу tfrecord на черепки?
Я працюю над розпізнаванням мовлення з Tensorflow і планую навчити LSTM NN з масивними наборами хвиль. Через підвищення продуктивності я планую використовувати tfrecords. В Інтернеті є кілька прикладів (Inception for ex.), Де файли tfrecords розбиті на фрагменти. Моє запитання: яка користь від створення файлів tfrecords в черепки? Чи є додаткове …

5
Об'єднання рідких та щільних даних у машинному навчанні для підвищення продуктивності
У мене є рідкісні функції, які є прогностичними, також у мене є деякі щільні риси, які також є прогностичними. Мені потрібно поєднати ці функції разом, щоб поліпшити загальну продуктивність класифікатора. Тепер, справа в тому, що я намагаюся поєднати їх разом, щільні риси, як правило, більше домінують над розрідженими характеристиками, отже, …

2
Чи слід застосовувати нормалізацію і для тестування даних?
Я роблю проект з проблеми ідентифікації автора. Я застосував нормалізацію tf-idf для підготовки даних, а потім навчив SVM для цих даних. Тепер при використанні класифікатора слід нормалізувати і тестові дані. Я вважаю, що основна мета нормалізації - зробити так, щоб навчальне альго надавало більшої ваги важливішим особливостям під час навчання. …

4
Зараз панди швидше, ніж data.table?
https://github.com/Rdatatable/data.table/wiki/Benchmarks-%3A-Grouping Базові показники data.table не оновлювалися з 2014 року. Я чув десь, що Pandasзараз швидше, ніж data.table. Це правда? Хтось робив якісь орієнтири? Я ніколи раніше не використовував Python, але розглядав би можливість перемикання, якщо pandasможна перемогти data.table?
17 python  r  pandas  data  data.table 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.