Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

3
Коли нам слід вважати набір даних незбалансованим?
Я стикаюся з ситуацією, коли кількість позитивних та негативних прикладів у наборі даних є незбалансованим. Моє запитання: чи існують якісь принципові правила, які підказують нам, коли нам слід підпробовувати велику категорію, щоб змусити якесь врівноваження в наборі даних. Приклади: Якщо кількість позитивних прикладів становить 1000, а кількість негативних прикладів - …

3
Чи Word2Vec і Doc2Vec є представленнями розподілу або розподіленим представленням?
Я читав, що розподільне представлення базується на розподільній гіпотезі, що слова, що виникають у подібному контексті, мають схоже значення. Word2Vec і Doc2Vec моделюються відповідно до цієї гіпотези. Але в оригінальному документі навіть вони названі як Distributed representation of words and phrasesі Distributed representation of sentences and documents. Отже, чи базуються …

1
Переформатування даних для глибокого навчання за допомогою Keras
Я початківець з Керасом, і я почав із прикладу MNIST, щоб зрозуміти, як насправді працює бібліотека. Фрагмент коду проблеми MNIST у папці приклад Keras задається як: import numpy as np np.random.seed(1337) # for reproducibility from keras.datasets import mnist from keras.models import Sequential from keras.layers import Dense, Dropout, Activation, Flatten from …

2
Інструменти для автоматичного виявлення аномалії в таблиці SQL?
У мене є велика таблиця SQL, яка по суті є журналом. Дані є досить складними, і я намагаюся знайти спосіб виявити аномалії, не розуміючи всіх даних. Я знайшов безліч інструментів для виявлення аномалії, але для більшості з них потрібен "середній чоловік", тобто Elastic Search, Splunk тощо. Хтось знає про інструмент, …

2
Структура проекту машинного навчання Python / Data Science
Я шукаю інформацію про те, як слід організувати проект машинного навчання Python. Для звичайних проектів Python є Cookiecutter та R ProjectTemplate . Це моя поточна структура папок, але я змішую Jupyter Notebooks з фактичним кодом Python, і це здається не дуже зрозумілим. . ├── cache ├── data ├── my_module ├── …
10 python 

2
ggvis vs. ggplot2 + блискучий; який вибрати для інтерактивної візуалізації?
Тут є подібне запитання в CrossValided, і я прочитав відповіді. Моє запитання дещо інше. Я не хочу просто візуалізувати свої дані, і дійсно те, що я хочу візуалізувати, непросто візуалізувати за допомогою будь-якого пакету. У мене на графіку є два набори точок ( координати). Я хочу додати краї та зробити …

3
Чи не має значення напрямок ребер у мережі Байєса?
Сьогодні на лекції було заявлено, що напрямок ребер в мережі Байєса насправді не має значення. Вони не повинні представляти причинності. Очевидно, що ви не можете переключити жоден край в мережі Bayes. Наприклад, нехай з і . Якщо ви переключитесь на , більше не буде ациклічним і, отже, не мережею Байєса. …

2
Тестування програмного забезпечення для наукових даних в R
Я часто використовую Nose, Tox або Unittest під час тестування коду python, особливо коли він повинен бути інтегрований з іншими модулями або іншими фрагментами коду. Однак тепер, коли я виявив, що використовую R більше, ніж пітон для моделювання та розвитку ML. Я зрозумів, що не дуже перевіряю свій R-код (І …

1
Конвергенція методу k-означає Hartigan-Wong та інших алгоритмів
Я намагаюся зрозуміти різні алгоритми кластеризації k-засобів, які в основному реалізовані в мовному statsпакеті R. Я розумію алгоритм Ллойда та онлайн-алгоритм MacQueen. Я розумію їх так: Алгоритм Ллойда: Спочатку вибираються випадкові спостереження 'k', які будуть служити центроїдами кластерів 'k'. Потім наступні кроки відбуваються в ітерації до сходження центроїдів. Розраховується евклідова …
10 r  clustering  k-means 

1
Аналіз журналу сервера за допомогою машинного навчання
Мені було призначено проаналізувати серверні журнали нашого додатку, що містять журнали виключень, журнали подій журналів баз даних і т. Д. Я новачок у машинному навчанні, ми використовуємо Spark з еластичним пошуком та Sparks MLlib (або PredictionIO). На прикладі потрібного Результатом було б можливість передбачити на основі зібраних журналів винятків, щоб …

1
Текстова класифікація-проблема: Word2Vec / NN найкращий підхід?
Я хочу створити систему, яка дасть абзац тексту, зможе його класифікувати та визначити контекст: Навчається з генерованих користувачем абзаців тексту (наприклад, коментарі / запитання / відповіді) Кожен предмет навчального набору буде позначений тегом. Так, наприклад ("категорія 1", "текст абзац") Будуть сотні категорій Який найкращий підхід для побудови такої системи? Я …

1
Трансформація автоматичних кодерів
Я щойно прочитав статтю Джеффа Гінтона про перетворення автоінкодерів Хінтон, Крижевський та Ван: Трансформація автокодерів . У галузі штучних нейронних мереж та машинного навчання, 2011. і дуже хотілося б пограти з чимось подібним. Але прочитавши його, я не зміг отримати достатньо деталей із статті про те, як я міг би …

2
Як AI навчитися діяти, коли проблемний простір занадто великий
Я найкраще навчаюся через експерименти та приклад. Я дізнаюся про нейронні мережі і маю (те, що мені здається) - досить добре розуміє класифікацію та регресію, а також кероване та непідконтрольне навчання, але я натрапив на щось, про що я не можу зауважити; Якби я хотів навчити ШІ грати в складну …

2
Кооперативне зміцнення навчання
У мене вже є реалізація для одного агента, який працює над проблемою динамічного ціноутворення з метою максимізації доходу. Однак проблема, з якою я працюю, полягає в декількох різних продуктах, які є заміною один одному, тому динамічне ціноутворення на них усіх з незалежними учнями здається некоректним, оскільки ціна одного впливає на …

5
LSTM або інший пакет RNN для R
Я побачив вражаючий результат від моделей LSTM, що створюють тексти, подібні Шекспіру. Мені було цікаво, чи існує пакет LSTM для R. Я за ним гуглив, але знаходив лише пакети для Python та Julia. (можливо, є якась проблема продуктивності, яка пояснює, чому ці програми є більш переважними перед R). Чи знаєте …
10 r  neural-network  rnn 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.