Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

3
Яка різниця між RNN на основі слів на основі слів і на основі знаків?
Читаючи про генерування тексту за допомогою періодичних нейронних мереж, я помітив, що деякі приклади були реалізовані для генерації тексту слово за словом, а інші - за символом, не фактично вказуючи чому. Отже, в чому різниця між моделями РНН, котрі пророкують текст кожного слова основи і ті , які пророкують текст …

4
R: машинне навчання на GPU
Чи є пакети машинного навчання для R, які можуть використовувати GPU для підвищення швидкості навчання (щось на зразок Theano із світу python)? Я бачу, що існує пакет під назвою gputools, який дозволяє виконувати код на gpu, але я шукаю більш повну бібліотеку для машинного навчання.

3
Інтуїція за обмеженою машиною Больцмана (МБР)
Я пройшов курс Нейронних мереж Джеффа Гінтона на Coursera, а також через ознайомлення з машинами з обмеженим набором болтцмана , все ще не зрозумів інтуїції, що стоїть за RBM. Навіщо нам потрібно обчислювати енергію в цій машині? І в чому полягає ймовірність використання в цій машині? Я також побачив це …

5
Бібліотека Python для реалізації прихованих моделей Маркова
Яку стабільну бібліотеку Python можна використовувати для реалізації прихованих моделей Маркова? Мені потрібно, щоб це було досить добре зафіксовано, тому що я ніколи не використовував цю модель раніше. Як варіант, чи існує більш прямий підхід до аналізу часових рядів набору даних за допомогою HMM?

4
Інструменти для вивчення даних за допомогою Scala
Я знаю, що Іскра повністю інтегрована зі Scala. Випадок використання спеціально для великих наборів даних. Які ще інструменти мають хорошу підтримку Scala? Чи Scala найкраще підходить для великих наборів даних? Або він також підходить для менших наборів даних?

4
Як вказати важливі атрибути?
Припустимо набір слабко структурованих даних (наприклад, веб-таблиці / пов'язані відкриті дані), що складається з багатьох джерел даних. Немає загальної схеми, за якою слідують дані, і кожне джерело може використовувати атрибути синоніму для опису значень (наприклад, "національність" проти "bornIn"). Моя мета - знайти деякі "важливі" атрибути, які якимось чином "визначають" сутності, …

2
Яка різниця між Hadoop і noSQL
Я чув про багато інструментів / рамок, які допомагають людям обробляти свої дані (середовище великих даних). Один називається Hadoop, а інший - noSQL. Чим відрізняється точка обробки? Вони доповнюють один одного?

2
Розсувне вікно призводить до надмірного розміщення в LSTM?
Чи зможу я перевищити свій LSTM, якщо навчатиму його за допомогою розсувного вікна? Чому люди, схоже, не використовують його для LSTM? Для спрощеного прикладу припустимо, що ми повинні передбачити послідовність символів: A B C D E F G H I J K L M N O P Q R S …

3
Чому ми перетворюємо перекошені дані в звичайний розподіл
Я переглядав рішення конкурсу цін на житло на Kaggle (Ядерний аналог людини на ціни на житло : Техніка попередньої регресії ) і натрапив на цю частину: # Transform the skewed numeric features by taking log(feature + 1). # This will make the features more normal. from scipy.stats import skew skewed …

4
Схожість між двома словами
Я шукаю бібліотеку Python, яка допомагає мені виявити подібність між двома словами чи реченнями. Я буду робити перетворення аудіо в текст, що призведе до словника англійської мови або слова без словника (Це може бути назва особи або компанії) Після цього мені потрібно порівняти це з відомим словом або словами. Приклад: …
15 nlp  nltk 

5
Проекти з відкритим кодом для наукових даних, щоб зробити свій внесок
Внесок у проекти з відкритим кодом, як правило, є хорошим способом отримати практику для новачків та спробувати нову область для досвідчених науковців та аналітиків. У які проекти ви сприяєте? Укажіть, будь ласка, якесь вступне посилання на Github.

1
видалення рядків після певного символу в заданому тексті
У мене є такий набір даних, як наведений нижче. Я хочу видалити всі символи після символу ©. Як я можу це зробити в R? data_clean_phrase <- c("Copyright © The Society of Geomagnetism and Earth", "© 2013 Chinese National Committee ") data_clean_df <- as.data.frame(data_clean_phrase)
15 r  data-cleaning 

2
Чому функції активації повинні бути монотонними?
Зараз я готуюсь до іспиту з нейронних мереж. У кількох протоколах попередніх іспитів я читав, що функції активації нейронів (у багатошарових персептронах) повинні бути монотонними. Я розумію, що функції активації повинні бути диференційованими, мати похідну, яка не є 0 у більшості точок, і бути нелінійною. Я не розумію, чому бути …

2
Відмінність рекомендацій, що базуються на предметах та користувачах у Mahout
Мені хотілося б знати, чим саме рекомендації Mahout, що базуються на користувача та на основі предметів, відрізняються один від одного. Це визначає це На основі користувачів : рекомендуйте елементи, знайшовши подібних користувачів. Це часто важче масштабувати через динамічний характер користувачів. На основі предметів: обчисліть схожість між елементами та дайте рекомендації. …

2
K-засоби проти онлайн-K-засоби
K-засоби - це добре відомий алгоритм кластеризації, але існує також он-лайн варіант такого алгоритму (онлайн-K-засоби). Які плюси і мінуси цих підходів і коли слід віддавати перевагу кожному?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.