Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

2
чому нам потрібно обробляти дисбаланс даних?
Мені потрібно знати, чому нам потрібно мати справу з дисбалансом даних. Я знаю, як впоратися з цим і різними методами вирішити проблему, яка полягає у вибіранні або зменшенні вибірки або за допомогою Smote. Наприклад, якщо у мене рідкісне захворювання - 1 відсоток із 100, і скажемо, що я вирішив створити …

4
Виявлення аномалій з нейронною мережею
У мене є великий багатомірний набір даних, який генерується щодня. Який би був хороший підхід для виявлення будь-якої «аномалії» порівняно з попередніми днями? Це підходяща проблема, яку можна було б вирішити через нейронні мережі? Будь-які пропозиції вдячні. додаткова інформація: прикладів не існує, тому метод повинен виявити самі аномалії

4
Альтернативи TF-IDF та косинусної подібності при порівнянні документів різного формату
Я працював над невеликим особистим проектом, який займає робочі навички користувача та пропонує найбільш ідеальну кар’єру для них, виходячи з цих навичок. Для цього я використовую базу списків завдань. На даний момент код працює наступним чином: 1) Обробіть текст кожного списку завдань, щоб витягнути навички, які згадуються в лістингу 2) …

2
Чи може виникнути перевиконання навіть тоді, коли втрати перевірки все ще знижуються?
У мене в Керасі згорнута модель LSTM, подібна до цієї (посилання 1), яку я використовую для змагань Kaggle. Архітектура показана нижче. Я підготував це на своєму міченому наборі з 11000 зразків (два класи, початкова поширеність становить ~ 9: 1, тому я збільшив вибірку від 1 до приблизно 1/1) протягом 50 …

1
Контрольоване навчання порівняно з навчанням на підсилення для простого автомобіля, що керує собою
Я будую дистанційно керований автомобіль для самостійного водіння для задоволення. Я використовую Raspberry Pi як бортовий комп'ютер; і я використовую різні плагіни, наприклад, камеру Raspberry Pi та датчики відстані, для зворотного зв’язку щодо оточення автомобіля. Я використовую OpenCV для перетворення відеокадрів у тензори, а я використовую TensorFlow від Google, щоб …

3
Як використовувати RBM для класифікації?
На даний момент я граю з обмеженими машинами Boltzmann, і, оскільки я перебуваю на ній, я хотів би спробувати класифікувати рукописні цифри. Модель, яку я створив, тепер є досить фантастичною генеративною моделлю, але я не знаю, як іти далі. У цій статті автор зазначає, що, створивши хорошу генеративну модель, « …

2
На скільки розмірів слід зменшити, роблячи PCA?
Як вибрати K для PCA? K - кількість розмірів, на які слід проектувати. Єдина вимога - не втрачати занадто багато інформації. Я розумію, це залежить від даних, але я шукаю більше простий загальний огляд того, які характеристики слід враховувати при виборі K.
12 pca 

1
MinHashing vs SimHashing
Припустимо, у мене є п'ять наборів, які я хотів би згрупувати. Я розумію, що описана тут техніка SimHashing: https://moultano.wordpress.com/2010/01/21/simple-simhashing-3kbzhsxyg4467-6/ може дати три кластери ( {A}, {B,C,D}і {E}), наприклад, якщо його результати були: A -> h01 B -> h02 C -> h02 D -> h02 E -> h03 Аналогічно, техніка MinHashing, …

1
Класифікуйте клієнтів на основі 2 особливостей та часової серії подій
Мені потрібна допомога щодо того, яким повинен бути наступний крок у алгоритмі, який я розробляю. Через NDAs я не можу розкрити багато, але я постараюся бути загальним і зрозумілим. В основному, після кількох кроків в алгоритмах, я маю це: Для кожного клієнта, який я маю, і події, які він проводить …

5
Найкраща бібліотека Джулії для нейронних мереж
Я використовую цю бібліотеку для основної побудови та аналізу нейронної мережі. Однак він не має підтримки для побудови багатошарових нейронних мереж тощо. Отже, я хотів би знати про будь-які приємні бібліотеки для роботи з розвиненими нейронними мережами та Deep Learning у Джулії.

7
Що таке "стара назва" вченого?
У наші дні все частіше вживаються такі терміни, як "наука про дані" та "вчений щодо даних". Багато компаній наймають «науковця даних». Але я не думаю, що це абсолютно нова робота. Дані існували з минулого, і комусь довелося мати справу з даними. Я здогадуюсь, що термін «науковець даних» стає більш популярним, …
12 bigdata 

2
Вартість авіаперевезень - Який аналіз слід використовувати для виявлення конкурентної поведінки та цінових співвідношень?
Я хочу дослідити поведінку авіакомпаній щодо встановлення цін - зокрема, як авіакомпанії реагують на ціни конкурентів. Як я б сказав, мої знання про більш складний аналіз досить обмежені, я робив здебільшого всі основні методи, щоб зібрати загальний вигляд даних. Сюди входять прості графіки, які вже допомагають виявити подібні зразки. Я …

1
Хитрість хитрості - що насправді відбувається
Коли алгоритми ML, наприклад, Vowpal Wabbit або хтось із механізмів факторизації, що виграють змагання за швидкість натискання ( Kaggle ), згадують, що функції "хешировані", що це насправді означає для моделі? Скажімо, існує змінна, яка представляє ідентифікатор інтернет-добудови, яка приймає такі значення, як "236BG231". Тоді я розумію, що ця функція хеширована …

2
Дані про почуття Emoji
Для експерименту ми хотіли б використовувати Emoji, вбудований у багато твітів, як основну інформацію правди / навчання для простого кількісного аналізу почуттів. Твіти зазвичай занадто неструктуровані, щоб NLP працював добре. У будь-якому випадку в Unicode 6.0 є 722 Emoji, і, ймовірно, ще 250 буде додано в Unicode 7.0. Чи є …

3
Неструктурована класифікація тексту
Я буду класифікувати неструктуровані текстові документи, а саме веб-сайти невідомої структури. Кількість класів, до яких я класифікую, обмежена (на даний момент я вважаю, що існує не більше трьох). Хтось пропонує, як мені почати? Чи підхід "мішок слів" тут здійсненний? Пізніше я можу додати ще один етап класифікації на основі структури …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.