Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

3
Неврівноважені класи - Як мінімізувати помилкові негативи?
У мене є набір даних, який має атрибут бінарного класу. Є 623 випадки з класом +1 (рак позитивний) та 101 671 екземпляр з класом -1 (рак негативний). Я випробував різні алгоритми (Naive Bayes, Random Forest, AODE, C4.5), і всі вони мають неприйнятні помилкові відхилення. Випадковий ліс має найвищу загальну точність …

4
Як word2vec можна використовувати для ідентифікації невидимих ​​слів та відношення їх до вже підготовлених даних
Я працював над моделлю gensim word2vec і вважав це дійсно цікавим. Мене цікавить пошук того, як невідоме / небачене слово при перевірці з моделлю зможе отримати подібні терміни з навченої моделі. Чи можливо це? Чи можна налаштувати word2vec для цього? Або навчальний корпус повинен мати всі слова, з якими я …

3
Проблема з IPython / Jupyter на Spark (Нерозпізнаний псевдонім)
Я працюю над створенням набору VM для експерименту зі Spark, перш ніж витрачати гроші та витрачати гроші на створення кластеру з деяким обладнанням. Коротка примітка: Я є вченим з досвідом прикладного машинного навчання і трохи пішов з науки про дані. Я використовую інструменти для обчислень, рідко мені знадобиться їх налаштувати. …

4
Як уникнути перевитрати у випадкових лісах?
Я хочу уникнути перевитрати у випадкових лісах. У зв'язку з цим я маю намір використовувати mtry, nodesize та maxnodes тощо. Чи можете ви мені допомогти вибрати значення для цих параметрів? Я використовую Р. Також, якщо можливо, скажіть, будь ласка, як я можу використовувати перехресну перевірку k-кратного для випадкового лісу (в …

7
Веб-скреблінг LinkedIn
Нещодавно я відкрив новий пакет R для підключення до API LinkedIn. На жаль, API LinkedIn, здається, для початку досить обмежений; наприклад, ви можете отримати лише основні дані про компанії, і це відмежовано від даних про фізичних осіб. Я хотів би отримати дані про всіх співробітників даної компанії, що ви можете …

3
Машини факторної розробки на місцях
Чи може хто-небудь пояснити, як польові машини факторизації (FFM) порівнюють зі стандартними машинами для факторизації (FM)? Стандарт: http://www.ismll.uni-hildesheim.de/pub/pdfs/Rendle2010FM.pdf "Польові програми": http://www.csie.ntu.edu.tw/~r01922136/kaggle-2014-criteo.pdf

5
Як об’єднати дані щомісяця, дня та тижня?
Google Trends повертає щотижневі дані, тому мені доведеться знайти спосіб їх об'єднання зі своїми щоденними / щомісячними даними. Що я зробив досі, це перебити кожну серію на щоденні дані, наприклад: від: 2013-03-03 - 2013-03-09 37 до: 2013-03-03 37 2013-03-04 37 2013-03-05 37 2013-03-06 37 2013-03-07 37 2013-03-08 37 2013-03-09 37 …

1
Рішення для постійної ідентифікації кластеру в Інтернеті?
Дозвольте показати вам приклад гіпотетичної онлайн-програми кластеризації: У момент часу n точок 1,2,3,4 виділяються синьому кластеру A, а точки b, 5,6,7 виділяються червоному кластеру B. Під час n + 1 вводиться нова точка a, яка присвоюється синьому кластеру A, але також призводить до того, що точка b також буде приписана …

1
Координатний спуск Fisher Scoring v / s для MLE в R
Основна функція R glm()використовує Fisher Scoring для MLE, тоді як, glmnetсхоже, використовується метод спуску координат для вирішення того ж рівняння. Координатний спуск є більш ефективним за часом, ніж Fisher Scoring, оскільки Fisher Scoring обчислює похідну матрицю другого порядку, окрім деяких інших операцій з матрицею. що робить дорогим виконання, тоді як …

3
Побудуйте двійковий класифікатор із лише позитивними та немеченими даними
У мене є 2 набори даних, один із позитивними примірниками того, що я хотів би виявити, і один з неозначеними екземплярами. Які методи я можу використовувати? Наприклад, припустимо, що ми хочемо зрозуміти, як виявити спам-електронну пошту на основі кількох структурованих характеристик електронної пошти. У нас є один набір даних 10000 …

4
Техніка вилучення функцій - узагальнення послідовності даних
Я часто будую модель (класифікацію чи регресію), де у мене є деякі змінні прогнози, що є послідовностями, і я намагаюся знайти рекомендації щодо техніки для їх узагальнення найкращим чином для включення в якості предикторів до моделі. Як конкретний приклад, скажімо, будується модель, яка передбачає, чи клієнт покине компанію протягом наступних …

4
Чи є GLM статистичною чи машинною моделлю навчання?
Я думав, що узагальнену лінійну модель (GLM) вважатимуть статистичною моделлю, але друг сказав мені, що деякі статті класифікують це як техніку машинного навчання. Який із них правдивий (чи точніше)? Будь-яке пояснення буде вдячним.

4
Алгоритм генерації правил класифікації
Таким чином, у нас є потенціал для програми машинного навчання, яка досить чітко вписується в традиційну проблемну область, яку вирішують класифікатори, тобто у нас є набір атрибутів, що описують предмет та "відро", до якого вони в кінцевому підсумку. Однак, а не створювати моделі імовірностей, як у Naive Bayes або подібних …

3
Чи можна пізніше перенести алгоритми зменшення карт, написані для MongoDB, до Hadoop?
У нашій компанії у нас є база даних MongoDB, що містить безліч неструктурованих даних, на якій нам потрібно запустити алгоритми зменшення карт для створення звітів та інших аналізів. У нас є два підходи для вибору необхідних аналізів: Один із підходів - витягнути дані з MongoDB до кластеру Hadoop та зробити …

2
Нейронна мережа для моніторингу сервера
Я дивлюся на pybrain для отримання тривог монітора сервера та визначення першопричини проблеми. Я задоволений навчанням цього методу під контрольованим навчанням та курінгом наборів даних про навчання. Дані структуровані приблизно так: Тип сервера A №1 Сигналізація типу 1 Сигналізація типу 2 Тип сервера A №2 Сигналізація типу 1 Сигналізація типу …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.