Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

7
Бібліотека Python, яка може обчислити матрицю плутанини для класифікації на багато міток
Я шукаю бібліотеку Python, яка може обчислити матрицю плутанини для класифікації на багато міток . FYI: scikit-learn не підтримує мульти-мітку для матриці плутанини) Яка різниця між багатокласовою задачею та багаторівневою задачею

2
Як моделювати поведінку покупців користувачів на Amazon?
Для нашого підсумкового курсового проекту з наукових даних ми запропонували наступне: Надайте набір даних обзорів Amazon , ми плануємо розробити алгоритм (орієнтований приблизно на персоналізований PageRank), який визначає стратегічну позицію для розміщення реклами на Amazon. Наприклад, на Amazon є мільйони продуктів. І набір даних дає вам уявлення про те, з …

3
Навчальний посібник з аналізу почуттів
Я намагаюся зрозуміти аналіз настроїв і як застосувати його за допомогою будь-якої мови (R, Python тощо). Я хотів би знати, чи є в Інтернеті гарне місце для підручника, який я можу прослідкувати. Я гуглив, але я був не дуже задоволений, оскільки вони були не навчальними посібниками, а більше теорією. Я …

2
Класифікація векторних послідовностей
Мій набір даних складається з векторних послідовностей. Кожен вектор має 50 дійсних значень. Кількість векторів у послідовності становить від 3-5 до 10-15. Іншими словами, довжина послідовності не фіксована. Деяка значна кількість послідовностей (а не векторів!) Зазначається міткою класу. Моє завдання - вивчити класифікатор, який задає послідовність векторів, обчислює мітку класу …


1
Вибір функцій для підтримуючих векторних машин
Моє питання триразове У контексті "Kernelized" підтримують векторні машини Чи бажаний вибір змінних / особливостей - тим більше, що ми регулюємо параметр C для запобігання перенастроювання, а головним мотивом введення ядер до SVM є збільшення розмірності проблеми, у такому випадку зменшення розмірів за допомогою зменшення параметрів здається протиінтуїтивним Якщо відповідь …



2
Реалізація комплементарних наївних баїв у пітоні?
Проблема Я намагався використовувати Naive Bayes на міченому наборі даних про злочини, але отримав дійсно погані результати (7% точність). Naive Bayes працює набагато швидше, ніж інші алогоритми, якими я користувався, тому хотів спробувати з'ясувати, чому оцінка була такою низькою. Дослідження Після прочитання я виявив, що Naive Bayes слід використовувати з …

2
Чи існує метод, протилежний зменшенню розмірності?
Я новачок у галузі машинного навчання, але зробив свою частку обробки сигналів. Будь ласка, повідомте мене, якщо це питання було неправильно позначено. У мене є двовимірні дані, які визначаються щонайменше трьома змінними, із дуже нелінійним способом, занадто складним для моделювання. Я мав різний рівень успіху в витягуванні двох основних компонентів …

1
Використання Vowpal Wabbit для NER
Vowpal Wabbit (VW), мабуть, підтримує функцію тегування послідовності через SEARN . Проблема полягає в тому, що я не можу ніде знайти докладний список параметрів з поясненнями та з деякими прикладами. Найкраще, що я міг знайти, це запис у блозі Зінкова з дуже коротким прикладом. Головна сторінка Вікі майже НЕ згадує …

1
Чи існують якісь непідтримувані алгоритми навчання для послідовних даних за часом?
Кожне спостереження за моїми даними збиралося з різницею в 0,1 секунди. Я не називаю це часовим рядом, тому що в ньому немає позначки дати та часу. У прикладах алгоритмів кластеризації (я знайшов в Інтернеті) та PCA, вибіркові дані мають 1 спостереження на випадок і не присвоєні часу. Але мої дані …

3
R випадковий ліс на Amazon ec2 Помилка: не можна виділити вектор розміром 5,4 Gb
Я randomForest()треную випадкові лісові моделі в R, використовуючи 1000 дерев і кадри даних з приблизно 20 прогнокторами і 600K рядками. На моєму ноутбуці все працює добре, але коли я переходжу на Amazon ec2, щоб запустити те саме, я отримую помилку: Error: cannot allocate vector of size 5.4 Gb Execution halted …

2
Кластеризація документів із використанням тем, похідних від розподілу прихованого Діріхле
Я хочу використовувати Latent Dirichlet Allocation для проекту, і я використовую Python з бібліотекою gensim. Знайшовши теми, я хотів би згрупувати документи за допомогою такого алгоритму, як k-засоби (в ідеалі я хотів би використовувати хороший для перекриття кластерів, тому будь-яка рекомендація вітається). Мені вдалося отримати теми, але вони є у …

7
Перехід до кар'єри на Big Data Analytics
Я 35-річний ІТ-професіонал, який суто технічний. Я добре програмую, вивчаю нові технології, розумію їх та впроваджую. Я не любив математику в школі, тому в математиці не набрав успіху. Мені дуже цікаво продовжувати кар'єру в галузі аналітики Big Data. Мене більше цікавлять аналітика, а не технології великих даних (Hadoop тощо), хоча …
9 career 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.