Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

2
Розв’язування системи рівнянь із розрідженими даними
Я намагаюся вирішити набір рівнянь, який має 40 незалежних змінних (x1, ..., x40) та одну залежну змінну (y). Загальна кількість рівнянь (кількість рядків) становить ~ 300, і я хочу вирішити для набору 40 коефіцієнтів, що мінімізує загальну помилку суми квадрата між y та передбачуваним значенням. Моя проблема полягає в тому, …

2
Випадання на яких шарах LSTM?
Використовуючи багатошаровий LSTMз випаданням, чи доцільно наносити випадання на всі приховані шари, а також вихідні щільні шари? У роботі Гінтона (яка запропонувала Dropout) він наклав Dropout лише на щільні шари, але це було тому, що приховані внутрішні шари були звивистими. Очевидно, я можу перевірити свою конкретну модель, але мені було …

1
Як використовувати розповсюдження міток Scikit-Learn для структурованих даних графіків?
У рамках мого дослідження мені цікаво розповсюдження міток на графіку. Мене особливо цікавлять ці два методи: Сяоїн Чжу та Зубін Гахрамані. Навчання з мічених та не маркованих даних із розповсюдженням міток. Технічний звіт CMU-CALD-02-107, Університет Карнегі Меллон, 2002 http://pages.cs.wisc.edu/~jerryzhu/pub/CMU-CALD-02-107.pdf Денджонг Чжоу, Олів'є Буске, Томас Навін Лал, Джейсон Вестон, Бернхард Шелкопфф. …

5
Непідконтрольна сегментація зображень
Я намагаюся реалізувати алгоритм, коли задано зображення з декількома об'єктами на площинній таблиці, бажаним є вихід масок сегментації для кожного об’єкта. На відміну від CNN, мета тут - виявити об'єкти в незнайомому середовищі. Які найкращі підходи до цієї проблеми? Також чи доступні приклади реалізації в Інтернеті? Редагувати: Вибачте, питання може …

1
Змусьте Керас працювати за допомогою багатоядерної багатоядерної процесорної системи
Я працюю над моделлю Seq2Seq, використовуючи LSTM від Keras (використовуючи фон Theano), і я хотів би паралелізувати процеси, тому що навіть на кілька МБ даних потрібно кілька годин для навчання. Зрозуміло, що GPU набагато кращі в паралелізації, ніж процесори. На даний момент у мене є лише процесори, з якими можна …

3
Яка різниця між хеширующим векторизатором і векторизатором tfidf
Я перетворюю корпус текстових документів у слова векторів для кожного документа. Я спробував це за допомогою TfidfVectorizer та HashingVectorizer Я розумію, що "a HashingVectorizer" не враховує IDFоцінок, як TfidfVectorizer"". Причина, по якій я все ще працюю з a, HashingVectorizer- це гнучкість, яку вона дає під час роботи з величезними наборами …

3
Нейрові мережі - кореляція втрат та точності
Мене трохи бентежить співіснування метрики втрат і точності в нейронних мережах. Обидва повинні надавати «точність» з порівняння yyy і у , чи не так? Тож чи не застосування двох зайвих у навчальних епохах? Більше того, чому вони не співвідносяться?y^y^\hat{y}

2
Питання про упередженість у конволюційних мережах
Я намагаюся розібратися, скільки ваг і ухилів потрібно для CNN. Скажіть, у мене є (3, 32, 32) -образ і хочу застосувати (32, 5, 5) -фільтр. Для кожної карти функцій я маю 5х5 ваг, тому у мене повинно бути 3 x (5x5) x 32 параметри. Тепер мені потрібно додати упередження. Я …

3
Чи є TensorFlow повна бібліотека машинного навчання?
Я новачок у TensorFlow, і мені потрібно зрозуміти можливості та недоліки TensorFlow, перш ніж я зможу ним скористатися. Я знаю, що це глибока рамка навчання, але крім того, які інші алгоритми машинного навчання ми можемо використовувати з тензором. Наприклад, чи можна використовувати SVM або випадкові ліси, використовуючи TensorFlow? (Я знаю, …

4
Який перший: алгоритм бенчмаркінгу, вибір функцій, налаштування параметрів?
Коли я намагаюся зробити, наприклад, класифікацію, на даний момент я підхожу спершу спробуйте різні алгоритми та порівняйте їх виконувати вибір функції за найкращим алгоритмом з 1 вище налаштування параметрів за допомогою вибраних функцій та алгоритму Однак я часто не можу переконати себе, що може бути кращий алгоритм, ніж обраний, якщо …


2
Як конвертувати категоричні дані в числові дані в Pyspark
Я використовую ноутбук Ipython для роботи з програмами pyspark. У мене є файл CSV з великою кількістю категоричних стовпців, щоб визначити, чи потрапляє дохід під діапазон 50k або більше. Я хотів би виконати алгоритм класифікації, беручи всі вхідні дані для визначення діапазону доходів. Мені потрібно побудувати словник змінних до відображених …

2
Наслідок масштабування функцій
Наразі я використовую SVM і масштабую свої функції тренувань до [0,1]. Я спочатку підходять / трансформують свій навчальний набір, а потім застосовують те саме перетворення до мого тестового набору. Наприклад: ### Configure transformation and apply to training set min_max_scaler = MinMaxScaler(feature_range=(0, 1)) X_train = min_max_scaler.fit_transform(X_train) ### Perform transformation on testing …

3
Яку регресію використовувати для обчислення результату виборів у багатопартійності?
Я хочу зробити прогноз на результат парламентських виборів. Мій результат буде%, який отримує кожна сторона. Є більше двох сторін, тому логістична регресія не є життєздатним варіантом. Я міг би зробити окремий регрес для кожної сторони, але в такому випадку результати будуть якимось чином незалежними один від одного. Це не забезпечило …

4
Використання кластеризації в обробці тексту
Привіт, це моє перше питання в стеці Data Science. Я хочу створити алгоритм класифікації тексту. Припустимо, у мене є великий набір тексту та статей. Скажімо, близько 5000 простих текстів. Спочатку використовую просту функцію для визначення частоти всіх чотирьох і вище символьних слів. Потім я використовую це як особливість кожного навчального …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.