Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

1
Як обробити нульовий коефіцієнт при розрахунку класифікатора Naive Bayes?
Якщо у мене є набір даних про навчання і я треную класифікатор Naive Bayes на ньому, і у мене є значення атрибута, яке має нульовий вірогідність. Як мені впоратися з цим, якщо пізніше я хочу передбачити класифікацію нових даних? Проблема полягає в тому, що якщо в розрахунку є нуль, весь …

1
Тепла карта на карті в Python
У режимі Analytics є приємна функція теплової карти ( https://community.modeanalytics.com/gallery/geographic-heat-map/ ). Але це не сприятливо для порівняння карт (лише одна на звіт). Те, що вони дозволяють, - це легко перетягувати дані в обгорнуту зошит пітона. І тоді будь-яке зображення в python можна легко додати до звіту. Отже, моє запитання: як …

5
Чи сучасні бібліотеки R та / або Python роблять SQL застарілим?
Я працюю в офісі, де SQL Server є основою всього, що ми робимо, від обробки даних до очищення до розміщення. Мій колега спеціалізується на написанні складних функцій і збережених процедур, щоб методично обробляти вхідні дані, щоб вони могли бути стандартизовані та працювати в проектах звітів, візуалізації та аналітики. Перш ніж …
14 python  r  data-cleaning  data  sql 

3
Doc2vec (gensim) - Як я можу зробити ярлик невидимих ​​речень?
https://radimrehurek.com/gensim/models/doc2vec.html Наприклад, якщо ми тренували doc2vec з "aaaaaAAAAAaaaaaa" - "мітка 1" "BbbbbbBBBBBbbbb" - "мітка 2" Чи можемо ми зробити висновок, що "aaaaAAAAaaaaAA" ​​є міткою 1 за допомогою Doc2vec? Я знаю, що Doc2vec може тренувати слова вектори та вектори міток. Використовуючи ці вектори, чи можемо ми зробити висновок про невидимі речення …
14 gensim 

1
Поширення назад через максимум шарів об'єднання
У мене є невелике підпитання до цього питання . Я розумію, що при розповсюдженні назад через максимальний шар об'єднання градієнт повертається назад таким чином, що нейрон в попередньому шарі, який був обраний як max, отримує весь градієнт. У чому я не впевнений на 100% - це те, як градієнт у …

1
Чим відрізняється (динамічна) мережа Bayes від HMM?
Я читав, що ГММ, Фільтри частинок та Фільтри Кальмана - це особливі випадки динамічних мереж Байєса. Однак я знаю лише HMM і не бачу різниці в динамічних мережах Bayes. Може хтось, будь ласка, пояснить? Було б добре, якби ваша відповідь могла бути подібною до наступної, але для Bayes Networks: Приховані …

3
Чи потрібно використовувати незбалансований клас, коли я використовую під час вибірки мої набори даних перевірки / тестування?
Я початківець у машинному навчанні і зіткнувся з ситуацією. Я працюю над проблемою встановлення ставок у режимі реального часу з набором даних IPinYou і намагаюся зробити прогноз кліків. Вся справа в тому, що, як ви можете знати, набір даних дуже незбалансований: близько 1300 негативних прикладів (не клацання) за 1 позитивний …

2
Високомірні дані: Які корисні методи знати?
Через різні прокльони розмірності , точність та швидкість багатьох поширених методів прогнозування деградують на даних високих розмірів. Які є найбільш корисні методи / прийоми / евристики, які допомагають ефективно працювати з великомірними даними? Наприклад, Чи добре виконуються певні методи статистичного / моделювання на високомірних наборах даних? Чи можемо ми покращити …

2
Аналіз результатів тестування A / B, які зазвичай не розподіляються, використовуючи незалежний t-тест
У мене є набір результатів тесту A / B (одна контрольна група, одна група функцій), які не відповідають нормальному розподілу. Насправді розподіл більше нагадує розподіл Ландау. Я вважаю, що незалежний t-тест вимагає, щоб зразки були принаймні приблизно нормально розподілені, що відштовхує мене від використання t-тесту як дійсного методу перевірки значимості. …

3
Коли р-значення оманливі?
Які умови даних слід слідкувати, коли значення p може бути не найкращим способом визначення статистичної значущості? Чи є конкретні типи проблем, які належать до цієї категорії?

3
Змінення розміру зображення та обшивка для CNN
Я хочу навчити CNN для розпізнавання зображень. Зображення для тренувань не мають фіксованого розміру. Наприклад, я хочу, щоб розмір вводу для CNN становив 50x100 (висота x ширина), наприклад. Коли я змінюю розмір невеликих розмірів зображень (наприклад, 32x32) до розміру введення, вміст зображення занадто сильно розтягується по горизонталі, але для деяких …

1
Дерева рішень: листяний (найкращий перший) та рівний обхід дерева
Випуск 1: Мене бентежить опис LightGBM щодо способу розширення дерева. Вони заявляють: Більшість алгоритмів навчання дерев рішень вирощують дерево за рівнем (глибиною) також, як і наступне зображення: Запитання 1 : Які "більшість" алгоритмів реалізовані таким чином? Наскільки я знаю, C4.5 і CART використовують DFS. XGBoost використовує BFS. Які ще алгоритми …


3
Навіщо перекручувати, якщо Макс Пуллінг все-таки збирається зменшити вибірку зображення?
Ідея застосування фільтрів, щоб зробити щось на кшталт виявлення країв, є досить крутою ідеєю. Наприклад, ви можете зробити зображення 7. За допомогою деяких фільтрів ви можете перетворити зображення, які підкреслюють різні характеристики вихідного зображення. Оригінал 7: може сприйматися мережею як: Зверніть увагу, як кожне зображення витягувало інший край оригіналу 7. …

4
Як ініціалізувати нову модель word2vec з попередньо підготовленими вагами моделі?
Я використовую бібліотеку Gensim у python для використання та навчання моделі word2vector. Нещодавно я розглядав ініціалізацію ваги моєї моделі з якоюсь попередньо навченою моделлю word2vec, такою як (попередньо вивчена модель GoogleNewDataset). Я боровся з цим пару тижнів. Тепер я просто дізнався, що в gesim є функція, яка може допомогти мені …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.