Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

3
Ефективна модель бази даних для зберігання даних, індексованих n-грамами
Я працюю над додатком, який вимагає створення дуже великої бази даних з n-грамів, які існують у великому текстовому корпусі. Мені потрібні три ефективні типи операцій: пошук та вставка, індексовані самим n-грамом, і запит для всіх n-грамів, які містять суб-n-грам. Мені це здається, що база даних повинна бути гігантським деревом документів, …
12 nlp  databases 

3
Вимірювання продуктивності різних класифікаторів з різними розмірами вибірки
В даний час я використовую кілька різних класифікаторів для різних об'єктів, витягнутих з тексту, і використовую точність / згадування як підсумок того, наскільки добре працює кожен окремий класифікатор для певного набору даних. Мені цікаво, чи є змістовний спосіб порівняння продуктивності цих класифікаторів аналогічним чином, але який також враховує загальну кількість …

3
Прогнозування наступного медичного стану від минулих станів у даних претензій
Зараз я працюю з великим набором даних про претензії на медичне страхування, що включає деякі лабораторні та аптечні претензії. Однак найсумісніша інформація в наборі даних складається з діагностики (ICD-9CM) та процедурних кодів (CPT, HCSPCS, ICD-9CM). Мої цілі: Визначте найбільш впливові умови попередника (супутні захворювання) для такого медичного стану, як хронічне …

1
У чому різниця між глобальними та універсальними методами стиснення?
Я розумію, що методи стиснення можуть бути розділені на два основні набори: глобальний місцеві Перший набір працює незалежно від даних, що обробляються, тобто вони не покладаються на будь-які характеристики даних і, таким чином, не потребують жодної попередньої обробки на будь-якій частині набору даних (перед самим стисненням). З іншого боку, місцеві …

2
Алгоритм відповідності переваг
Є цей побічний проект, над яким я працюю, де мені потрібно структурувати рішення наступної проблеми. У мене дві групи людей (клієнти). Група Aмає намір придбати, а група Bмає намір продати визначений товар X. У продукту є низка атрибутів x_i, і моя мета - полегшити транзакцію між ними Aта Bшляхом їх …

3
Чи замінює Amazon RedShift Hadoop для даних ~ 1XTB?
Навколо Хадоопа та його екосистеми є багато шуму. Однак на практиці, де багато наборів даних знаходяться в терабайтному діапазоні, чи не розумніше використовувати Amazon RedShift для запитів великих наборів даних, а не витрачати час і зусилля на створення кластера Hadoop? Крім того, як Amazon Redshift порівнюється з Hadoop щодо складності, …

2
Компроміси між штормом та Hadoop (MapReduce)
Чи може хтось люб’язно розказати мені про компроміси, які брали участь у виборі між Storm та MapReduce у кластері Hadoop для обробки даних? Звичайно, окрім очевидного, що Hadoop (обробка через MapReduce в кладоні Hadoop) є системою пакетної обробки, а Storm - системою обробки в режимі реального часу. Я трохи працював …

9
Які кілька простих у вивченні програм машинного навчання? [зачинено]
Закрито . Це питання ґрунтується на думці . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб на нього можна було відповісти фактами та цитатами, відредагувавши цю публікацію . Закрито 5 років тому . Будучи новим у машинному навчанні взагалі, я хотів би почати грати і бачити, які …

3
Примірники проти ядер при використанні EC2
Працюючи над проектами, які часто можна назвати "середніми даними", я зміг паралелізувати свій код (в основному для моделювання та прогнозування в Python) на єдиній системі з будь-якого місця від 4 до 32 ядер. Тепер я дивлюся на масштабування кластерів на EC2 (можливо, StarCluster / IPython, але також відкритий для інших …
12 parallel  clusters  aws 

2
Чи може нейронна мережа обчислити
В дусі відомого жарту Tensorflow Fizz Buzz і проблеми XOr я задумався, чи можливо створити нейронну мережу, яка реалізує функцію ?у= х2у=х2y = x^2 Враховуючи деяке подання числа (наприклад, як вектор у двійковій формі, так що це число 5представлене як [1,0,1,0,0,0,0,...]), нейронна мережа повинна навчитися повертати свій квадрат - 25 …

3
Чи існує правило для створення дизайну нейронних мереж?
Я знаю, що нейромережева архітектура здебільшого базується на самій проблемі та типах введення / виводу, але все ж - завжди є "квадратний", коли він починає будувати. Отже, моє запитання - з урахуванням вхідного набору даних MxN (M - кількість записів, N - кількість особливостей) та C можливих вихідних класів - …

1
Особливість важливості з високою кардинальністю для регресії (числова змінна залежність)
Я намагався використовувати імпорт функцій з Random Forests, щоб здійснити деякий емпіричний вибір функції для проблеми регресії, де всі функції є категоричними і багато з них мають багато рівнів (порядку 100-1000). Зважаючи на те, що одне гаряче кодування створює фіктивну змінну для кожного рівня, імпорт функцій - для кожного рівня, …

4
Як знати, що модель почала переозброювати?
Я сподіваюся, що наступні уривки дадуть зрозуміти, про що піде моє питання. Це з http://neuralnetworksanddeeplearning.com/chap3.html Потім навчання поступово сповільнюється. Нарешті, приблизно в епоху 280 точність класифікації в значній мірі перестає покращуватися. Пізніші епохи просто бачать невеликі стохастичні коливання поблизу значення точності в епоху 280. Порівнюйте це з попереднім графіком, де …

1
Причина квадратних зображень у глибокому навчанні
Більшість передових моделей глибокого навчання, таких як VGG, ResNet тощо, потребують квадратних зображень як вхідних даних, як правило, розміром пікселя 224x224224x224224x224 . Чи є причина, чому вхід повинен мати однакову форму, або я можу створити конвеєрну модель з скажімо 100x200100x200100x200 (якщо я хочу зробити фасиміальне розпізнавання, наприклад, і у мене …

2
Скільки зображень у класі достатньо для навчання CNN
Я починаю проект, де завданням є визначення типів кросівок із зображень. На даний момент я читаю про реалізацію TensorFlow та Torch . Моє запитання: скільки зображень для кожного класу потрібно для досягнення розумної ефективності класифікації?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.