Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

3
Масове перетворення категоричних стовпців у пандах (не одноразове кодування)
У мене є рамки даних панди з тоннами категоричних стовпців, які я планую використовувати в дереві рішень з scikit-learn. Мені потрібно перетворити їх на числові значення (не один гарячий вектор). Я можу це зробити з LabelEncoder від scikit-learn. Проблема в тому, що їх занадто багато, і я не хочу їх …

2
Втрати та точність валідації залишаються постійними
Я намагаюся реалізувати цей документ на наборі медичних зображень. Я роблю це в Керасі. Мережа, по суті, складається з 4 шарів conv і max-пулу з подальшим повністю пов'язаним шаром і м'яким класифікатором max. Наскільки я знаю, я дотримувався архітектури, згаданої в роботі. Однак втрати та точність перевірки просто залишаються рівними …

1
Як визначити спеціальний показник ефективності в Керасі?
Я спробував визначити власну метричну фукцію (F1-Score) у Керасі (тензорфлоу), відповідно до наступного: def f1_score(tags, predicted): tags = set(tags) predicted = set(predicted) tp = len(tags & predicted) fp = len(predicted) - tp fn = len(tags) - tp if tp>0: precision=float(tp)/(tp+fp) recall=float(tp)/(tp+fn) return 2*((precision*recall)/(precision+recall)) else: return 0 Поки що так добре, …

3
Tensorflow Коригування функції витрат для незбалансованих даних
У мене є проблема класифікації сильно незбалансованих даних. Я читав, що надмірне зменшення розміру, а також зміна вартості для недостатньо представлених категоричних результатів призведе до кращого пристосування. Перш ніж це зробити, tensorflow би класифікував кожну інформацію як групу більшості (і набирав би точність понад 90%, настільки ж безглуздо, як це …

3
Потрібна допомога з розумінням пропозиції приблизних розділених балів xgboost
фон: в xgboost в ітераційним підганяє дерево ф т по всьому п прикладів , які зводять до мінімуму наступної мети:tttftftf_tnnn ∑i=1n[gift(xi)+12hif2t(xi)]∑i=1n[gift(xi)+12hift2(xi)]\sum_{i=1}^n[g_if_t(x_i) + \frac{1}{2}h_if_t^2(x_i)] де спочатку порядок і похідні другого порядку над нашою попередньою кращої оцінки у (від ітерації т - 1 ):gi,higi,hig_i, h_iy^y^\hat{y}t−1t−1t-1 gi=dy^l(yi,y^)gi=dy^l(yi,y^)g_i=d_{\hat{y}}l(y_i, \hat{y}) hi=d2y^l(yi,y^)hi=dy^2l(yi,y^)h_i=d^2_{\hat{y}}l(y_i, \hat{y}) а - наша …
12 xgboost  gbm 

2
Глибоке навчання за допомогою спектрограм для розпізнавання звуку
Я розглядав можливість класифікувати звук (наприклад, звуки тварин) за допомогою спектрограми. Ідея полягає у використанні глибоких звивистих нейронних мереж для розпізнавання сегментів у спектрограмі та виведення одного (або багатьох) міток класу. Це не нова ідея (див., Наприклад, класифікацію звуку китів або розпізнавання музичного стилю ). Проблема, з якою я стикаюся, …

1
Вибір особливостей за допомогою імпортів функцій у випадкових лісах із науковим досвідом
Я побудував схему імпортних функцій у випадкових лісах за допомогою наукової роботи . Для того, щоб покращити прогнозування за допомогою випадкових лісів, як я можу використовувати інформацію про ділянки для видалення функцій? Тобто як визначити, чи є марка марною або навіть гіршою, що зменшує продуктивність випадкових лісів, спираючись на інформацію …

3
Як я можу динамічно розрізняти категоричні дані та числові дані?
Я знаю когось, хто працює над проектом, який передбачає введення файлів даних без огляду на стовпці чи типи даних. Завдання - взяти файл з будь-якою кількістю стовпців та різними типами даних та вивести підсумкову статистику на числові дані. Однак він не знає, як рухатись щодо динамічного призначення типів даних певним …

4
Завантаження великого набору даних в Інтернеті безпосередньо в AWS S3
Хтось знає, чи можна імпортувати великий набір даних в Amazon S3 з URL-адреси? В основному я хочу уникати завантаження величезного файлу, а потім перезавантаження його на S3 через веб-портал. Я просто хочу надати URL-адресу завантаження на S3 і чекати, коли вони завантажать його у свою файлову систему. Здається, це легко …
12 dataset  aws 

3
Довідка щодо НЕР у NLTK
Я деякий час працюю в NLTK, використовуючи Python. Проблема, з якою я стикаюсь, полягає в тому, що з моїми спеціальними даними вони не допомагають навчати НЕР в NLTK Вони використовували MaxEnt і навчали його на корпусі ACE. Я багато шукав в Інтернеті, але не зміг знайти жодного способу, який би …

2
Моделювання нерівномірно розташованих часових рядів
Я маю суцільну змінну, відібрану вибірку протягом року з нерегулярними інтервалами. Деякі дні мають більше одного спостереження на годину, а інші періоди нічого не мають. Це ускладнює виявлення закономірностей у часових рядах, оскільки деякі місяці (наприклад, жовтень) є дуже вибірковою, а інші - ні. Моє питання - який найкращий підхід …

3
Як оживити зростання соціальної мережі?
Я шукаю бібліотеку / інструмент, щоб візуалізувати, як змінюється соціальна мережа, коли до неї додаються нові вузли / краї. Одним із існуючих рішень є SoNIA: Social Animator Image Animator . Це дозволяє вам зробити фільми , як цей . Документація SoNIA говорить про те, що вона наразі зламана, і, крім …

2
Інструменти з відкритих джерел для допомоги у видобутку потоку балів лідерів
Розглянемо потік, що містить кортежі, що (user, new_score) представляють результати користувачів в онлайн-грі. Потік може мати 100-1000 нових елементів в секунду. У грі є 200K до 300K унікальних гравців. Я хотів би мати кілька постійних запитів, таких як: Котрі гравці розміщували більше x балів у розсувному вікні години Які гравці …

3
Як запит до величезної бази даних повертається з незначною затримкою?
Наприклад, шукаючи щось у Google, результати повертаються майже миттєво. Я розумію, що Google сортує та індексує сторінки з алгоритмами і т. Д., Але я вважаю це нездійсненним для індексації результатів кожного можливого запиту (а результати персоналізовані, що робить це ще більш нездійсненним)? Крім того, хіба не буде затримка апаратного забезпечення …
12 bigdata  google  search 

2
глибоке навчання невиконаним завданням без зображення?
Наразі існує багато цікавих додатків для глибокого вивчення комп’ютерного зору чи обробки природних мов. Як це в інших, більш традиційних галузях? Наприклад, у мене є традиційні соціально-демографічні змінні плюс, можливо, багато лабораторних вимірювань і хочу передбачити певну хворобу. Це буде додатком для глибокого навчання, якщо у мене буде багато спостережень? …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.