Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

1
Чи потрібно нормалізувати дані, будуючи дерева рішень за допомогою R?
Отже, наш набір даних цього тижня має 14 атрибутів, і кожен стовпець має дуже різні значення. Один стовпець має значення нижче 1, а інший - у трьох-чотирьох цілих цифр. Ми дізналися про нормалізацію минулого тижня, і, здається, ви повинні нормалізувати дані, коли вони мають дуже різні значення. Чи стосується дерев …
10 r  beginner 

3
Чи мертві онтології та семантична павутина? [зачинено]
Закрито . Це питання має бути більш зосередженим . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно зосередило увагу на одній проблемі лише редагуючи цю публікацію . Закрито 3 роки тому . Чи помер Семантичний Інтернет? Чи онтології мертві? Я розробляю план роботи для своєї дипломної …

2
Підсилення чутливості до локальності
Я намагаюся створити хеш-чутливість до косинусної місцевості, щоб я міг знайти кандидата подібних пар елементів, не порівнюючи всіх можливих пар. У мене це в основному працює, але, здається, більшість пар у моїх даних мають схожість на косинус у діапазоні від -0,2 до +0,2, тому я намагаюся нарізати його досить тонко …

2
Скільки часу займає класифікатор scikit для класифікації?
Я планую використовувати класифікатор лінійної підтримуючої машини scikit (SVM) для класифікації тексту на корпусі, що складається з 1 мільйона мічених документів. Що я планую зробити, це коли користувач вводить якесь ключове слово, класифікатор спочатку класифікує його до категорії, а потім подається запит на отримання інформації в документах цієї категорії категорії. …

2
Стохастичний градієнтний спуск на основі векторних операцій?
припустимо, що я хочу навчити алгоритм регресії стохастичного градієнта спуску за допомогою набору даних, що містить N зразків. Оскільки розмір набору даних є фіксованим, я повторно використовую дані T разів. Під час кожної ітерації або "епохи" я використовую кожен зразок тренінгу рівно один раз після випадкового переупорядкування всього навчального набору. …

4
Як створити оптимізований список прогулянок з урахуванням координат довготи та широти?
Я працюю над політичною кампанією, де десятки добровольців будуть проводити акції, що стукають дверима, протягом наступних кількох тижнів. Дано список із іменами, адресами та довгими / латинськими координатами, які алгоритми можна використовувати для створення оптимізованого списку прогулянок.
10 algorithms 

3
Класичний набір даних мережі
Існує кілька класичних наборів даних для завдань машинного навчання класифікації / регресії. Найпопулярніші: Набір даних про квіткові райдужки ; Титанічний набір даних ; Автомобільні тренди ; тощо. Але хтось знає подібні набори даних для аналізу мереж / теорії графіків? Більш конкретно - я шукаю стандартні набори даних Gold для порівняння …
10 dataset  graphs 

2
Перехресне підтвердження: K-кратне та повторне випадкове під вибірку
Цікаво, який тип перехресної перевірки моделі вибрати для проблеми класифікації: K-кратна або випадкова підсемплікація (вибірка завантажувальної програми)? Моя найкраща здогадка - використовувати 2/3 набору даних (що становить ~ 1000 предметів) для навчання та 1/3 для перевірки. У цьому випадку K-кратність дає лише три ітерації (складки), що недостатньо, щоб побачити стабільну …

4
Як налагодити аналіз даних?
Я зіткнувся з наступною проблемою, яку я повторюю досить типово. У мене є кілька великих даних, скажімо, кілька мільйонів рядків. Я виконую на ньому нетривіальний аналіз, наприклад, SQL-запит, що складається з декількох підзапитів. Я отримую певний результат, констатуючи, наприклад, що властивість X з часом збільшується. Зараз є дві можливі речі, …

2
Налагодження нейронних мереж
Я створив штучну нейронну мережу в python, використовуючи функцію оптимізації scipy.optimize.minimize (Conjugate gradient). Я здійснив перевірку градієнта, двічі перевірив все тощо, і я впевнений, що він працює правильно. Я запускав його кілька разів, і він досягає "Оптимізація успішно припиняється", але коли я збільшую кількість прихованих шарів, вартість гіпотези збільшується (все …

1
Як слід поводитися з неявними даними в рекомендації
Система рекомендацій веде журнал того, які рекомендації були зроблені конкретному користувачеві та чи приймає він рекомендацію. Це як user_id item_id result 1 4 1 1 7 -1 5 19 1 5 80 1 де 1 означає, що користувач прийняв рекомендацію, а -1 означає, що користувач не відповів на рекомендацію. Питання: …

1
Кластеризація даних клієнтів, що зберігаються в ElasticSearch
У мене є купа профілів клієнтів, які зберігаються в еластичний пошуккластер. Ці профілі зараз використовуються для створення цільових груп для нашої підписки на електронну пошту. Цільові групи тепер формуються вручну, використовуючи можливість пошуку гранічних пошуків (наприклад, залучити всіх клієнтів чоловіків віком до 23 років з одним автомобілем та 3 дітьми). …

5
Як створити хороший список зупинок
Я шукаю підказки про те, як вилікувати список зупинок. Хтось знає / чи може хтось порекомендувати хороший метод вилучення списків зупинок із самого набору даних для попередньої обробки та фільтрації? Дані: величезна кількість введення людського тексту різної довжини (пошукові терміни та цілі речення (до 200 символів)) протягом кількох років. Текст …


1
Чому моя модель Кераса вчиться розпізнавати тло?
Я намагаюся навчити цю керасову реалізацію Deeplabv3 + на Pascal VOC2012, використовуючи попередньо перевірену модель (яка також проходила навчання на цьому наборі даних). Я отримав дивні результати з точністю швидко зближення до 1,0: 5/5 [==============================] - 182s 36s/step - loss: 26864.4418 - acc: 0.7669 - val_loss: 19385.8555 - val_acc: 0.4818 …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.