Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області


2
Яка перевага збереження розміру партії потужністю 2?
Під час навчання моделей машинного навчання, чому іноді вигідно тримати розмір партії до потужності 2? Я подумав, що найкраще використовувати розмір, який найбільше вписується у вашу пам’ять / оперативну пам’ять. Ця відповідь стверджує, що для деяких пакетів потужність 2 краще, ніж розмір партії. Чи може хтось надати детальне пояснення / …



1
Чому ReLU кращий за інші функції активації
Тут відповідь стосується зникаючих та вибухових градієнтів, які були у sigmoidподібних функціях активації, але, я думаю, Reluмає недолік, і це його очікуване значення. немає обмежень на вихід Reluта, тому його очікуване значення не дорівнює нулю. Я пам'ятаю час , перш ніж популярність , Reluщо tanhбув найпопулярнішим серед машинного навчання фахівців …

2
Doc2Vec - Як позначити абзаци (gensim)
Мені цікаво, як позначити (тег) речення / абзаци / документи з doc2vec в gensim - з практичної точки зору. Чи потрібно мати кожне речення / абзац / документ із власною унікальною міткою (наприклад, "Sent_123")? Це здається корисним, якщо ви хочете сказати, "які слова чи речення найбільш схожі на одне конкретне …

3
Що означає позначення mAP @ [. 5: .95]?
Для виявлення загальним способом визначення правильності однієї об’єктної пропозиції є Перетин над Союзом (IoU, IU). Для цього береться набір запропонованих пікселів об'єкта та набір справжніх пікселів об'єкта B і обчислюється:ААAББB Яo U( A , B ) = A ∩ BA ∪ BЯоU(А,Б)=А∩БА∪БIoU(A, B) = \frac{A \cap B}{A \cup B} Як …

3
Баггінг проти випадання в глибоких нейронних мережах
Баггінг - це покоління декількох предикторів, яке працює так само симпатично, як і єдиний провісник. Випадання - це техніка, яка привчає нейронні мережі до порівняння всіх можливих підмереж. Дивлячись на найважливіші змагання Kaggle, здається, що ці дві техніки використовуються разом дуже часто. Я не бачу жодної теоретичної різниці, окрім реальної …

1
Алгоритми кластеризації тексту
У мене є проблема об’єднання величезної кількості речень у групи за їх значеннями. Це схоже на проблему, коли у вас є багато речень і хочете згрупувати їх за значеннями. Які алгоритми пропонуються для цього? Я не знаю кількість кластерів заздалегідь (а оскільки надходить більше даних, кластери також можуть змінюватися), які …

4
К-значить: Які хороші способи вибрати ефективний набір початкових центроїдів?
Коли використовується випадкова ініціалізація центроїдів, різні прогони K-засобів виробляють різні загальні SSE. І це має вирішальне значення у виконанні алгоритму. Які ефективні підходи до вирішення цієї проблеми? Останні підходи оцінюються.

3
Найближчі сусіди шукають дуже високі розмірні дані
Я маю велику розріджену матрицю користувачів та елементів, які їм подобаються (порядку 1М користувачів та 100К елементів, із дуже низьким рівнем розрідженості). Я вивчаю способи, за допомогою яких я міг би здійснювати пошук kNN на ньому. Враховуючи розмір мого набору даних та деякі початкові тести, які я виконував, я припускаю, …

4
Додатковий вихідний рівень у нейронній мережі (десяткові до двійковій)
Я працюю над запитанням із онлайн-книги: http://neuralnetworksanddeeplearning.com/chap1.html Я можу зрозуміти, що якщо додатковий вихідний шар має 5 вихідних нейронів, я, ймовірно, міг би встановити зміщення в 0,5 і вагу 0,5 кожного для попереднього шару. Але тепер питання задати для нового шару з чотирьох вихідних нейронів - що більш ніж достатньо …

6
Що ви використовуєте для створення інформаційної панелі в R?
Мені потрібно генерувати періодичні (щоденні, щомісячні) звіти на інформаційній панелі веб-аналітики. Вони будуть статичними і не потребують взаємодії, тому уявіть PDF-файл як цільовий вихід. У звітах будуть змішані таблиці та діаграми (в основному діаграми блискавки та кулі, створені з ggplot2). Подумайте про інформаційні панелі стилю Стівен Мало / Перцептуальні краї, …
17 r  visualization 

2
Як слід застосовувати етику в науці даних
Нещодавно відбувся фурор, коли у Facebook експериментували їх користувачі, щоб побачити, чи зможуть вони змінити емоції користувачів, і тепер okcupid . Хоча я не є професійним науковцем даних, я читав про етику науки про дані з книги Кеті О'Нілл "Doing Data Science" і хотів би знати, чи це щось, чого …

7
Візуалізація графіка з мільйоном вершин
Який найкращий інструмент використовувати для візуалізації (малювання вершин і ребер) графіка з 1000000 вершин? У графіку є близько 50000 ребер. І я можу обчислити розташування окремих вершин і ребер. Я думаю про те, щоб написати програму для створення svg. Будь-які інші пропозиції?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.