Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

3
Відносини між KS, AUROC та Gini
Загальні статистичні дані валідації, такі як тест Колмогорова – Смірнова (KS), AUROC та коефіцієнт Джіні, є функціонально пов'язаними. Однак моє запитання стосується доведення того, як вони пов'язані між собою. Мені цікаво, чи хтось може допомогти мені довести ці стосунки. Мені нічого не вдалося знайти в Інтернеті, але мене просто щиро …

2
Бухгалтерський облік експериментів та результатів
Я є дослідником і мені подобається тестувати життєздатні рішення, тому я, як правило, провожу багато експериментів. Наприклад, якщо я обчислюю оцінку подібності між документами, я, можливо, захочу спробувати багато заходів. Насправді, для кожного заходу мені може знадобитися зробити кілька запусків, щоб перевірити дію деяких параметрів. Поки що я відстежував вхідні …

1
Реалізація t-SNE Python: розбіжність Kullback-Leibler
t-SNE, як у [1], працює шляхом поступового зменшення розбіжності Куллбека-Лейблера (KL) до досягнення певної умови. Творці t-SNE пропонують використовувати дивергенцію KL як критерій продуктивності візуалізацій: ви можете порівняти розбіжності Kullback-Leibler, про які повідомляє t-SNE. Цілком чудово запустити t-SNE десять разів і вибрати рішення з найнижчою різницею KL [2] Я спробував …

3
Непідконтрольне функціональне навчання для NER
Я впровадив систему NER з використанням алгоритму CRF із своїми ручними функціями, які дали досить хороші результати. Вся справа в тому, що я використав безліч різноманітних функцій, включаючи POS-теги та леми. Тепер я хочу зробити той самий NER для різної мови. Проблема тут полягає в тому, що я не можу …

4
Робота з кластерами HPC
У моєму університеті у нас є обчислювальний кластер HPC. Я використовую кластер для підготовки класифікаторів тощо. Отже, зазвичай, щоб надіслати завдання кластеру (наприклад, скрипт python scikit-learn), мені потрібно написати сценарій Bash, який містить (серед інших) таку команду, як qsub script.py. Однак мені здається, що цей процес дуже розчаровує. Зазвичай відбувається …

3
Візуалізація даних для аналізу шаблонів (незалежно від мови, але бажано R)
Я хочу побудувати байти з зображення диска, щоб зрозуміти в них візерунок. Це, головним чином, академічне завдання, оскільки я майже впевнений, що ця модель була створена програмою тестування дисків, але я хотів би все-таки реінжиніринг її. Я вже знаю, що візерунок вирівняний, з періодичністю 256 символів. Я можу передбачити два …
11 r  visualization 

4
Де можна завантажити дані про історичну ринкову капіталізацію та щоденний оборот для акцій?
Існує безліч джерел, які надають історичні дані про запаси, але вони надають лише поля OHLC разом із обсягом та відрегульованими близько. Також декілька джерел, які я знайшов, надають набір даних про ринкові обмеження, але вони обмежені запасами США. Yahoo Finance надає ці дані в Інтернеті, але немає можливості їх завантажувати …
11 dataset 

3
Інформаційно-орієнтований набір даних / дослідження для дисертації статистики MSc
Я хотів би вивчити "науку про дані". Цей термін здається мені трохи розпливчастим, але, мабуть, вимагає: машинне навчання (а не традиційна статистика); досить великий набір даних, що вам доведеться виконувати аналізи на кластерах. Які хороші набори даних та проблеми, доступні статистику з деяким досвідом програмування, я можу використати для вивчення …

4
Чи справді логістична регресія є алгоритмом регресії?
Звичайне визначення регресії (наскільки мені відомо) передбачає безперервну змінну виводу з заданого набору вхідних змінних . Логістична регресія - це алгоритм бінарної класифікації, тому він дає категоричний вихід. Це справді алгоритм регресії? Якщо так, то чому?

3
Як обробити природні мовні запити?
Мені цікаво запитувати природну мову. У Стенфорді є складний набір програмного забезпечення для обробки природних мов . Я також бачив бібліотеку Apache OpenNLP та загальну архітектуру текстової інженерії . Існує неймовірна кількість використань для обробки природних мов, що робить документацію цих проектів важкою для швидкого засвоєння. Чи можете ви трохи …
11 nlp 


3
Що таке LSTM, BiLSTM і коли їх використовувати?
Я дуже новачок у глибокому навчанні, і мені особливо цікаво знати, що таке LSTM та BiLSTM та коли їх використовувати (основні сфери застосування). Чому LSTM і BILSTM популярніші за RNN? Чи можемо ми використовувати ці архітектури глибокого навчання у непідконтрольних проблемах?

2
Дивна поведінка з оптимізатором Адама, коли занадто довго тренувалися
Я намагаюся навчити один перцептрон (1000 вхідних одиниць, 1 вихід, без прихованих шарів) на 64 випадково генерованих точках даних. Я використовую Pytorch за допомогою оптимізатора Адама: import torch from torch.autograd import Variable torch.manual_seed(545345) N, D_in, D_out = 64, 1000, 1 x = Variable(torch.randn(N, D_in)) y = Variable(torch.randn(N, D_out)) model = …

1
Кількість і розмір щільних шарів у CNN
Більшість мереж, яких я бачив, мають один або два щільних шару до остаточного шару softmax. Чи є якийсь принциповий спосіб вибору кількості та розмірів щільних шарів? Чи два щільні шари представницькіші за один, для однакової кількості параметрів? Чи слід наносити випадання перед кожним щільним шаром чи лише один раз?
11 convnet 

3
Як використовувати GAN для непідконтрольного вилучення функцій із зображень?
Я зрозумів, як працює GAN, поки дві мережі (генеративні та дискримінаційні) конкурують між собою. Я створив DCGAN (GAN з згортаючим дискримінатором та деконволюційним генератором), який зараз успішно генерує рукописні цифри, подібні до даних у наборі даних MNIST. Я багато читав про програми GAN для отримання функцій із зображень. Як можна …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.