Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області



3
Що швидше: PostgreSQL проти MongoDB на великих наборах даних JSON?
У мене великий набір даних з 9м JSON-об'єктів по ~ 300 байт кожен. Це повідомлення з агрегатора посилань: в основному посилання (URL, назва та ідентифікатор автора) та коментарі (текст та ідентифікатор автора) + метадані. Вони цілком можуть бути реляційними записами в таблиці, за винятком того, що вони мають одне поле …

1
Іскра, оптимально розділивши один RDD на два
У мене є великий набір даних, який мені потрібно розділити на групи за певними параметрами. Я хочу, щоб робота пройшла максимально ефективно. Я можу передбачити два способи цього Варіант 1 - Створіть карту з оригінального RDD та фільтра def customMapper(record): if passesSomeTest(record): return (1,record) else: return (0,record) mappedRdd = rddIn.map(lambda …

1
Кілька міток у контрольованому алгоритмі навчання
У мене є корпус тексту з відповідною тематикою. Наприклад, "A rapper Tupac was shot in LA"це було позначено як ["celebrity", "murder"]. Отже, в основному кожен вектор функцій може мати багато міток (не однакова кількість. Перший вектор функцій може мати 3 мітки, другий 1, третій 5). Якби мені кожен текст міг …

4
Як скребти веб-сторінку imdb?
Я намагаюся навчитися веб-вискоблюванню за допомогою Python самостійно як частина зусиль для вивчення аналізу даних. Я намагаюся скребити веб-сторінку imdb, URL-адреса якої: http://www.imdb.com/search/title?sort=num_votes,desc&start=1&title_type=feature&year=1950,2012 Я використовую модуль BeautifulSoup. Далі йде код, який я використовую: r = requests.get(url) # where url is the above url bs = BeautifulSoup(r.text) for movie in bs.findAll('td','title'): …

3
Вектор космічної моделі косинус tf-idf для пошуку подібних документів
Мають корпус з понад мільйона документів Для даного документа потрібно знайти подібні документи, використовуючи косинус, як у векторній космічній моделі d1⋅d2/(||d1||||d2||)г1⋅г2/(||г1||||г2||)d_1 \cdot d_2 / ( ||d_1|| ||d_2|| ) Всі tf були нормалізовані за допомогою збільшеної частоти, щоб запобігти упередженню до більш довгих документів, як у цьому tf-idf : tf(t,d)=0.5+0.5f(t,d)max{f(t,d):t∈d}тf(т,г)=0,5+0,5f(т,г)мах{f(т,г):т∈г}tf(t,d)=0.5+0.5\frac{f(t,d)}{\mathrm{max}\{f(t,d): t\in …

3
Аналіз файлів журналу: витяг інформаційної частини з частини значення
Я намагаюся створити набір даних на кількох файлах журналів одного з наших продуктів. Різні файли журналів мають власний макет і власний вміст; Я успішно згрупував їх разом, залишився лише один крок ... Дійсно, журнал "повідомлення" - найкраща інформація. У мене немає вичерпного списку всіх цих повідомлень, і це погана ідея …

2
Виявлення масштабованого зовнішнього вигляду / аномалії
Я намагаюся налаштувати велику інфраструктуру даних за допомогою Hadoop, Hive, Elastic Search (серед інших), і я хотів би запустити деякі алгоритми над певними наборами даних. Я хотів би, щоб самі алгоритми були масштабованими, тому це виключає використання таких інструментів, як Weka, R або навіть RHadoop. Бібліотека Apache Mahout здається хорошим …

1
Бібліотеки для (алгоритми розповсюдження міток / часте видобування підграфів) для графіків на R
Загальний опис проблеми У мене є графік, де деякі вершини позначені типом з 3 або 4 можливими значеннями. Для інших вершин тип невідомий. Моя мета - використовувати графік, щоб передбачити тип вершин, що не мають маркування. Можливі рамки Я підозрюю, що це вписується в загальні рамки проблем із розповсюдженням етикетки, …

2
Бібліотеки онлайн-машинного навчання
Я шукаю пакети (або в python, R, або в окремий пакет) для виконання онлайн-навчання для прогнозування запасів. Я знайшов і читав про Vowpal Wabbit ( https://github.com/JohnLangford/vowpal_wabbit/wiki ), який здається досить перспективним, але мені цікаво, чи є там інші пакети. Заздалегідь спасибі.

2
здійснення часової різниці в шахах
Я розробляв шахову програму, яка використовує алгоритм обрізки альфа-бета та функцію оцінювання, яка оцінює позиції за допомогою наступних функцій, а саме: матеріал, безпека, мобільність, структура пішака та захоплені шматочки тощо ..... Моя функція оцінювання: походить від f(p)=w1⋅material+w2⋅kingsafety+w3⋅mobility+w4⋅pawn-structure+w5⋅trapped piecesf(p)=w1⋅material+w2⋅kingsafety+w3⋅mobility+w4⋅pawn-structure+w5⋅trapped piecesf(p) = w_1 \cdot \text{material} + w_2 \cdot \text{kingsafety} + w_3 \cdot …

2
Витягніть канонічну струну зі списку галасливих струн
У мене тисячі списків рядків, і кожен список містить близько 10 рядків. Більшість рядків у даному списку дуже схожі, хоча деякі рядки (рідко) повністю не пов'язані з іншими, а деякі рядки містять нерелевантні слова. Їх можна вважати галасливими варіаціями канонічної струни. Я шукаю алгоритм чи бібліотеку, які перетворять кожен список …

4
Які початкові кроки я повинен використовувати, щоб зрозуміти великі набори даних, і які інструменти я повинен використовувати?
Caveat: Я повний новачок, коли йдеться про машинне навчання, але прагну вчитися. У мене великий набір даних, і я намагаюся знайти в ньому шаблон. Можливо / може не бути кореляції між даними, як з відомими змінними, так і зі змінними, які містяться в даних, але які я ще не зрозумів, …

3
Як різноманітні статистичні методи (регресія, PCA тощо) масштабують з розміром та розміром вибірки?
Чи відома загальна таблиця статистичних методик, яка пояснює, як вони масштабуються з розміром і розміром вибірки? Наприклад, мій друг сказав мені днями, що час обчислення просто швидкого сортування одновимірних даних за розміром n йде як n * log (n). Наприклад, якщо ми регресуємо y проти X, де X є d-мірною …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.