Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

1
Перетворити стовпець панди з типу даних int до часової позначки
У мене є кадр даних, який, серед іншого, містить стовпчик кількості минулих мілісекунд з 1970-1-1 років. Мені потрібно конвертувати цей стовпець ints у дані часових позначок, тому я можу в кінцевому підсумку перетворити його у стовпчик даних timetime, додавши серію стовпців часової мітки до серії, яка повністю складається зі значень …

5
Особливість важливості у науковому навчанні Random Forest демонструє дуже високий рівень стандартного відхилення
Я використовую випадковий класифікатор лісового науку і хочу вивчити важливість функції, наприклад, у цьому прикладі . Однак мій результат зовсім інший, в тому сенсі, що значення важливості функції майже завжди більше, ніж значення функції (див. Додане зображення). Чи можна мати таку поведінку, чи я роблю деякі помилки, будуючи це? Мій …

1
Розпізнайте граматику в послідовності нечітких лексем
У мене є текстові документи, які містять переважно списки предметів. Кожен елемент - це група з декількох маркерів різних типів: ім’я, прізвище, прізвище, день народження, номер телефону, місто, окупація тощо. Маркер - це група слів. Елементи можуть лежати на кількох рядках. Елементи з документа мають приблизно однаковий синтаксис лексеми, але …

2
Лінійна регресія з несиметричною функцією витрат?
Y( х )Y(x)Y(x)Y^( х )Y^(x)\hat Y(x)Y( х )Y(x)Y(x)cost{Y(x)≳Y^(x)}>>cost{Y^(x)≳Y(x)}cost{Y(x)≳Y^(x)}>>cost{Y^(x)≳Y(x)}\text{cost}\left\{ Y(x) \gtrsim \hat Y(x) \right\} >> \text{cost}\left\{ \hat Y(x) \gtrsim Y(x) \right\} Я думаю, що проста лінійна регресія повинна зробити абсолютно чудово. Тож я дещо знаю, як це реалізувати вручну, але, мабуть, я не перший із подібними проблемами. Чи є там якісь …

2
Як обчислити середнє значення стовпця фрейму даних і знайти топ-10%
Я дуже новачок у Scala та Spark і працюю над деякими саморобними вправами, використовуючи статистику бейсболу. Я використовую класовий регістр, щоб створити RDD і призначити схему даним, а потім перетворюю їх у DataFrame, щоб я міг використовувати SparkSQL для вибору груп гравців за їх статистикою, що відповідають певним критеріям. Після …

2
Ефективний алгоритм для обчислення кривої ROC для класифікатора, що складається з ансамблю роз'єднаних класифікаторів
Припустимо, у мене є класифікатори C_1 ... C_n, які не роз'єднуються в тому сенсі, що жодне двоє не поверне істину на одному вході (наприклад, вузли в дереві рішення). Я хочу створити новий класифікатор, який є об'єднанням якогось підмножини (наприклад, я хочу визначити, які листя дерева рішень даватимуть позитивну класифікацію). Звичайно, …
13 algorithms 

7
Я програміст, як я можу потрапити в сферу наукових даних?
Перш за все цей термін звучить так незрозуміло. У всякому разі .. Я програмний програміст. Однією з мов, яку я можу кодувати, є Python. Якщо говорити про дані, то я можу використовувати SQL і можу робити скребки даних. Що я з’ясував поки що, прочитавши так багато статей, що в науці …
13 beginner  career 

1
У чому різниця між генерацією та вилученням функцій?
Хтось може мені сказати, яка мета генерування функцій? і навіщо потрібне збагачення простору функцій перед класифікацією зображення? Це необхідний крок? Чи є який-небудь спосіб збагатити простір функцій?

1
Neo4j vs OrientDB проти Титану
Я працюю над проектом з науковими даними, пов’язаним із розробкою соціальних відносин і потребую зберігання даних у деяких базах даних графіків. Спочатку я вибрав Neo4j як базу даних. Але це здається, що Neo4j не дуже масштабується. Альтернатива, яку я дізнався, - «Титан» та «oriebtDB». Я пройшов це порівняння на цих …

2
Візуалізація тренувань з глибокої нейромережі
Я намагаюся знайти еквівалент діаграм Хінтона для багатошарових мереж, щоб скласти графік ваг під час тренувань. Навчена мережа дещо схожа на Deep SRN, тобто вона має велику кількість матриць з декількома вагами, що зробить одночасний графік декількох діаграм Хінтона візуально заплутаним. Хтось знає про хороший спосіб візуалізації процесу оновлення ваги …

1
Он-лайн випадкові ліси, додаючи більше одиничних дерев рішень
Випадковий ліс (РФ) створюється ансамблем дерев рішень (DT). За допомогою пакетування кожен DT навчається в різному наборі даних. Отже, чи є спосіб впровадження он-лайн випадкового лісу шляхом додавання більшої кількості рішень для нових даних? Наприклад, ми маємо 10К зразків і навчаємо 10 ДТ. Потім ми отримуємо зразки 1К, і замість …

2
Які функції, як правило, використовуються з дерев Парсера в процесі класифікації в NLP?
Я вивчаю різні типи структур дерев розбору. Дві широко відомі структури дерев розбору: a) Дерево розбору, засноване на окружності, і b) Деревові структури розбору на основі залежності. Я можу використовувати генерувати обидва типи структур дерева розбору за допомогою пакету Stanford NLP. Однак я не впевнений, як використовувати ці структури дерев …

4
Вивчення алгоритмів машинного навчання: глибина розуміння та кількість алгоритмів
Нещодавно мене познайомили з галуззю наукових даних (минуло 6 місяців), і Ii розпочав подорож з курсу машинного навчання Ендрю Нґ та посадою, яка почала працювати над спеціалізацією JHU з наукових даних. На практичній практиці я працював над створенням прогностичної моделі, яка б передбачала погіршення. Поки я використовував glm, bayesglm, rf, …

6
Набори даних, що розуміють кращі практики
Я студент-магістр CS з вибору даних. Мій керівник одного разу сказав мені, що перед тим, як запустити будь-який класифікатор або зробити що-небудь із набором даних, я повинен повністю зрозуміти дані та переконатися, що дані чисті та правильні. Мої запитання: Які найкращі практики для розуміння набору даних (великі розміри з числовими …

1
Коли реляційна база даних має кращі показники, ніж реляційна
Коли реляційна база даних, як MySQL, має кращу продуктивність, ніж реляційна, як MongoDB? Днями я побачив питання про Quora про те, чому Quora все ще використовує MySQL як їхній запуск, і про те, що їхня ефективність все ще хороша.

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.