Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

4
Чому кілька моделей можуть дати майже однакові результати?
Я аналізував набір даних ~ 400k записів і 9 змінних Залежна змінна є двійковою. Я встановив логістичну регресію, дерево регресії, випадковий ліс і дерево, підсилене градієнтом. Усі вони надають віртуальну ідентичну корисність підходящих номерів, коли я перевіряю їх в іншому наборі даних. Чому це так? Я здогадуюсь, що це тому, …

3
Статистика + Інформатика = Інформація? [зачинено]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було актуальним для обміну стеками даних. Закрито 5 років тому . Я хочу стати науковцем даних . Я вивчав прикладну статистику (актуарна наука), тому маю чудовий статистичний досвід (регресія, стохастичний процес, часовий …

1
Прогнозування з неатомними ознаками
Я хотів би використовувати неатомні дані, як особливість для прогнозування. Припустимо, у мене є таблиця з цими функціями: - Column 1: Categorical - House - Column 2: Numerical - 23.22 - Column 3: A Vector - [ 12, 22, 32 ] - Column 4: A Tree - [ [ 2323, …

3
Обробка регулярно збільшується набору функцій
Я працюю над системою виявлення шахрайств. У цій галузі регулярно з'являються нові шахрайства, так що нові моделі повинні додаватися до моделі на постійній основі. Цікаво, який найкращий спосіб впоратися з цим (з точки зору процесу розвитку)? Просто додавання нової функції у векторний функцію та перепідготовка класифікатора, здається, є наївним підходом, …

2
Прогнозування валютного ринку за допомогою нейронних мереж
Я хотів би використовувати ANN для автоматизації торгівлі валютами, переважно USD / EUR або USD / GBP. Я знаю, що це важко і може бути не просто. Я вже читав деякі документи і робив кілька експериментів, але без особливої ​​долі. Я хотів би отримати поради від ЕКСПЕРТІВ, щоб зробити цю …

4
Вивчення порядкової регресії в R?
Я працюю над проектом і мені потрібні ресурси, щоб довести мене до швидкості. Набір даних становить близько 35000 спостережень за 30 або близько змінними. Близько половини змінних є категоричними, при цьому деякі мають багато різних можливих значень, тобто якщо ви розділите категоричні змінні на фіктивні змінні, у вас було б …

1
Як визначити, чи можна підмножини побудувати на звичайній діаграмі Ейлера?
У деяких випадках може бути неможливо скласти діаграми Ейлера з перекриваючими колами, щоб представити всі підгрупи, що перекриваються, у правильних пропорціях. Потім для цього типу даних потрібно використовувати багатокутники або інші фігури для представлення кожного набору. Маючи справу з даними, що описують підмножини, що перекриваються, як я можу зрозуміти, чи …

4
Виявлення споживання газів - проект нейронної мережі. Погані результати
Я намагався виявити людей, що споживають енергію в споживання енергії деяких голландських будівель, будуючи модель нейронної мережі. У мене дуже погані результати, але я не можу знайти причину. Я не експерт, тому хотів би запитати у вас, що я можу вдосконалити і що я роблю неправильно. Це повний опис: https://github.com/denadai2/Gas-consumption-outliers …

1
Яка найефективніша методика індексації даних
Як ми всі знаємо, існують деякі методи індексації даних, використовуючи відомі додатки для індексації, такі як Lucene (для Java) або Lucene.NET (для .NET), MurMurHash, B + Tree тощо для No-Sql / Object Орієнтована база даних (яку я намагаюся трохи записати / пограти за допомогою C #), яку техніку ви пропонуєте? …

2
Чи правильне це порівняння Neo4j з часом виконання RDBMS?
Передумови: Далі йде з книги " Графічні бази даних" , яка охоплює тест на ефективність, згаданий у книзі Neo4j в дії : Взаємовідносини в графі природно утворюють контури. Запит або перегляд графіка включає наступні шляхи. Через принципово орієнтований на дорогу характер моделімоделі, більшість операцій з базою даних графіків на основі …
10 databases  nosql  neo4j 

3
Що таке обмеження пам'яті R?
Рецензуючи " Прикладне прогнозне моделювання ", рецензент зазначає : Однією з моїх критик педагогіки статистичного навчання є відсутність міркувань щодо обчислювальної роботи в оцінці різних методик моделювання. З його акцентом на завантажувальній та перехресній валідації для налаштування / тестування моделей, SL є досить обчислювальним. Додайте до цього повторний відбір зразків, …
10 apache-hadoop  r 

4
Чому важко надати ефективність під час використання бібліотек?
Будь-яка невелика обробка бази даних може бути легко вирішена сценаріями Python / Perl / ..., що використовує бібліотеки та / або навіть утиліти з самої мови. Однак, що стосується продуктивності, люди, як правило, тягнуться до мов C / C ++ / низького рівня. Можливість адаптації коду до потреб, здається, є …

5
Кваліфікація докторантів
Ян Лекун зазначив у своєму AMA, що вважає, що доктор наук є дуже важливим для того, щоб влаштуватися на роботу у вищій компанії. У мене є магістри зі статистики, і мої студенти були в галузі економіки та прикладної математики, але зараз я вивчаю докторські програми ML. Більшість програм кажуть, що …
10 education 

3
Як кодувати клас з 24 000 категорій?
Зараз я працюю над логістичною регресійною моделлю для геноміки. Одне з полів введення, яке я хочу включити як коваріат, - це genes. Відомо близько 24 000 генів. Існує багато особливостей з цим рівнем мінливості в обчислювальній біології, і потрібні сотні тисяч зразків. Якщо я LabelEncoder()ці 24K гени а потім OneHotEncoder()їх …

2
Які відмінності між Convolutional1D, Convolutional2D та Convolutional3D?
Я дізнався про конволюційні нейронні мережі. Переглядаючи Kerasприклади, я натрапив на три різні методи згортки. А саме, 1D, 2D та 3D. Які відмінності між цими трьома шарами? Які випадки їх використання? Чи є посилання чи посилання, які показують випадки їх використання?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.