Наука про дані

Питання та відповіді для фахівців з науки про дані, фахівців з машинного навчання та тих, хто зацікавлений у вивченні даної області

4
Великий випадок даних чи приклад використання
Я читав багато блогів \ статті про те, як різні галузі використовують великі аналітичні дані. Але більшість із цих статей не згадується Які своєрідні дані використовували ці компанії. Який був розмір даних Які види інструментальних технологій вони використовували для обробки даних Яка була проблема, з якою вони стикалися, і як …

5
Чому додавання шару відсіву покращує ефективність глибокого / машинного навчання, враховуючи, що випадання пригнічує деякі нейрони з моделі?
Якщо видалення деяких нейронів призводить до більш ефективної моделі, чому б не використати в першу чергу більш просту нейронну мережу з меншими шарами і меншою кількістю нейронів? Навіщо будувати більшу, більш складну модель на початку і придушувати її частини згодом?

2
Чому ініціалізацію ваг і ухилів слід вибирати близько 0?
Я читав це: Для тренування нашої нейронної мережі ми ініціалізуємо кожен параметр W (l) ijWij (l) та кожний b (l) ibi (l) до малого випадкового значення біля нуля (скажімо, згідно з Normal (0, ϵ2) Normal (0 , ϵ2) розподіл для деяких малих ϵϵ, скажімо, 0,01) із навчальних посібників зі Стенфордського …

3
Чому автоенкодери для зменшення розмірів симетричні?
Я не є експертом з автокодерів чи нейронних мереж будь-якими способами, тому вибачте мене, якщо це дурне питання. З метою зменшення розмірів або візуалізації кластерів у даних високих розмірів, ми можемо використовувати автокодер для створення (втраченого) 2-мірного подання, перевіряючи вихід мережевого шару з 2-ма вузлами. Наприклад, за допомогою наступної архітектури …

3
Що таке вбудовування графіка?
Нещодавно я натрапив на вбудовування графіків, таких як DeepWalk та LINE. Однак я все ще не маю чіткого уявлення про те, що мається на увазі під вкладкою графа та коли ним користуватися (додатки)? Будь-які пропозиції вітаються!
13 graphs 

3
Чому згортки завжди використовують непарні числа як filter_size
Якщо ми розглянемо 90-99% паперів, опублікованих за допомогою CNN (ConvNet). Переважна більшість із них використовує непарні номери фільтрів : {1, 3, 5, 7} для найбільш використовуваних. Ця ситуація може призвести до певної проблеми: За таких розмірів фільтрів, як правило, операція згортання не є ідеальною, якщо прокладка 2 (звичайна прокладка), а …

1
Як слід ініціалізувати і регулювати упередження?
Я прочитав пару статей про ініціалізацію ядра, і багато робіт згадують, що вони використовують регуляризацію ядра L2 (часто з ).λ = 0,0001λ=0.0001\lambda = 0.0001 Хтось робить щось інше, ніж ініціалізувати зміщення з постійним нулем і не регулювати його? Папери ініціалізації ядра Мішкін і Матас: Все, що вам потрібно, - це …

3
Чи мають нейронні мережі пояснення, як це роблять дерева рішень?
У Деревах рішень ми можемо зрозуміти вихідну структуру дерева, а також можемо уявити, як Дерево рішень приймає рішення. Тому дерева рішень мають пояснення (їх вихід можна пояснити легко.) Чи є у нас пояснення в нейронних мережах, як у деревах рішень?

1
Що таке 1D згортковий шар у глибокому навчанні?
Я добре розумію роль та механізм звивистих шарів у програмі Deep Learning для обробки зображень у разі двовимірної чи тривимірної реалізації - вони "просто" намагаються вловлювати 2D-шаблони у зображеннях (у 3-х каналах у випадку 3D). Але нещодавно я наткнувся на 1D згорткові шари в контексті обробки природних мов, що є …

1
Чим відрізняється одне гаряче кодування від одного кодування?
Я читаю презентацію, і вона рекомендує не використовувати кодування не залишати, але це добре з одним гарячим кодуванням. Я думав, що вони обоє однакові. Чи може хтось описати, у чому полягають відмінності між ними?

1
Забудьте прошарок у періодичній нейронній мережі (RNN) -
Я намагаюся з'ясувати розміри кожної змінної в RNN в шарі забуття, однак я не впевнений, чи я на правильному шляху. Наступна картина та рівняння - з публікації блогу Кола "Розуміння мереж LSTM" : де: є введення розміру м * 1 векторхтxtx_tm ∗ 1m∗1m*1 - прихований стан розміру n ∗ 1 …

3
Як вибрати класифікатор після перехресної перевірки?
Коли ми робимо k-кратну перехресну перевірку, чи слід просто використовувати класифікатор, який має найвищу точність тесту? Який, як правило, найкращий підхід для отримання класифікатора від перехресної перевірки?

4
Чи можемо ми скористатися використанням трансферного навчання під час навчання моделей word2vec?
Я шукаю заздалегідь підготовлену вагу вже навчених моделей, таких як дані Google News тощо. Мені було важко навчити нову модель з достатньою кількістю даних (10 Гб тощо) для себе. Отже, я хочу скористатись трансферним навчанням, в якому я міг би отримати попередньо підготовлену вагу шару та перевчити ці ваги на …

2
Етичний та економічно вигідний масштабування даних із записом масштабування
Небагато речей у житті мені приносять задоволення, як скребкування структурованих та неструктурованих даних з Інтернету та використання їх у своїх моделях. Наприклад, Інструментарій даних щодо наукових даних (або RDSTKдля програмістів R) дозволяє мені отримувати багато хороших даних, заснованих на розташуванні, використовуючи IP-адреси або адреси, а пакет tm.webmining.pluginR для tmпрямого скрабування …

3
Найкращий спосіб класифікувати набори даних із змішаними типами атрибутів
Мені хотілося б знати, який найкращий спосіб класифікувати набір даних, що складається із змішаних типів атрибутів, наприклад, текстових та числових. Я знаю, що можу перетворити текстовий в булевий, але словниковий запас різноманітний, а дані стають занадто рідкими. Я також намагався класифікувати типи атрибутів окремо і комбінувати результати за допомогою методів …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.