Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Застосування машинного навчання для фільтрації DDoS
У курсі машинного навчання Стенфорда Ендрю Нг згадав про застосування ML в ІТ. Через деякий час, коли я отримав DDoS середнього розміру (близько 20k ботів) на нашому сайті, я вирішив боротися з ним, використовуючи простий класифікатор Neural Network. Я написав цей сценарій python приблизно за 30 хвилин: https://github.com/SaveTheRbtz/junk/tree/master/neural_networks_vs_ddos Він використовує …

2
Прогнозування декількох цілей або класів?
Припустимо, я будую модель прогнозування, де я намагаюся передбачити кілька подій (наприклад, як перекидання штампів, так і метання монети). Більшість алгоритмів, які мені знайомі з роботою лише з однією ціллю, тому мені цікаво, чи існує стандартний підхід до подібного роду речей. Я бачу два можливі варіанти. Мабуть, найбільш наївним підходом …

2
Домен-агностична особливість інженерії, яка зберігає смислове значення?
Техніка особливостей часто є важливою складовою для машинного навчання (її активно використовували, щоб виграти Кубок KDD у 2010 році ). Однак я вважаю, що і більшість технічних методів знищити будь-яке інтуїтивне значення основних рис або дуже специфічні для певного домену або навіть конкретних типів функцій. Класичним прикладом першого є аналіз …


2
Регулювання р-значення для адаптивного послідовного аналізу (для квадратного тесту чі)?
Я хотів би знати, яка статистична література є актуальною для наступної проблеми, і, можливо, навіть ідея, як її вирішити. Уявіть таку проблему: У нас є 4 можливі методи лікування якогось захворювання. Для того, щоб перевірити, яке лікування краще, ми проводимо спеціальне випробування. У судовому процесі ми починаємо з відсутності суб'єктів, …


1
Розуміння відсутності теореми про вільний обід у Класифікації класифікацій Дуда та ін
У мене є кілька питань по приводу позначень , використовуваних в розділі 9.2 Відсутності початкового переваги будь-якого класифікатора в Дуда, хартії і Лелека розпізнаванню . Спочатку дозвольте процитувати якийсь відповідний текст із книги: Для простоти розглянемо двокатегорійну задачу, де навчальний набір складається з шаблонів та пов'язаних з ними міток категорії …

2
SVM, змінна взаємодія та дані тренувань підходять
У мене є 2 загальних / більше теоретичних питання. 1) Мені цікаво, як SVM обробляють змінні взаємодії під час побудови прогнозних моделей. Наприклад, якщо у мене є дві функції f1 і f2, і ціль залежить від f1, f2, і скажімо, f1 * f2 (або якась функція h (f1, f2)), чи …

1
Назва середньої абсолютної помилки, аналог балу Brier?
Вчорашнє запитання Визначте точність моделі, яка оцінює ймовірність події, мене цікавить оцінка ймовірності. Оцінка Brier - середній показник помилки у квадраті. Чи вимірює аналогічне середнє значення абсолютної похибки маєте також ім’я?1N∑i = 1N( р р е дi c t i o ni- р е фe r e n c ei)21N∑i=1N(prегicтiонi-rеfеrенcеi)2\frac{1}{N}\sum\limits …

1
Визначте точність моделі, яка оцінює ймовірність події
Я моделюю подію з двома результатами, a і b. Я створив модель, яка оцінює ймовірність того, що відбудеться або a, або b (тобто модель обчислить, що a відбудеться з 40% шансом, а b відбудеться з 60% шансом). Я маю великий запис результатів випробувань із оцінками моделі. Я хотів би оцінити, …


3
Обчислення режиму вибірки даних від безперервного розподілу
Які найкращі методи пристосування "режиму" даних, вибірених із безперервного розповсюдження? Оскільки режим є технічно невизначеним (правда?) Для безперервного розповсюдження, я справді запитую "як ти знаходиш найпоширеніше значення"? Якщо ви припускаєте, що батьківський розподіл є гауссовим, ви можете поповнити дані і знайти, скажімо, що режим - це місце біна з найбільшою …

3
Ілюстративні набори даних та аналіз для багаторівневого моделювання
Нещодавно я пройшов вступний курс з багаторівневого моделювання. Більшість використовуваних нами наборів даних та прикладів були з соціальних наук. Щойно я пройшов 2-тижневе стажування у відділі біостатики, де вони хочуть, щоб я розпочав проект щодо зміни на стаціонарі рівня пацієнтів на екстрений стан, який має високий рівень смертності, як між …


2
Що робити, коли деякі моменти часу сильно перекосили відповіді, а деякі - у повторному дослідженні заходів?
Як правило, коли стикаються з безперервними, але перекошеними заходами результатів у поздовжньому дизайні (скажімо, з одним ефектом між суб'єктами), загальним підходом є перетворення результату на нормальність. Якщо ситуація екстремальна, наприклад, із усіченими спостереженнями, можна пофантазувати і скористатися моделлю кривої зростання Тобіта чи якоюсь такою. Але я в збитку, коли бачу …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.