Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Статистична криміналістика: Бенфорд та за його межами
Які існують широкі методи виявлення шахрайства, аномалій, підробок тощо у наукових працях, створених третьою стороною? (Мене спонукало запитати про це нещодавньою справою Марка Хаузера .) Зазвичай для фальсифікації виборів та бухгалтерського обліку цитується якийсь варіант Закону Бенфорда . Я не впевнений, як це може бути застосовано, наприклад, до випадку Марка …

3
Як обчислити p-значення параметрів для моделі ARIMA в R?
Роблячи дослідження часових рядів в R, я виявив, що arima передбачає лише значення коефіцієнтів та їх стандартні похибки встановленої моделі. Однак я також хочу отримати p-значення коефіцієнтів. Я не знайшов жодної функції, яка б забезпечувала значення кофе. Тому я хочу сам обчислити його, але я не знаю ступеня свободи в …

5
Альтернативи деревам класифікації з кращою прогнозованою (наприклад: CV) роботою?
Я шукаю альтернативу Класифікаційним деревам, яка могла б дати кращу прогнозовану здатність. Дані, з якими я маю справу, мають фактори як для пояснювальних, так і для пояснених змінних. Я пам’ятаю, що в цьому контексті натрапляв на випадкові ліси та нейронні мережі, хоч ніколи раніше не пробував їх, чи є ще …


2
Кластеризація змінних на основі співвідношень між ними
Запитання: У мене є велика кореляційна матриця. Замість кластеризації окремих кореляцій я хочу кластеризувати змінні на основі їх співвідношень один з одним, тобто якщо змінні A і змінна B мають аналогічні кореляції зі змінними C до Z, то A і B повинні бути частиною одного кластеру. Хорошим прикладом реального життя …

9
Часовий ряд для даних лічильників, підрахунок <20
Нещодавно я почав працювати в клініці з туберкульозу. Періодично ми зустрічаємось, щоб обговорити кількість випадків захворювання на туберкульоз, які ми зараз лікуємо, кількість проведених тестів тощо. Я хотів би почати моделювати ці показники, щоб ми не просто здогадувались, чи є щось незвичне чи ні. На жаль, я мало навчався у …

5
Що не так з цим "наївним" алгоритмом переміщення?
Це подальше запитання щодо Stackoverflow щодо випадкового переміщення масиву . Існують встановлені алгоритми (такі як Knuth-Fisher-Yates Shuffle ), які слід використовувати для переміщення масиву, а не покладатися на "наївні" спеціальні реалізації. Мені зараз цікаво довести (або спростувати), що мій наївний алгоритм порушений (як у: не створює всіх можливих перестановок з …

1
Які саме механізми уваги?
Механізми уваги були використані в різних документах поглибленого навчання за останні кілька років. Ілля Суцкевер, керівник досліджень Open AI, захоплено похвалив їх: https://towardsdatascience.com/the-fall-of-rnn-lstm-2d1594c74ce0 Евгеніо Кулурчелло з університету Пердю заявив, що RNN та LSTM повинні бути відмовлені на користь суто нейронних мереж, орієнтованих на увагу: https://towardsdatascience.com/the-fall-of-rnn-lstm-2d1594c74ce0 Це здається перебільшенням, але безперечно, …

1
Пояснення min_child_weight в алгоритмі xgboost
Визначення з min_child_weight параметра в xgboost задається як: мінімальна сума ваги екземпляра (гессіана), необхідна дитині. Якщо на етапі розділу дерева з’явиться вузол аркуша із сумою ваги екземпляра менше min_child_weight, тоді процес побудови відмовиться від подальшого розподілу. У режимі лінійної регресії це просто відповідає мінімальній кількості екземплярів, необхідних для кожного вузла. …

1
Гамільтоніан Монте-Карло проти послідовного Монте-Карло
Я намагаюся відчути відносні достоїнства та недоліки, а також різні області застосунку цих двох схем MCMC. Коли ви використовували б які і чому? Коли один може вийти з ладу, а інший - ні (наприклад, де застосовується HMC, але SMC немає, і навпаки) Чи міг би один, дуже наївно наданий, застосувати …

2
Чому існує дві різні логістичні формулювання втрат / позначень?
Я бачив два типи формулювання логістичних втрат. Ми можемо легко показати, що вони однакові, єдиною різницею є визначення мітки yyy . Формулювання / позначення 1, y∈{0,+1}y∈{0,+1}y \in \{0, +1\} : L(y,βTx)=−ylog(p)−(1−y)log(1−p)L(y,βTx)=−ylog⁡(p)−(1−y)log⁡(1−p) L(y,\beta^Tx)=-y\log(p)-(1-y)\log(1-p) де p=11+exp(−βTx)p=11+exp⁡(−βTx)p=\frac 1 {1+\exp(-\beta^Tx)} , де логістична функція відображає дійсне числоβTxβTx\beta^T xна 0,1 інтервал. Формулювання / позначення 2, …

3
Чи високий
Це питання було переміщено із програми переповнення стека, оскільки на нього можна відповісти на перехресному підтвердженні. Мігрували 4 роки тому . У статистиці ми робимо лінійні регресії, самі їх початки. Загалом ми знаємо, що чим вище тим краще, але чи колись існує сценарій, коли високий був би марною моделлю?R 2R2R2R^2R2R2R^2

2
Чому Laplace раніше виробляє розріджені рішення?
Я переглядав літературу про регуляризацію, і часто бачу абзаци, що пов'язують регулятизацію L2 з Гауссовим попереднім, а L1 з Лапласом, орієнтованим на нуль. Я знаю, як виглядають ці пріори, але я не розумію, як це означає, наприклад, ваги в лінійній моделі. У L1, якщо я правильно розумію, ми очікуємо, що …

3
Координатний та градієнтний спуск
Мені було цікаво, які різні випадки використання для двох алгоритмів, Координатного спуску та Градієнтного Спуску . Я знаю, що спуск координат має проблеми з негладкими функціями, але він використовується в популярних алгоритмах, таких як SVM і LASSO. Однак градієнтний спуск, на мою думку, застосовується ширше, особливо при відродженні ANN та …

3
AIC проти перехресної перевірки у часових рядах: невеликий зразок зразка
Мене цікавить вибір моделі в налаштуваннях часових рядів. Для конкретності, припустимо, я хочу вибрати модель ARMA з пулу моделей ARMA з різними порядками відставання. Кінцевим наміром є прогнозування . Вибір моделі може здійснити компанія перехресне підтвердження, використання інформаційних критеріїв (AIC, BIC), серед інших методів. Роб Дж. Хайндман пропонує спосіб зробити …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.