Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Чому функція bootstrap scikit-learn переутворює тестовий набір?
Під час використання завантажувальної програми для оцінки моделі, я завжди вважав, що зразки з мішків безпосередньо використовуються як тестовий набір. Однак, як видається, це не стосується застарілого підходу наукової роботиBootstrap , який, здається, будує тестовий набір із малювання із заміною із підмножини даних із пакета. Які статистичні міркування стоять за …

1
Перетворення стандартизованих бета-версій до оригінальних змінних
Я розумію, що це, мабуть, дуже просте запитання, але після пошуку я не можу знайти відповідь, яку шукаю. У мене є проблема, коли мені потрібно стандартизувати виконання змінних (регресія хребта), щоб обчислити оцінки хребта бета. Потім мені потрібно перетворити їх назад у початкову шкалу змінних. Але як це зробити? Я …

4
Як генерувати випадкові категоричні дані?
Скажімо, у мене є категоріальна змінна, яка може приймати значення A, B, C і D. Як я можу генерувати 10000 випадкових точок даних і контролювати частоту кожного? Наприклад: A = 10% B = 20% C = 65% D = 5% Будь-які ідеї, як я можу це зробити?

2
Функції впливу та OLS
Я намагаюся зрозуміти, як працюють функції впливу. Чи може хтось пояснити в контексті простої регресії OLS yi=α+β⋅xi+εiyi=α+β⋅xi+εi\begin{equation} y_i = \alpha + \beta \cdot x_i + \varepsilon_i \end{equation} де я хочу функцію впливу для .ββ\beta

1
Яка «ємність» моделі машинного навчання?
Я вивчаю цей Навчальний посібник з різних автоінкодерів Карла Доерша . На другій сторінці зазначено: Однією з найпопулярніших таких фреймворків є Variational Autoencoder [1, 3], тема цього підручника. Припущення цієї моделі слабкі, і навчання проходить швидко за допомогою зворотного розповсюдження. VAE роблять наближення, але помилка, введена цим наближенням, мабуть, невелика …

2
Максимальна середня розбіжність (розподіл відстані)
У мене є два набори даних (вихідні та цільові дані), які слідують за різним розподілом. Я використовую MMD - це непараметричний розподіл відстані - для обчислення граничного розподілу між вихідними та цільовими даними. вихідні дані, Xs цільові дані, Xt адаптаційна матриця A * Прогнозовані дані, Zs = A '* Xs …

1
RNN: Коли застосовувати BPTT та / або оновлювати ваги?
Я намагаюся зрозуміти застосування високого рівня RNN для маркування послідовностей через (серед інших) документ Graves '2005 про класифікацію фонеми. Підсумовуючи проблему: у нас є великий навчальний набір, що складається з (вхідних) аудіофайлів з одиночних пропозицій та (вихідних) часу початку роботи, часу зупинки та міток для окремих фонем (включаючи декілька "спеціальних" …
15 lstm  rnn 


2
Чи може рівняння змінного інструменту записати у вигляді спрямованого ациклічного графіка (DAG)?
Направлені ациклічні графіки (DAG) - це ефективні візуальні уявлення про якісні причинно-наслідкові припущення в статистичних моделях, але чи можна їх використовувати для подання звичайного приладового змінного рівняння (або інших рівнянь)? Якщо так, то як? Якщо ні, то чому?

1
Як працює L-BFGS?
Метою статті була оптимізація деяких параметрів шляхом максимальної регульованості вірогідності журналу. Потім вони обчислюють Часткові похідні. Потім автори згадують, що вони оптимізують рівняння за допомогою L-BFGS, стандартної квазі-ньютонівської процедури для оптимізації гладких функцій багатьох змінних (більше деталей). Як це працює ?

4
Безкоштовний хостинг даних для громадських інтересів? [зачинено]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 4 роки тому . У мене є погодинний та щоденний звіт про температуру для багатьох станцій на http://data.barrycarter.info/ Я закликаю людей завантажувати його, але, на 6.6G, …
14 dataset 

1
Чому вони вибирали б тут розповсюдження гамми?
В одній із вправ мого курсу ми використовуємо медичний набір даних Kaggle . Вправа говорить: ми хочемо моделювати розподіл індивідуальних зарядів, і ми також дійсно хочемо мати можливість виявити нашу невизначеність щодо цього розподілу, щоб ми могли краще зафіксувати діапазон значень, який ми можемо побачити. Завантаження даних та виконання початкового …

3
Як виміряти статистичну "відстань" між двома частотними розподілами?
Я займаюся проектом аналізу даних, який передбачає вивчення часу використання веб-сайтів протягом року. Що я хотів би зробити, це порівняти, наскільки "послідовними" є схеми використання, скажімо, наскільки вони близькі до тієї схеми, яка передбачає використання її протягом 1 години один раз на тиждень, або тієї, що передбачає використання її протягом …

1
Як називається середнє значення найбільших і найменших значень у заданому наборі даних?
Як ви називаєте статистичне середнє значення, яке обчислюється від верхньої та нижньої крайностей у будь-якому даному наборі даних? Наприклад, якщо у вас є набір: { -2, 0 , 8, 9, 1, 50, -2, 6} Верхня крайність цього набору є, 50а нижня крайність - -2. Отже, середнє значення буде крайнім(-2 + …

2
Чи робить Вольфрам Mathworld помилку, описуючи дискретний розподіл ймовірностей з функцією густини ймовірностей?
Зазвичай розподіл ймовірності на дискретні змінні описується за допомогою функції масової ймовірності (PMF): Працюючи з безперервними випадковими змінними, ми описуємо розподіли ймовірностей за допомогою функції щільності ймовірностей (PDF), а не функції масової ймовірності. - Глибоке навчання Гудффелла, Бенджо та Курвіля Однак Wolfram Mathworld використовує PDF для опису розподілу ймовірностей по …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.