Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Як SVM = шаблон відповідає?
Я прочитав про SVM та дізнався, що вони вирішують оптимізаційну задачу та ідея максимальної маржі була дуже розумною. Тепер, використовуючи ядра, вони можуть знайти навіть нелінійні межі поділу, що було чудово. Поки я справді не маю уявлення, як SVM (спеціальна машина ядра) та машини ядра пов'язані з нейронними мережами? Розгляньте …

1
К-означає: Скільки ітерацій у практичних ситуаціях?
Я не маю досвіду в галузі видобутку даних або великих даних, тому хотілося б почути, як ви поділилися певним досвідом. Чи реально люди керують k-засобами, PAM, CLARA тощо на дійсно великому наборі даних? Або вони просто випадковим чином вибирають з нього зразок? Якщо вони просто беруть вибірку набору даних, чи …

1
Чому б ви передбачили модель змішаного ефекту, не враховуючи випадкових ефектів для прогнозування?
Це скоріше концептуальне запитання, але в міру використання Rя буду посилатися на пакунки в R. Якщо мета полягає у встановленні лінійної моделі для прогнозування, а потім робити прогнози, коли випадкові ефекти можуть бути недоступні, чи є користь від використання моделі змішаних ефектів, чи слід використовувати замість неї модель з фіксованим …

3
Чому в деяких випадках гамільтонівська динаміка краща за пропозицію про випадкові прогулянки в MCMC?
Гамільтонова динаміка завжди перевершує, ніж випадкова хода в алгоритмі Метрополіса в деяких випадках. Чи може хтось пояснити причину простими словами без зайвої математики?
10 mcmc 

3
Функція втрати для смислової сегментації
Вибачає за нецільове використання технічних термінів. Я працюю над проектом семантичної сегментації за допомогою конволюційних нейронних мереж (CNN); намагаючись реалізувати архітектуру типу Encoder-Decoder, тому вихід має той же розмір, що і вхідний. Як ви проектуєте етикетки? Яку функцію втрат слід застосувати? Особливо в умовах важкої нерівноваги класу (але співвідношення між …

2
Регульований індекс Rand vs коригувана взаємна інформація
Я намагаюся оцінити ефективність кластеризації. Я читав документацію по вивченню skiscit на метриках . Я не розумію різниці між ARI та AMI. Мені здається, що вони роблять одне й те саме двома різними способами. Посилаючись на документацію: Враховуючи знання присвоєння основного класу правди labels_true та призначення алгоритму кластеризації одних і …

2
У нормальних та біноміальних моделях чи завжди задня дисперсія менша за попередню дисперсію?
Або які умови це гарантують? Взагалі (і не тільки нормальні та біноміальні моделі) я вважаю, що головна причина, яка порушила цю заяву, полягає в тому, що між моделлю вибірки та попередньою є невідповідність, але що ще? Я починаю з цієї теми, тому дуже ціную легкі приклади

1
Лівостороння та права бічна номенклатура в регресійних моделях
y=β0+β1x1+ε0y=β0+β1x1+ε0y = \beta_{0} + \beta_{1}x_{1} + \varepsilon_{0} Мова для опису регресійних моделей, така як дуже проста лінійна регресія, зазначена вище, часто змінюється, і такі зміни часто несуть тонкі зрушення в значеннях. Наприклад, частина моделі в лівій частині рівняння може називатися (серед інших я не знаю) конотаціями та позначеннями в дужках: …

2
Центральна гранична теорема для ланцюгів Маркова
\newcommand{\E}{\mathbb{E}}\newcommand{\P}{\mathbb{P}} Центральна гранична теорема (CLT) зазначає, що для незалежні та однаково розподілені (iid) з і \ ім'я оператора {Var} (X_i) <\ infty , сума переходить у звичайний розподіл як n \ to \ infty : \ sum_ {i = 1} ^ n X_i \ в N \ зліва ( 0, …

1
RNN з регуляризацією L2 припиняє навчання
Я використовую двонаправлений RNN для виявлення події незбалансованого виникнення. Позитивний клас у 100 разів рідше, ніж негативний. Хоча не використовую регуляризацію, я можу отримати 100% точність на наборі поїздів і 30% на комплект перевірки. Я включаю регуляризацію l2, і результат - лише 30% точність на поїзді, а не довше навчання …

1
Комплексний аналіз, функціональний аналіз для глибшого розуміння машинного навчання
Я хочу заглибитися в машинне навчання (теорія та застосування у фінансах). Хочу запитати, наскільки релевантні комплексний аналіз та функціональний аналіз як основа машинного навчання? Чи потрібно мені вивчати ці предмети чи слід зосередитись на іншій темі (якщо так, то на якій?)

3
Розрахунок розподілу від хв, середнього та макс
Припустимо, у мене є мінімальний, середній та максимум деякого набору даних, скажімо, 10, 20 та 25. Чи є спосіб: створити розподіл з цих даних та знати, який відсоток населення, ймовірно, лежить вище або нижче середнього Редагувати: Згідно з пропозицією Глена, припустимо, у нас розмір вибірки 200.

4
Найкращий спосіб посіяти N незалежних генераторів випадкових чисел з 1 значення
У моїй програмі мені потрібно запустити N окремих потоків, кожен з яких має власний RNG, який використовується для вибірки великого набору даних. Мені потрібно мати можливість зафіксувати весь цей процес одним значенням, щоб я міг відтворити результати. Чи достатньо просто послідовно збільшувати насіння для кожного показника? В даний час я …

2
Часто визначення визначення ймовірності; чи існує формальне визначення?
Чи є якесь формальне (математичне) визначення того, що часто розуміють лікарі під "вірогідністю". Я читав, що це відносна частота виникнення '' в довгостроковій перспективі '', але чи є якийсь формальний спосіб її визначити? Чи є якісь відомі посилання, де я можу знайти це визначення? Редагувати: Під часткою (див. Коментар @whuber …

2
Тестування припущення про пропорційну небезпеку в параметричних моделях
Мені відомо про тестування припущення про пропорційну небезпеку в контексті моделей Cox PH, але я не зустрічав нічого, що стосується параметричних моделей? Чи можливий спосіб перевірити припущення щодо PH для певних параметричних моделей? Схоже, слід враховувати, що параметричні моделі лише трохи відрізняються від напівпараметричних моделей Кокса? Наприклад, якби я хотів …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.