Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

5
Середнє значення вибраного штампу з нескінченного ряду рулонів
Якщо я перекидаю пару кубиків нескінченну кількість разів і завжди вибираю більш високе значення двох, чи очікуване середнє значення найвищих значень перевищить 3,5? Здавалося б, це повинно бути, оскільки якщо я прокачу мільйон кубиків і щоразу вибираю найвищу цінність, шанси переважають, що в кожному рулоні будуть доступні шістдесят. Таким чином, …
13 dice 

1
Найсучасніша у спільній фільтрації
Я працюю над проектом спільної фільтрації (CF), тобто заповнюю частково спостережувану матрицю або загалом тензор. Я новачок у цій галузі, і для цього проекту в кінцевому підсумку я повинен порівняти наш метод з іншими відомими, які сьогодні пропонуються запропоновані методи проти них, а саме - найсучасніші у КФ. Мій пошук …

3
Визначення та розмежування регресійної моделі
Збентежуюче просте запитання - але, схоже, його раніше не було поставлено на перехресну перевірку: Що таке визначення регресійної моделі? Також питання підтримки, Що не є регресійною моделлю? Що стосується останнього, мене цікавлять хитрі приклади, коли відповідь не відразу очевидна, наприклад, ARIMA або GARCH.

3
Лінійна регресія: будь-який ненормальний розподіл, що дає тотожність OLS та MLE?
Це питання викликане довгим обговоренням у коментарях тут: Як лінійна регресія використовує нормальний розподіл? У звичайній лінійної регресійної моделі, для простоти тут написана тільки один провісник: Yi= β0+ β1хi+ ϵiYi=β0+β1xi+ϵi Y_i = \beta_0 + \beta_1 x_i + \epsilon_i , де хixix_i відомі константи і & ϵiϵi\epsilon_i дорівнюють нулю, середні незалежні …

7
Чи неправильно називати результати "майже" чи "дещо" значущими?
Загальний консенсус щодо аналогічного питання: Чи неправильно називати результати "високо значимими"? полягає в тому, що "високозначущий" є дійсним, хоча і неспецифічним способом опису міцності асоціації, яка має р-значення набагато нижче встановленого вами порогу значущості. Однак як щодо опису р-значень, які трохи перевищують ваш поріг? Я бачив, як деякі статті використовують …

1
Що це за діаграма?
Вибачте за розпливчасте запитання, але ця діаграма з’являється у Biddle et al. 2009 року, і я раніше не зустрічав нічого подібного. Це гістограма зі скошеними краями, іноді «рогами». Що це означає? Чи має цей тип діаграми назву? На /meta/244083/site-for-asking-about-charts я вважав, що Академія найкраще запитати.

3
центрування та масштабування фіктивних змінних
У мене є набір даних, який містить як категоричні, так і безперервні змінні. Мені порадили перетворювати категоріальні змінні у бінарні змінні для кожного рівня (тобто A_level1: {0,1}, A_level2: {0,1}) - я думаю, що деякі називають це "фіктивними змінними". З огляду на це, чи не введено в оману центр і масштабувати …

1
Контрольоване зменшення розмірності
У мене є набір даних, що складається з 15K зразків з міткою (з 10 груп). Я хочу застосувати зменшення розмірності на 2 виміри, які б враховували знання етикетки. Коли я використовую "стандартні" методи безконтрольного зменшення розмірності, такі як PCA, графік розсіювання, здається, не має нічого спільного з відомими мітками. Чи …

1
Що таке основні компоненти, що обертаються та не враховуються, враховуючи, що PCA завжди обертає осі координат?
Наскільки я розумію, основні компоненти отримуються обертанням координатних осей для вирівнювання їх до напрямків максимальної дисперсії. Тим не менш, я продовжую читати про "невратовані основні компоненти", і моє програмне забезпечення для статистики (SAS) дає мені основні компоненти, що повертаються з варімаксом, а також невратовані. Тут я плутаюся: коли ми обчислюємо …

1
Як тренувати LSTM шар глибокої мережі
Для класифікації тексту я використовую lstm та мережу перекладу каналів. Я перетворюю текст в гарячі вектори і подаю кожен в lstm, щоб я міг його узагальнити як єдине подання. Потім я подаю його в іншу мережу. Але як я треную lstm? Я просто хочу, щоб текст класифікував послідовність - чи …

3
Як саме конволюційні нейронні мережі використовують згортку замість множення матриці?
Я читав Книгу Йошуа Бенджіо про глибоке навчання, і це написано на сторінці 224: Конволюційні мережі - це просто нейронні мережі, які використовують згортку замість загального множення матриць принаймні в одному з їх шарів. однак я не був на 100% впевнений у тому, як «замінити матричне множення на згортку» в …

5
Як я можу конвертувати відстань (евклідову) в оцінку подібності
Я використовую означає кластеризацію для голосу кластера динаміків. Коли я порівнюю висловлювання з кластерними даними динаміків, я отримую (евклідову відстань) середнє спотворення. Ця відстань може бути в межах . Я хочу перетворити цю відстань у показник подібності . Підкажіть будь ласка про те, як я можу цього досягти.kkk[0,∞][0,∞][0,\infty][0,1][0,1][0,1]

1
Що таке часткова F-статистика?
Що таке часткова F-статистика? Це те саме, що частковий F-тест? Коли ви обчислите часткову F-статистику? Я припускаю, що це має відношення до порівняння регресійних моделей, але я щось не слідкую (?)

1
Чи відрізняється відповідність Cox-моделі з прошарком і взаємодією страти-коваріату від встановлення двох моделей Кокса?
У регресійному моделюванні стратегій Гаррелла (друге видання) є розділ (S. 20.1.7), де обговорюються моделі Кокса, включаючи взаємодію між коваріатом, основний вплив якого на виживання ми хочемо оцінити також (вік у прикладі нижче) та коваріат, основний ефект якого ми не хочемо оцінювати (стать у наведеному нижче прикладі). Конкретно: припустимо, що в …

1
Що таке довгострокова дисперсія?
Як визначається довгострокова дисперсія в області аналізу часових рядів? Я розумію, він використовується в тому випадку, якщо в даних є структура кореляції. Отже, наш стохастичний процес не був би сімейством iid випадкових змінних, а лише ідентично розподіленим?X1,X2…X1,X2…X_1, X_2 \dots Чи можу я мати стандартне посилання як вступ до концепції та …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.