Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Приклади реального життя різниці між незалежністю та кореляцією
Добре відомо, що незалежність випадкових величин передбачає нульову кореляцію, але нульова кореляція не потребує незалежності. Я натрапив на безліч математичних прикладів, що демонструють залежність, незважаючи на нульову кореляцію. Чи є приклади реального життя, які підтверджують цей факт?

1
Приклади реального життя неефективного генератора випадкових чисел
Всі ми знаємо, що Генератори випадкових чисел на комп’ютерах не генерують справжні випадкові числа, а натомість генерують псевдовипадкові числа. Також деякі RNG краще, ніж інші, а деякі реалізуються краще, ніж інші. Наведіть декілька прикладів, коли використовувались погані РНГ або погано реалізовані РНГ, і вони були використані? Приклади, які я знайшов, …

2
Надання більшої ваги останнім спостереженням в області регресії
Як надати більше ваги останнім спостереженням в R? Я вважаю це запитанням чи бажанням, але мені важко зрозуміти, як саме це здійснити. Я намагався багато шукати для цього, але не можу знайти хорошого практичного прикладу. У моєму прикладі я мав би великий набір даних із часом. Хочу сказати, застосувати якесь …

2
Чому інформаційний критерій (не скоригований ) використовується для вибору відповідного порядку відставання у моделі часових рядів?
У моделях часових рядів, таких як ARMA-GARCH, для вибору відповідного відставання або порядку моделі використовуються різні інформаційні критерії, такі як AIC, BIC, SIC тощо. Моє запитання дуже просте, чому ми не використовуємо скоригований для вибору відповідної моделі? Ми можемо вибрати модель, яка призводить до більш високого значення скоригованого . Оскільки …

2
Вивівши градієнт одношарової нейронної мережі wrt своїх входів, що таке оператор у ланцюговому правилі?
Проблема: Отримайте градієнт щодо вхідного шару для нейронної мережі одного прихованого шару, використовуючи сигмоїд для введення -> прихований, софтмакс для прихованого -> виводу, з поперечною втратою ентропії. Я можу пройти більшу частину виведення, використовуючи правило ланцюга, але я не впевнений, як насправді "з'єднати" їх разом. Визначте деякі позначення r=xW1+b1r=xW1+b1 r …

2
Яка різниця між цими двома тестами на Бреуш-Язичники?
Використовуючи R на деяких даних і намагаючись зрозуміти, чи є мої дані гетероскедастичними, я знайшов дві реалізації тесту Брейша-Язичника , bptest (пакет lmtest) і ncvTest (пакетний автомобіль). Однак вони дають різні результати. Яка різниця між ними? Коли слід вибрати те чи інше? > model <- lm(y ~ x) > bp …

1
Простір даних, змінний простір, простір спостереження, простір моделі (наприклад, в лінійній регресії)
Припустимо, маємо матрицю даних , яка -by- , і вектор мітки , який -by-one. Тут кожен рядок матриці є спостереженням, і кожен стовпець відповідає розмірності / змінній. (припустимо )ХX\mathbf{X}нnnpppYYYнnnn > pn>pn>p Тоді що data space, variable space, observation space, model spaceзначить? Чи простір, що охоплюється вектором стовпців, є (виродженим) -D …

1
Випадкові інтервали перекриття
Як я можу знайти аналітичний вираз у наступній задачі?D(n,l,L)D(n,l,L)D(n,l,L) Я випадковим чином опускаю "брусків" довжиною в проміжок . "Бруски" можуть перекриватися. Я хотів би знайти середню загальну довжину інтервалу зайняту принаймні одним "бар".nnnlll[0,L][0,L][0,L]DDD[0,L][0,L][0,L] У межі "низької щільності" перекриття повинно бути незначним і . У «високої щільності» межа, наближається . Але …

1
Нормалізація введення для нейронів ReLU
Згідно з "Efficient Backprop" від LeCun et al. (1998), є хорошою практикою нормалізувати всі входи, щоб вони були зосереджені навколо 0 і лежали в межах максимальної другої похідної. Так, наприклад, ми використали [-0,5,0,5] для функції "Tanh". Це допоможе досягти прогресу в просуванні, коли гессея стає стабільнішою. Однак я не був …

1
Як можна формалізувати попередній розподіл ймовірностей? Чи є правила, які слід використовувати?
Хоча мені подобається думати, що я добре розумію концепцію попередньої інформації в байєсівському статистичному аналізі та прийнятті рішень, у мене часто виникають проблеми з обгортанням голови навколо її застосування. Я маю на увазі пару ситуацій, які є прикладом моєї боротьби, і я вважаю, що вони не належним чином розглядаються в …

4
Інтерпретація значення AIC
Типові значення AIC, які я бачив для логістичних моделей, є тисячами, принаймні сотнями. наприклад, на http://www.r-bloggers.com/how-to-perform-a-logistic-regression-in-r/ AIC становить 727,39 Хоча завжди кажуть, що AIC слід використовувати лише для порівняння моделей, я хотів зрозуміти, що означає конкретне значення AIC. Відповідно до формули, AIC=−2log(L)+2KAIC=−2log⁡(L)+2KAIC= -2 \log(L)+ 2K Де L = максимальна ймовірність …

1
Топології, для яких ансамбль розподілів ймовірностей завершений
Я досить багато боровся з узгодженням свого інтуїтивного розуміння розподілу ймовірностей із дивними властивостями, якими володіють майже всі топології розподілу ймовірностей. Наприклад, розглянемо випадкову змінну суміші : виберемо Гаусса з центром у 0 з відхиленням 1 та з ймовірністю додати до результату. Послідовність таких випадкових змінних сходилася б (слабко і …

2
Найкраще використовувати LSTM для прогнозування подій послідовності
Припустимо наступну 1 розмірну послідовність: A, B, C, Z, B, B, #, C, C, C, V, $, W, A, % ... Букви A, B, C, ..тут представляють "звичайні" події. Символи #, $, %, ...тут представляють "особливі" події Тимчасовий проміжок між усіма подіями неоднаковий (що завгодно від секунд до днів), хоча …

2
Вузьке місце застосування глибокого навчання на практиці
Прочитавши багато робіт з глибокого вивчення, таке грубе відчуття, що існує багато хитрощів у навчанні мережі, щоб досягти кращої, ніж звичайної, продуктивності. З точки зору галузевого застосування, дуже важко розробити подібні хитрощі, за винятком тих елітних дослідницьких груп у великих технологічних компаніях, наприклад, google або facebook. Тоді який найкращий спосіб …

3
Якщо
Це не домашнє завдання. Нехай XXX - випадкова величина. Якщо E[X]=k∈RE[X]=k∈R\mathbb{E}[X] = k \in \mathbb{R} та Var[X]=0Var[X]=0\text{Var}[X] = 0 , чи випливає, що Pr(X=k)=1Pr(X=k)=1\Pr\left(X = k\right) = 1 ? Інтуїтивно це здається очевидним, але я не впевнений, як би це довів. Я знаю фактично, що з припущень випливає, що E[X2]=k2E[X2]=k2\mathbb{E}[X^2] …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.