Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
R нейроннет - обчислення дають постійну відповідь
Я намагаюся використовувати neuralnetпакет R (документація тут ) для прогнозування. Ось що я намагаюся зробити: library(neuralnet) x <- cbind(runif(50, min=1, max=500), runif(50, min=1, max=500)) y <- x[, 1] * x[, 2] train <- data.frame(x, y) n <- names(train) f <- as.formula(paste('y ~', paste(n[!n %in% 'y'], collapse = ' + '))) …

5
Математичний фон для нейронних мереж
Не впевнений, чи підходить це для цього сайту, але я починаю свій магістр MSE з інформатики (бакалавра прикладної математики) і хочу отримати сильний досвід в машинному навчанні (я, швидше за все, збираюся здобути ступінь доктора наук). Одним із моїх підінтересів є нейронні мережі. Що є хорошим математичним підґрунтям для ANN? …

1
Очікувана кількість разів, коли емпіричне середнє значення перевищить значення
Враховуючи послідовність iid випадкових величин, скажімо, для , я намагаюся пов'язати очікувану кількість разів емпіричного середнього перевищить значення, , оскільки ми продовжуємо малювати зразки, тобто: Xi∈[0,1]Xi∈[0,1]X_i \in [0,1]i=1,2,...,ni=1,2,...,ni = 1,2,...,n1n∑ni=1Xi1n∑i=1nXi\frac{1}{n}\sum_{i=1}^n X_ic≥0c≥0c \geq 0T=def∑j=1nP({1j∑i=1jXi≥c})T=def∑j=1nP({1j∑i=1jXi≥c}) \mathcal{T} \overset{def}{=} \sum_{j=1}^n \mathbb{P} \left(\left\{ \frac{1}{j}\sum_{i=1}^j X_i \geq c\right\}\right) Якщо припустити, що для деяких , ми можемо …

3
Як проектувати простір високого розміру в двовимірну площину?
У мене є набір точок даних у N-мірному просторі. Крім того, у мене також є центроїд в цьому ж N-мірному просторі. Чи є підходи, які можуть дозволити мені проектувати ці точки даних у двовимірний простір, зберігаючи їх відносну інформацію про відстань у вихідному просторі. PCA є правильним?

1
Варіант річної віддачі на основі дисперсії щомісячної віддачі
Я намагаюся зрозуміти всю дисперсію / строкову помилку часового ряду фінансових доходів, і я думаю, що я застряг. У мене є серія щомісячних даних про повернення запасів (назвемо це ), яка очікувала значення 1,00795 та дисперсію 0,000228 (std. Dev - 0,01512). Я намагаюся обчислити найгірший випадок щорічної віддачі (скажімо, очікуване …

2
Показники коваріаційних матриць: недоліки та сильні сторони
Які "найкращі" показники для матриць коваріації та чому? Мені зрозуміло, що Frobenius & c не підходять, і параметризації кутів також мають свої проблеми. Інтуїтивно можна отримати компроміс між цими двома, але я також хотів би знати, чи є інші аспекти, які слід пам’ятати і, можливо, добре встановлені стандарти. Загальні показники …

1
Розрахунок поліноміальних контрастних змінних
Будь ласка, дайте мені уявлення про те, як ефективно переконувати категоричну змінну (фактор) у набір ортогональних контрастних змінних поліном. Для багатьох типів змінних контрастів (наприклад, відхилення, проста, Гельмерта тощо) пропуск: Складіть матрицю коефіцієнтів контрасту, що відповідає типу. Повернути або узагальнити-обернути його, щоб отримати матрицю кодів. Наприклад: Suppose there is 3-group …

1
Багатоозброєний бандит для загального розподілу нагород
Я працюю над багатогранною бандитською проблемою, де у нас немає інформації про розподіл винагород. Я знайшов багато паперів, які гарантують межі жалю для розподілу з відомим обмеженням, а також для загальних дистрибутивів із підтримкою в [0,1]. Я хотів би дізнатися, чи існує спосіб успіху в умовах, коли розподіл винагород не …

2
Які відстані між змінними, що складають коваріаційну матрицю?
Я маю коваріаційну матрицю і хочу розділити змінні на кластери за допомогою ієрархічної кластеризації (наприклад, для сортування матриці коваріації).kn × nн×нn \times nккk Чи існує типова функція відстані між змінними (тобто між стовпцями / рядками матриці квадратної коваріації)? Або якщо їх більше, чи є хороша довідка по темі?

3
Інтервал довіри для добутку двох параметрів
Припустимо, у нас є два параметри, і . У нас також є два максимальних оцінювача ймовірності і і два довірчих інтервалу для цих параметрів. Чи є спосіб побудувати інтервал довіри для ?p 2 ^ p 1 ^ p 2 p 1 p 2p1p1p_1p2p2p_2p1^p1^\hat{p_1}p2^p2^\hat{p_2}p1p2p1p2p_1p_2

1
Вибірковий розподіл коефіцієнтів регресії
Раніше я дізнався про вибіркові розподіли, які давали результати, що стосуються оцінки, з точки зору невідомого параметра. Наприклад, для вибіркових розподілів та в моделі лінійної регресії β 1Уя=βпро+β1Xя+εяβ^0β^0\hat\beta_0β^1β^1\hat\beta_1Yi=βo+β1Xi+εiYi=βo+β1Xi+εiY_i = \beta_o + \beta_1 X_i + \varepsilon_i β^0∼N(β0, σ2(1n+x¯2Sxx))β^0∼N(β0, σ2(1n+x¯2Sxx)) \hat{\beta}_0 \sim \mathcal N \left(\beta_0,~\sigma^2\left(\frac{1}{n}+\frac{\bar{x}^2}{S_{xx}}\right)\right) і β^1∼N(β1, σ2Sxx)β^1∼N(β1, σ2Sxx) \hat{\beta}_1 \sim \mathcal …

2
Хвостові межі евклідової норми для рівномірного розподілу на
Які відомі верхні межі щодо того, як часто євклідова норма рівномірно вибраного елемента буде більше, ніж заданий поріг?{−n, −(n−1), ..., n−1, n}d{−n, −(n−1), ..., n−1, n}d\:\{-n,~-(n-1),~...,~n-1,~n\}^d\: Мене в основному цікавлять межі, які сходяться експоненціально до нуля, коли набагато менше .nnnddd

1
Показник оцінки прогнозу для панельних / поздовжніх даних
Мені хотілося б оцінити кілька різних моделей, які забезпечують передбачення поведінки на щомісячному рівні. Дані збалансовані, і 100 000 і T = 12. Результат відвідує концерт у визначеному місяці, тож він дорівнює нулю для ~ 80% людей у ​​будь-якому місяці, але довгий правий хвіст важких користувачів. Прогнози, які я маю, …

2
Чи є тест і однобічний ANOVA обидва тести Вальда?
t-тест для перевірки того, чи є середнє значення нормально розподіленого зразка рівним константі, є тестом Вальда шляхом оцінки стандартного відхилення середнього зразка за інформацією рибалки про нормальне розподіл на середньому зразку. Але тестова статистика в t-тесті має розподіл t-студента, тоді як тест-статистика в асимптотичному тесті Уолда має розподіл c-квадрата. Цікаво, …

2
Порівняйте класифікатори на основі AUROC чи точності?
У мене є проблема бінарної класифікації, і я експериментую на ній з різними класифікаторами: я хочу порівняти класифікатори. який з них є кращим показником AUC або точності? І чому? Raondom Forest: AUC: 0.828 Accuracy: 79.6667 % SVM: AUC: 0.542 Accuracy: 85.6667 %

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.