Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Статистичний тест для перевірки, коли два подібних часових ряду починають розходитися
Щодо назви, я хотів би знати, чи існує статистичний тест, який може допомогти мені виявити значну розбіжність між двома подібними часовими рядами. Зокрема, дивлячись на рисунок нижче, я хотів би виявити, що серії починають розходитися в момент t1, тобто коли різниця між ними починає бути значною. Більше того, я б …

2
Як імітувати дані для демонстрації змішаних ефектів з R (lme4)?
Як аналог цієї посади , я працював над імітацією даних безперервними змінними, піддаючи себе кореляційним перехопленням і нахилам. Хоча є великі повідомлення на цю тему на сайті , а також за межами сайту , у мене були труднощі зустрівши , наприклад початок в кінець з змодельованих даних, паралельно простий, реальний …

1
Як пов'язані функція помилок та функція стандартного нормального розподілу?
Якщо стандартний звичайний PDF -f(x)=12π−−√e−x2/2f(x)=12πe−x2/2f(x) = \frac{1}{\sqrt{2\pi}} e^{-x^2/2} і CDF дорівнює F(x)=12π−−√∫x−∞e−x2/2dx,F(x)=12π∫−∞xe−x2/2dx,F(x) = \frac{1}{\sqrt{2\pi}} \int_{-\infty}^x e^{-x^2/2}\mathrm{d}x\,, як це перетворюється на функцію помилки ?zzz

1
Які небезпеки обчислення Пірсонових кореляцій (замість тетрахорних) для бінарних змінних у факторному аналізі?
Я займаюся дослідженнями навчальних ігор, і деякі мої поточні проекти передбачають використання даних BoardGameGeek (BGG) та VideoGameGeek (VGG) для вивчення взаємозв'язків між елементами дизайну ігор (тобто, "встановлених у Другій світовій війні", "включає кочення" ) та рейтинги гравців у цих іграх (тобто бали з 10). Кожен з цих елементів дизайну відповідає …

1
Очікуване значення iid випадкових змінних
Я натрапив на це виведення, яке я не розумію: Якщо - випадкові вибірки розміру n, взяті з сукупності середніх та дисперсії , то μ σ 2Х1, X2, . . . , XнХ1,Х2,...,ХнX_1, X_2, ..., X_nмкмк\muσ2σ2\sigma^2 Х¯= ( X1+ X2+...+Xn) / нХ¯=(Х1+Х2+...+Хн)/н\bar{X} = (X_1 + X_2 + ... + X_n)/n Е( …

2
Математичне визначення асимптотики заливки
Я пишу статтю, яка використовує непосильну асимптотику, і один з моїх рецензентів попросив надати чітке математичне визначення того, що таке асимптотика заповнення (тобто з математичними символами та позначеннями). Я, здається, не знайшов жодної у літературі і сподівався, що хтось може або вказати мені в бік когось, або дати мені власне …

2
Чи можна використовувати аналіз основних компонентів щодо цін акцій / нестаціонарних даних?
Я читаю приклад, наведений у книзі " Машинне навчання для хакерів" . Я спершу детальніше деталізую на прикладі, а потім поговору про своє запитання. Приклад : Бере набір даних за 10 років цін на акції. Працює PCA за цінами на 25 акцій. Порівняє головний компонент з індексом Dow Jones. Зауважує …

2
Який розподіл кардинальності перетину незалежних випадкових вибірок без заміни?
п ∈ N 1 , 2 , . . . , a m nSSS - деякий набір з елементами , а закріплені додатні цілі числа, менші або рівні .n∈Nn∈Nn\in\mathbb{N}a1,a2,...,ama1,a2,...,ama_1,a_2,...,a_mnnn Оскільки елементи однаково вірогідні, зразки окремо і незалежно витягуються з без заміни, розміри яких відповідно становлять .SSSmmmL1,L2,...,LmL1,L2,...,LmL_1, L_2,...,L_m1 , 2 , …

2
Що саме означає позначення?
Що означає позначення (крапка над тильдою) у такому контексті, як ?∼˙∼˙\dot\simx∼˙N(0,1)x∼˙N(0,1)x \mathrel{\dot\sim} \mathcal N(0,1) Виявляється, простіше знайти, як правильно його ввести : tex.SE пояснює, що слід вводити, \mathrel{\dot\sim}а не просто \dot\simвиправляти проблему з інтервалом - ніж шукати, що це насправді означає. Досі він використовувався лише 4 рази на CV; це …

3
Які статистичні методи я можу використовувати, щоб знайти популярні чи поширені комбінації категоричних змінних?
Я роблю дослідження щодо використання багатолікарських препаратів. У мене є набір даних про 400 наркоманів, які кожен заявляв про наркотики, які вони зловживають. Існує більше 10 препаратів, а значить, можливі великі комбінації. Я переписав більшість наркотиків, які вони вживають у бінарні змінні (тобто героїн - 1, якщо наркоман зловживав героїном …


3
Як читати p, d і q з auto.arima ()?
Як я можу отримати p,d and qзначення в ARIMA(p,d,q)моделі, оцінені auto.arima(mytimeseries)? arima_model <- auto.arima (mytimeseries, ic = 'bic') Якщо ми подивимось на вихід arima_model $ arma ми отримуємо, [1] 1 0 0 0 1 2 0 Яке значення цифр відображається у наведеній вище послідовності?
10 r  arima 

1
Логістична регресія проти чи-квадрата в таблицях на випадок 2х2 та Ix2 (один фактор - двійковий відповідь)?
Я намагаюся зрозуміти використання логістичної регресії в таблицях на випадок 2–2 та Ix2. Наприклад, використовуючи це як приклад Яка різниця між використанням тесту чи-квадрата та використанням логістичної регресії? Як щодо таблиці з декількома номінальними коефіцієнтами (таблиця Ix2) на зразок цієї: Існує аналогічне питання тут - але відповідь в основному , …

1
Як кернелізувати простий перцептрон?
Задачі класифікації з нелінійними межами не можуть бути вирішені простим перцептроном . Наступний код R має ілюстративні цілі та заснований на цьому прикладі в Python): nonlin <- function(x, deriv = F) { if (deriv) x*(1-x) else 1/(1+exp(-x)) } X <- matrix(c(-3,1, -2,1, -1,1, 0,1, 1,1, 2,1, 3,1), ncol=2, byrow=T) y …

1
Що розуміється під PCA збереженням лише великих парних відстаней?
Зараз я читаю техніку візуалізації t-SNE, і було зазначено, що одним із недоліків використання аналізу основних компонентів (PCA) для візуалізації високомірних даних є те, що він зберігає лише великі парні відстані між точками. Значущі точки, які знаходяться далеко в просторі великого розміру, також з'являтимуться далеко в низькомірному підпросторі, окрім того, …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.