Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Чи є нормалізовані еквіваленти Skewness і Kurtosis?
Який би був нормований еквівалент Skewness, який би мав ту саму одиницю, що і дані? Аналогічно, що було б нормованим еквівалентом куртозу? В ідеалі ці функції повинні бути лінійними щодо даних, тобто, якщо всі спостереження повинні бути помножені на коефіцієнт n, нормалізована косоокість і куртоз буде помножена на один і …

2
Як я повинен моделювати взаємодії між пояснювальними змінними, коли одна з них може мати квадратичний та кубічний доданки?
Я щиро сподіваюся, що я сформулював це питання таким чином, що на нього можна остаточно відповісти - якщо ні, будь ласка, дайте мені знати, і я спробую ще раз! Я також мушу зазначити, що я буду використовувати R для цих аналізів. У мене є кілька заходів , plant performance (Ys)які …

2
Чи існує елегантний / проникливий спосіб зрозуміти цю лінійну ідентичність регресії для декількох ?
У рамках лінійної регресії я натрапив на чудовий результат, який, якщо ми підходимо до моделі E[Y]=β1X1+β2X2+c,E[Y]=β1X1+β2X2+c,E[Y] = \beta_1 X_1 + \beta_2 X_2 + c, то, якщо ми стандартизуємо і відцентруємо дані , і ,YYYX1X1X_1X2X2X_2 R2=Cor(Y,X1)β1+Cor(Y,X2)β2.R2=Cor(Y,X1)β1+Cor(Y,X2)β2.R^2 = \mathrm{Cor}(Y,X_1) \beta_1 + \mathrm{Cor}(Y, X_2) \beta_2. Мені це здається двома змінною версією для регресії …

1
Довідка для розповіді про вибірку з телефонної книги
Я сьогодні розмовляв з кимось про відбір проб і смутно пам’ятаю історію про якогось дуже шанованого статистика, який рекомендував систематичний відбір проб з телефонної книги у певній юридичній справі. Я пам’ятаю історію, яка йшла чимось на зразок судді в суді, кажучи йому щось на кшталт «Я не знаю багато про …

1
Від ідентифікації до оцінки
Зараз я читаю твір Перла (Pearl, 2009, 2-е видання) про причинності та боротьбі за встановлення зв'язку між непараметричною ідентифікацією моделі та фактичною оцінкою. На жаль, сама Перл на цю тему дуже мовчить. Для прикладу я маю на увазі просту модель з причинним шляхом, x → z→ уx→z→yx \rightarrow z \rightarrow …

3
Виявлення аномалії часового ряду з Python
Мені потрібно реалізувати виявлення аномалії на кількох наборах даних часових рядів. Я ніколи цього не робив і сподівався на поради. Мені дуже зручно з python, тому я вважаю за краще, щоб рішення було втілено в ньому (більшість мого коду - це python для інших частин моєї роботи). Опис даних: дані …

2
Перетворити розподіл Пуассона в нормальний розподіл
Я маю насамперед досвід інформатики, але зараз я намагаюся навчити себе базовій статистиці. У мене є деякі дані, які, на мою думку, мають розповсюдження Пуассона У мене є два питання: Це розподіл Пуассона? По-друге, чи можна перетворити це в звичайний розподіл? Будь-яка допомога буде вдячна. Велике спасибі

2
Як інтерпретувати сюжети ACF та PACF
Я просто хочу перевірити, чи правильно я інтерпретую графіки ACF та PACF: Дані відповідають помилкам, згенерованим між фактичними точками даних та оцінками, згенерованими за допомогою моделі AR (1). Я відповів на цю відповідь: Оцініть коефіцієнти ARMA за допомогою перевірки ACF та PACF Прочитавши, що здається, що помилки не автокорельовані, але …

1
Об'єктивний оцінювач з мінімальною дисперсією для
Нехай є випадковою вибіркою, яка містить розподіл для . Тобто,X1,...,XnX1,...,Xn X_1, ...,X_nGeometric(θ)Geometric(θ)Geometric(\theta)0&lt;θ&lt;10&lt;θ&lt;10<\theta<1 pθ(x)=θ(1−θ)x−1I{1,2,...}(x)pθ(x)=θ(1−θ)x−1I{1,2,...}(x)p_{\theta}(x)=\theta(1-\theta)^{x-1} I_{\{1,2,...\}}(x) Знайдіть неупереджений оцінювач з мінімальною дисперсією дляg(θ)=1θg(θ)=1θg(\theta)=\frac{1}{\theta} Моя спроба: Оскільки геометричний розподіл походить від родини експонентів, статистика є повною і достатньою для . Крім того, якщо є оцінкою для , воно є неупередженим. Тому за теоремою …

1
Експоненціальна сім'я: спостережена порівняно з очікуваною достатньою статистикою
Моє запитання виникає при читанні читання "Мінки Діріхле" розподілу Мінки , в якому зазначено наступне без доказів у контексті отримання оцінки максимальної ймовірності розподілу Діріхле на основі спостережень за випадковими векторами: Як і завжди з експоненціальною сім'єю, коли градієнт дорівнює нулю, очікувана достатня статистика дорівнює достатній статистиці, що спостерігається. Я …

3
Чому людям подобаються безперебійні дані?
Я повинен використовувати ядро ​​квадратичного експоненціалу (SE) для регресії Гауссового процесу. Перевагами цього ядра є: 1) просте: лише 3 гіперпараметри; 2) гладка: це ядро ​​гауссова. Чому люди так люблять «гладкість»? Я знаю, що ядро ​​Гаусса нескінченно диференційоване, але чи це так важливо? (Будь ласка, дайте мені знати, чи є інші …

4
Найменш корельована підмножина випадкових змінних з кореляційної матриці
У мене є кореляційна матриця , яку я отримав, використовуючи коефіцієнт лінійної кореляції Пірсона через корркоф Матлаба () . Кореляційна матриця розмірності 100x100, тобто я обчислила кореляційну матрицю на 100 випадкових величин.AAA Серед цих 100 випадкових змінних я хотів би знайти 10 випадкових змінних, чия кореляційна матриця містить якомога менше …


5
Чи використовує децили для пошуку кореляції статистично обгрунтований підхід?
У мене є вибірка з 1449 точок даних, які не співвідносяться (r-квадрат 0,006). Аналізуючи дані, я виявив, що розділяючи значення незалежної змінної на позитивні та негативні групи, здається, є значна різниця в середньому залежної змінної для кожної групи. Розділяючи точки на 10 бункерів (децилів) за допомогою незалежних змінних значень, схоже, …

2
Логістична регресія та порядкові незалежні змінні
Я знайшов цю публікацію: Так. Коефіцієнт відображає зміну коефіцієнтів журналу для кожного приросту зміни порядкового предиктора. Ця (дуже поширена) специфікація моделі передбачає, що предиктор має лінійний вплив на всі його кроки. Щоб перевірити припущення, ви можете порівняти модель, в якій ви використовуєте порядкову змінну як єдиний предиктор, та ту, в …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.