Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Колінеарні змінні в навчанні багатошарового LDA
Я готую багатокласний класифікатор LDA з 8 класами даних. Під час виконання тренінгу я отримую попередження: " Змінні колінеарні " Я отримую точність тренувань понад 90% . Я використовую бібліотеку scikits-learn у Python, щоб тренувати та перевіряти дані класу Multi-Class. Я також отримую гідну точність тестування (близько 85% -95% ). …

3
Чи потрібні MLE дані про iid? Або просто незалежні параметри?
Оцінка параметрів з використанням максимальної оцінки ймовірності (MLE) включає оцінку функції ймовірності, яка відображає ймовірність виникнення вибірки (X) до значень (x) на просторі параметрів (θ) з заданим сімейством розподілу (P (X = x | θ) ) над можливими значеннями θ (зверніть увагу: чи я прав на це?) Усі приклади, які …

2
Як запустити двосторонню ANOVA на даних, що не мають ні нормальності, ні рівності дисперсії в R?
Наразі я працюю над магістерською роботою та планую вести статистику із SigmaPlot. Однак, витративши деякий час на свої дані, я прийшов до висновку, що SigmaPlot може не підходити до моєї проблеми (я можу помилятися), тому я розпочав свої перші спроби в R, що точно не полегшило. За моїми даними було …

4
Очищення даних невідповідного формату в R?
Я часто маю справу з брудними даними опитування, які вимагають багато очищення, перш ніж стати статистикою. Я раніше робив це "вручну" в Excel, іноді використовуючи формули Excel, а іноді перевіряючи записи окремо. Я почав робити все більше і більше цих завдань, написавши сценарії, щоб виконати їх в R, що було …
16 r  data-cleaning 

2
Обчислення стандартної похибки в оцінці середньозваженого значення
Припустимо , що w1,w2,…,wnw1,w2,…,wnw_1,w_2,\ldots,w_n і x1,x2,...,xnx1,x2,...,xnx_1,x_2,...,x_n кожен звертається IID від деяких розподілів, з wiwiw_i НЕ залежить від xixix_i . wiwiw_i строго позитивні. Ви спостерігаєте всі wiwiw_i , але не xixix_i ; швидше ви спостерігаєте ∑ixiwi∑ixiwi\sum_i x_i w_i . Мені цікаво оцінити E[x]E⁡[x]\operatorname{E}\left[x\right] з цієї інформації. Очевидно оцінювач є неупередженим, і …

3
Розрахунок нового стандартного відхилення з використанням старого стандартного відхилення після зміни набору даних
У мене є масив з реальних значень, який має середнє значення та стандартне відхилення . Якщо елемент масиву буде замінений іншим елементом , тоді буде нове значенняnnnμoldμold\mu_{old}σoldσold\sigma_{old}xixix_ixjxjx_j μnew=μold+xj−xinμnew=μold+xj−xin\mu_{new}=\mu_{old}+\frac{x_j-x_i}{n} Перевага цього підходу полягає в тому, що він вимагає постійних обчислень незалежно від значення . Чи є якийсь підхід для обчислення використовуючи …

1
Інтерпретація результатів тесту Грінгера на причинність
Я намагаюся просвітити себе причинності Грейнджера. Я прочитав публікації на цьому сайті та кілька хороших статей в Інтернеті. Я також натрапив на дуже корисний інструмент - « Біваріантна Грінджерська причинність» - Безкоштовний калькулятор статистики , який дозволяє вводити часовий ряд та обчислювати статистику Грейнджера. Нижче наведено вихід із зразкових даних, …

3
Пошук MLE для однозначного експоненціального процесу Хоукса
Універсальний експоненціальний процес Хоукса - це захоплюючий точковий процес зі швидкістю прибуття події: λ(t)=μ+∑ti&lt;tαe−β(t−ti)λ(t)=μ+∑ti&lt;tαe−β(t−ti) \lambda(t) = \mu + \sum\limits_{t_i<t}{\alpha e^{-\beta(t-t_i)}} де - часи прибуття події.t1,..tnt1,..tn t_1,..t_n Функція вірогідності журналу є −tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln(μ+αe−β(tj−ti))−tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln⁡(μ+αe−β(tj−ti)) - t_n \mu + \frac{\alpha}{\beta} \sum{( e^{-\beta(t_n-t_i)}-1 )} + \sum\limits_{i<j}{\ln(\mu+\alpha e^{-\beta(t_j-t_i)})} які можна обчислити рекурсивно: −tnμ+αβ∑(e−β(tn−ti)−1)+∑ln(μ+αR(i))−tnμ+αβ∑(e−β(tn−ti)−1)+∑ln⁡(μ+αR(i)) - t_n \mu …

1
Використання R і plm для оцінки моделей з фіксованими ефектами, які включають взаємодію з часом
Я використовую plm()для оцінки моделей з фіксованими ефектами y ~ x + time + time:fixed_trait де fixed_traitє змінною, яка змінюється в окремих індивідах, але є постійною в межах індивідів. Сенс взаємодії timeз ним fixed_traitполягає в тому, щоб дозволити ефекту fixed_traitзмінюватися в часі. (Я працюю тут з недавнього буклета Пола Елісона …
16 r 

1
Найменш дурний спосіб прогнозувати короткий багатоваріантний часовий ряд
Мені потрібно прогнозувати наступні 4 змінні на 29-ту одиницю часу. У мене є приблизно 2 роки історичних даних, де 1 і 14 і 27 - це той самий період (або час року). Зрештою, я роблю декомпозицію стилю Oaxaca-Blinder на , , та .WWWw dшгwdw cшcwcppp time W wd wc p …

3
Чи взагалі можна захищати стратифікацію набору даних за розміром залишку та проводити порівняння у двох зразках?
Це те, що я вважаю зробленим як своєрідний метод, і мені це здається дуже рибковим, але, можливо, я щось пропускаю. Я бачив це в багатьох регресіях, але давайте просто будемо робити це просто: yi=β0+β1xi+εiyi=β0+β1xi+εi y_{i} = \beta_{0} + \beta_{1} x_{i} + \varepsilon_{i} Тепер візьміть залишки від встановленої моделі ei=yi−(β^0+β^1xi)ei=yi−(β^0+β^1xi) e_{i} …

6
Найшвидша реалізація SVM
Більше загального питання. Я запускаю rbf SVM для прогнозного моделювання. Я думаю, що моїй програмі, безумовно, потрібно трохи прискорити. Я використовую scikit learn з грубим точним пошуком сітки + перехресне підтвердження. Кожен пробіг SVM займає близько хвилини, але з усіма ітераціями я все ще знаходжу це занадто повільно. Припустимо, що …

2
Які альтернативи VC-виміру для вимірювання складності нейронних мереж?
Я натрапив на кілька основних способів вимірювання складності нейронних мереж: Наївні та неформальні: підраховують кількість нейронів, прихованих нейронів, шарів чи прихованих шарів VC-вимір (Eduardo D. Sontag [1998] "VC-розмір нейронних мереж" [ pdf ].) ОбчислювальнаТС0гТСг0TC^0_d та асимптотична обчислювальна складність вимірювання за еквівалентністю . Чи є інші альтернативи? Краще: Якщо показник складності …

4
Інтуїція за розподілом закону про владу
Я знаю, що pdf розподілу закону про владу єp(x)=α−1xmin(xxmin)−αp(x)=α−1xmin(xxmin)−α p(x) = \frac{\alpha-1}{x_{\text{min}}} \left(\frac{x}{x_{\text{min}}} \right)^{-\alpha} Але що це інтуїтивно означає, якщо, наприклад, ціни на акції слідують за розподілом закону про владу? Чи означає це, що втрати можуть бути дуже високими, але рідкісними?

1
Як проаналізувати дані поздовжнього рахунку: облік тимчасової автокореляції в ГЛММ?
Привіт, майстри програмування статистичних гуру та R, Мені цікаво моделювати захоплення тварин як залежність від умов навколишнього середовища та дня року. Як частина іншого дослідження, я зафіксував кількість знімань за ~ 160 днів протягом трьох років. Кожен з цих днів у мене температура, кількість опадів, швидкість вітру, відносна вологість тощо. …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.