Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Швидке обчислення / оцінка лінійної системи низького рангу
Лінійні системи рівнянь поширені в обчислювальній статистиці. Одна зі спеціальних систем, з якими я стикався (наприклад, при факторному аналізі), - це система Ax=bAx=bAx=b де Тут - діагональна матриця із строго позитивною діагоналлю, - (з ) симетрична позитивна напіввизначена матриця, і є довільною матрицею . Нас пропонують розв’язати діагональну лінійну систему …

2
Чи існує тест на придатність Андерсона на два набори даних?
Я знаю, що ad.test () може бути використаний для перевірки нормальності. Чи можна отримати ad.test для порівняння розподілів з двох зразків даних? x <- rnorm(1000) y <- rgev(2000) ad.test(x,y) Як я можу виконати тест Андерсона-Дарлінга на 2-х зразках?

2
Як оцінити параметри фільтра Калмана
У попередньому запитанні я поцікавився питанням відповідності розподілів деяким емпіричним даним, які не є Гауссом. Мені було запропоновано в автономному режимі, я можу спробувати припустити, що дані є гауссовими і спочатку підходять фільтром Калмана. Тоді, залежно від помилок, вирішуйте, чи варто розвивати щось фантазії. Що має сенс. Отже, маючи хороший …

2
Чи можу я перевірити обґрунтованість попередніх даних?
Проблема Я пишу функцію R, яка виконує байєсівський аналіз, щоб оцінити задню щільність за даними попередніх даних та даних. Я хотів би, щоб функція надсилала попередження, якщо користувачеві потрібно переглянути попереднє. У цьому питанні мені цікаво дізнатися, як оцінити попереднє. Попередні питання висвітлювали механіку викладу інформованих пріорів ( тут і …



2
Обґрунтування використання AUC?
Особливо в галузі інформатики, орієнтованої на машинознавчу літературу, AUC (область під характеристикою кривої оператора приймача) є популярним критерієм оцінювання класифікаторів. Які виправдання щодо використання AUC? Наприклад, чи є певна функція втрат, для якої оптимальним рішенням є класифікатор з найкращим AUC?

3
Чим відрізняється ITT від ATE?
У мене виникають проблеми з розумінням різних оцінок, які можна використовувати в оцінці впливу. Я знаю, що оцінювач наміру лікувати (ІТТ) порівнює відмінності між правомочними людьми без програми та придатними особами з програмою, незалежно від відповідності. Однак я подумав, що середній ефект лікування (ATE) також вимірює те саме. Однак, схоже, …

6
Найкращий спосіб взаємодії з R-сеансом, що працює в хмарі
Заблокований . Це запитання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. У мене працює R на Amazon EC2, використовуючи модифіковану версію біопровідника AMI . В даний час я використовую шпаклівку для ssh на своєму сервері, починаючи з …
10 r 

2
Рекомендована процедура аналізу факторів на дихотомічні дані з R
Мені потрібно провести факторний аналіз на наборі даних, що складається з дихотомних змінних (0 = так, 1 = ні), і я не знаю, чи я на правильному шляху. Використовуючи, tetrachoric()я створюю кореляційну матрицю, на якій я запускаюсь fa(data,factors=1). Результат дуже близький до результатів, які я отримую при використанні MixFactor , …

2
Поздовжні дані: часовий ряд, повторні заходи чи щось інше?
Простий англійською мовою: у мене є множинна регресія або ANOVA модель, але змінна відповідь для кожної людини є криволінійною функцією часу. Як я можу визначити, яка з правої змінної відповідає правовим змінам кривих та вертикальних зміщень кривих? Це проблема часових рядів, проблема повторних заходів чи щось інше цілком? Які найкращі …

2
Оптимізація дисперсії середнього показника у R в портфоліо Марковіца
У мене є 5 підсумкових серійних прибутків валютних ринків, що розвиваються, для яких я прогнозую прибутки на один період (1 рік). Я хотів би побудувати портфоліо з 5 серій, оптимізованих за дисперсією, з використанням історичних дисперсій та коваріацій (1) та моїх власних прогнозованих прибутків. Чи має R (простий) спосіб / …
10 r 

3
Рандомізована техніка сліду
Я зустрічав таку рандомізовану методику відстеження у М. Зеегера, "Оновлення низького рангу для розкладу Чолеського", Каліфорнійський університет в Берклі, Техн. Респ., 2007. tr(A)=E[xTAx]tr⁡(A)=E[xTAx]\operatorname{tr}(\mathbf{A}) = {E[\mathbf{x}^T \mathbf{A} \mathbf{x}]} де .x∼N(0,I)x∼N(0,I)\mathbf{x} \sim N(\mathbf{0},\mathbf{I}) Як людина без глибокого передумови математики, мені цікаво, як можна досягти цієї рівності. Крім того, як ми можемо інтерпретувати …


1
Використання куртозу для оцінки значущості компонентів незалежного компонентного аналізу
В PCA власне значення визначають порядок складових. У ICA я використовую куртоз для отримання замовлення. Які деякі прийняті методи для оцінки кількості (якщо я маю порядок) компонентів, які є важливими, крім попередніх знань про сигнал?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.