Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Порівняйте дві криві виживання для парних даних
Я хочу порівняти два різні методи виявлення зміни статусу в аналізі виживання. Група досліджуваних спостерігається протягом більш тривалого періоду (багато років), і два методи обстеження використовуються для перевірки того, чи відбулася зміна статусу; один метод був використаний для обстеження кожного суб'єкта двічі на рік, а другий - для обстеження кожного …

3
Машини Больцмана з обмеженою регресією?
Я продовжую відповідати на запитання, яке я задавав раніше щодо УЗМ . Я бачу багато літератури, що описує їх, але жодна, яка насправді говорить про регресію (навіть не класифікація з міченими даними). У мене виникає відчуття, що він використовується лише для не маркованих даних. Чи є ресурси для лікування регресії? …

3
Негативна реалізація ласо в R
Я шукаю якісь відкриті джерела чи наявну бібліотеку, яку можу використовувати. Наскільки я кажу, пакет glmnet не дуже легко розширюється, щоб охопити негативний випадок. Я можу помилятися, будь-хто з будь-якими ідеями високо оцінений. Під негативним я маю на увазі, що всі коефіцієнти обмежені позитивними (> 0).
13 r  lasso 

4
Різниця часових рядів перед Арімою або в межах Аріми
Чи краще відрізнити ряд (якщо припустити, що він потрібен) перед тим, як використовувати Аріма АБО, краще використовувати параметр d у Arima? Я був здивований, наскільки різні пристосовані значення залежать від маршруту, взятого з тією ж моделлю та даними. Або я щось неправильно роблю? install.packages("forecast") library(forecast) wineindT<-window(wineind, start=c(1987,1), end=c(1994,8)) wineindT_diff <-diff(wineindT) …
13 r  time-series  arima 

3
Як можна обробляти нестабільні оцінки в лінійній регресії з високою мультиколінеарністю без викидання змінних?
Бета-стабільність при лінійній регресії з високою мультиколінеарністю? Скажімо, в лінійній регресії змінні і x_2 мають високу мультиколінеарність (кореляція становить близько 0,9).х 2x1x1x_1x2x2x_2 Ми стурбовані стабільністю коефіцієнта ββ\beta тому нам доводиться ставитись до багатоколінеарності. Рішенням підручника було б просто викинути одну зі змінних. Але ми не хочемо втрачати корисну інформацію, просто …

2
Як перевірити, чи вибирають два багатовимірні розподіли від однієї базової сукупності?
Скажімо, вам дано два багатовимірні набори даних, скажімо, старий та новий, і що вони, як передбачається, були створені тим самим процесом (для якого у вас немає моделі), але, можливо, десь уздовж лінії збирання / створення дані, щось пішло не так. Ви не хочете використовувати нові дані як, скажімо, набір перевірки …

4
Що робити, коли засоби двох зразків суттєво відрізняються, але різниця здається занадто малою для значення
У мене є дві вибірки ( в обох випадках). Засоби відрізняються приблизно вдвічі збільшеною стд. дев. Отримане значення становить приблизно 10. Хоча це чудово знати, що я остаточно показав, що засоби не однакові, мені здається, що він керується великим n. Дивлячись на гістограми даних, я, звичайно, не відчуваю, що такі, …


2
Навіщо використовувати бета-розподіл за параметром Бернуллі для ієрархічної логістичної регресії?
Зараз я читаю чудову книгу Крушке "Проведення байєсівського аналізу даних". Однак глава про ієрархічну логістичну регресію (глава 20) дещо заплутаний. На рисунку 20.2 описана ієрархічна логістична регресія, де параметр Бернуллі визначений як лінійна функція на коефіцієнти, перетворені через сигмоподібну функцію. Це, мабуть, є ієрархічною логістичною регресією у більшості прикладів, які …

2
Пошук найкращих особливостей у моделях взаємодії
У мене є список білків з їх значеннями. Прикладна таблиця виглядає так: ...............Feature1...Feature2...Feature3...Feature4 Protein1 Protein2 Protein3 Protein4 Рядки - це білки, а стовпці - особливості. У мене також є список білків, які взаємодіють; наприклад Protein3, Protein4 Protein1, Protein2 Protein4, Protein1 Проблема : Для попереднього аналізу я хочу знати, які особливості …

1
Чому квадрати дає пояснену дисперсію?
Це може бути основним питанням, але мені було цікаво, чому значення в регресійній моделі може бути просто в квадрат, щоб дати фігуру поясненої дисперсії?RRR Я розумію, що коефіцієнт може дати силу відносинам, але я не розумію, як просто квадратування цього значення дає міру поясненої дисперсії.RRR Будь-яке просте пояснення цьому? Дуже …

1
Послідовність Халтона проти послідовності Соболя?
З відповіді на попереднє запитання я був спрямований до послідовності Халтона, щоб створити набір векторів, які досить рівномірно покривали простір вибірки. Але на сторінці вікіпедії згадується, що вищі праймери особливо часто сильно корелюються на початку серіалу. Це, мабуть, має місце для будь-якої пари високих простих чисел з відносно коротким розміром …

2
Проблема з e1071 libsvm?
У мене є набір даних з двома класами, що перекриваються, по сім балів у кожному класі, точки - у двовимірному просторі. У R, і я біжу svmвід e1071пакета, щоб побудувати роздільну гіперплан для цих класів. Я використовую таку команду: svm(x, y, scale = FALSE, type = 'C-classification', kernel = 'linear', …

2
Чому похідні функції використовуються в нейронних мережах?
Наприклад, хочеться передбачити ціни на житло та мати два вхідні характеристики довжини та ширини будинку. Іноді також включаються «похідні» поліноміальні вхідні характеристики, такі як площа, що є довжиною * шириною. 1) В чому сенс включення похідних ознак? Чи не повинна нейромережа дізнатися зв’язок між довжиною, шириною та ціною під час …

1
Як Kinect використовує випадкові ліси?
Я читав на цьому сайті, що, очевидно, Kinect певним чином використовує алгоритм випадкових лісів для машинного навчання. Чи може хтось пояснити, для чого він використовує випадкові ліси та як працює їхній підхід?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.