Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Діагностика колінеарності проблематична лише тоді, коли включений термін взаємодії
Я провів регресію в американських графствах і перевіряв наявність колінеарності у своїх "незалежних" змінних. Регресійна діагностика Belsley, Kuh та Welsch пропонує переглянути показник коефіцієнта стану та дисперсійного коефіцієнта: library(perturb) ## colldiag(, scale=TRUE) for model with interaction Condition Index Variance Decomposition Proportions (Intercept) inc09_10k unins09 sqmi_log pop10_perSqmi_log phys_per100k nppa_per100k black10_pct hisp10_pct …

3
Чим пошук центроїда відрізняється від знаходження середнього?
Виконуючи ієрархічну кластеризацію, можна використовувати багато метрик для вимірювання відстані між кластерами. Дві такі метрики передбачають обчислення центроїдів і засобів точок даних у кластерах. Яка різниця між середнім та центроїдним? Хіба це не однакова точка кластеру?
26 clustering  mean 

3
Як я інтерпретую "кореляції фіксованих ефектів" у своєму виведенні з блиску?
У мене є такий результат: Generalized linear mixed model fit by the Laplace approximation Formula: aph.remain ~ sMFS2 +sAG2 +sSHDI2 +sbare +season +crop +(1|landscape) AIC BIC logLik deviance 4062 4093 -2022 4044 Random effects: Groups Name Variance Std.Dev. landscape (Intercept) 0.82453 0.90804 Number of obs: 239, groups: landscape, 45 Fixed …

2
Як обчислити SVD величезної розрідженої матриці?
Який найкращий спосіб обчислити сингулярне розкладання величини (SVD) дуже великої позитивної матриці (65M x 3.4M), де дані надзвичайно рідкі? Менше 0,1% матриці не дорівнює нулю. Мені потрібен спосіб, який: впишеться в пам'ять (я знаю, що існують онлайн-методи) буде обчислено у розумний час: 3,4 дня буде досить точним, проте точність не …
26 svd  numerics 

3
Чому моделі Гаусса називають непараметричними?
Я трохи розгублений. Чому процеси Гаусса називають непараметричними моделями? Вони припускають, що функціональні значення або їх підмножина мають гауссовий пріоритет із середнім значенням 0 і коваріаційною функцією, заданою як функція ядра. Ці самі функції ядра мають деякі параметри (тобто, гіперпараметри). То чому їх називають непараметричними моделями?

2
Перетворення змінних для множинної регресії в R
Я намагаюся виконати кратну регресію в R. Однак моя залежна змінна має такий сюжет: Ось матриця розсіювання з усіма моїми змінними ( WARє залежною змінною): Я знаю, що мені потрібно виконати перетворення на цій змінній (а можливо, і незалежних змінних?), Але я не впевнений у необхідній точній трансформації. Чи може …

2
Переваги робити "подвійне ласо" або виконувати ласо двічі?
Я один раз почув метод використання ласо двічі (як подвійне ласо), коли ви виконуєте ласо на початковому наборі змінних, скажімо, S1, отримуєте розріджений набір під назвою S2, а потім знову виконуєте ласо на множині S2 для отримання множини S3 . Чи є для цього методологічний термін? Також, які переваги робити …

6
Встановити синусоїдальний термін до даних
Хоча я читаю цю публікацію, я все ще не маю уявлення, як застосувати це до власних даних і сподіваюся, що хтось може мені допомогти. У мене є такі дані: y <- c(11.622967, 12.006081, 11.760928, 12.246830, 12.052126, 12.346154, 12.039262, 12.362163, 12.009269, 11.260743, 10.950483, 10.522091, 9.346292, 7.014578, 6.981853, 7.197708, 7.035624, 6.785289, 7.134426, …
26 r  regression  fitting 

1
Чи можна тест Мантеля поширити на асиметричні матриці?
Тест Мантеля зазвичай застосовується для симетричних матриць відстані / різниці. Наскільки я розумію, припущення тесту полягає в тому, що міра, яка використовується для визначення різниць, повинна бути принаймні напівметричною (відповідати стандартним вимогам метрики, а не нерівності трикутника). Чи можна припущення про симетрію послабити (даючи попередню метрику)? Чи можливо застосувати тест …

3
Тематичні моделі та методи спільного виникнення слів
Популярні моделі тем, як LDA, як правило, кластеризують слова, які мають тенденцію спільно зустрічатися в одну тему (кластер). У чому полягає основна відмінність таких моделей тематики від інших простих підходів, заснованих на кластеризації на основі спільного виникнення, таких як PMI? (PMI позначає точку взаємної інформації, і вона використовується для ідентифікації …

5
Стратегії впровадження передової статистики для різних аудиторій
Я працюю переважно з нестатистами в таких галузях, як медицина, суспільні науки та освіта. Я консультуюся з аспірантами, допомагаю дослідникам зі статтями чи переглядаю статті для журналів, у мене часто виникає проблема, що хтось (клієнт, автор, дисертаційний комітет, редактор журналу) хоче використовувати якусь відносно відому методику, коли вона цілком є …
26 consulting 

2
Геометрична інтерпретація пенізованої лінійної регресії
Я знаю, що лінійну регресію можна розглядати як "лінію, вертикально найближчу до всіх точок" : Але є й інший спосіб побачити це, візуалізуючи простір стовпців, як "проекцію на простір, що охоплюється стовпцями коефіцієнта матриці" : Моє запитання: у цих двох інтерпретаціях, що відбувається, коли ми використовуємо пенізовану лінійну регресію, як …

1
Як інтерпретувати коефіцієнти стандартних помилок у лінійній регресії?
Мені цікаво, як інтерпретувати коефіцієнт стандартних помилок регресії при використанні функції відображення в Р. Наприклад у наступному виході: lm(formula = y ~ x1 + x2, data = sub.pyth) coef.est coef.se (Intercept) 1.32 0.39 x1 0.51 0.05 x2 0.81 0.02 n = 40, k = 3 residual sd = 0.90, R-Squared …

7
Яка мінімальна рекомендована кількість груп для коефіцієнта випадкових ефектів?
Я використовую змішану модель в R( lme4) для аналізу деяких даних повторних заходів. У мене є змінна відповідь (вміст клітковини в калі) і 3 фіксованих ефекту (маса тіла тощо). У моєму дослідженні є лише 6 учасників, з 16 повторних заходів для кожного (хоча два мають лише 12 повторень). Суб'єктами є …

2
Коли використовувати тест Wilcoxon-рейтингу замість непарного тесту?
Це додаткове запитання до того, що тут написав Френк Харрелл : На мій досвід, необхідний розмір вибірки для точного розподілу t часто перевищує розмір вибірки. Як ви вже говорили, тест з підписом Wilcoxon є надзвичайно ефективним, і він надійний, тому я майже завжди віддаю перевагу йому над тестом t Якщо …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.