Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Побудова дискретного обороту, що підтримує всі раціональні в
Це конструктивістський продовження цього питання . Якщо ми не можемо мати дискретної рівномірної випадкової величини, яка підтримує всі раціональні речовини в інтервалі , то наступне найкраще: [0,1][0,1][0,1] Побудуйте випадкову змінну яка має цю підтримку, , і вона має деякий розподіл. І майстриня в мені вимагає, щоб ця випадкова величина була …

2
PCA та дослідницький факторний аналіз на одному і тому ж наборі даних: відмінності та схожість; факторна модель проти PCA
Мені хотілося б знати, чи є логічний сенс проводити аналіз основних компонентів (PCA) та дослідницький факторний аналіз (EFA) на одному і тому ж наборі даних. Я чув, що фахівці прямо рекомендують: Зрозуміти, яка мета аналізу, і вибрати PCA або EFA для аналізу даних; Зробивши один аналіз, не потрібно робити іншого …

4
GEE: вибір правильної робочої кореляційної структури
Я епідеміолог, який намагається зрозуміти ГЕЗ, щоб належним чином проаналізувати когортне дослідження (використовуючи регресію Пуассона з посиланням на журнал, оцінити відносний ризик). У мене є кілька запитань про "робочу кореляцію", яку я хотів би, щоб хтось більш обізнаний уточнив: (1) Якщо я повторював вимірювання у однієї особи, як правило, найбільш …
19 gee 

3
Чи має диференціальна геометрія щось спільне зі статистикою?
Я займаюся майстром статистики і мені рекомендують вивчити диференційну геометрію. Мені було б щасливіше почути про статистичні програми для диференціальної геометрії, оскільки це зробило б мене мотивацією. Хтось знає програми для диференціальної геометрії в статистиці?

4
Практично кажучи, як люди поводяться з ANOVA, коли дані не зовсім відповідають припущенням?
Це не суто статистичне запитання - я можу прочитати всі підручники про припущення ANOVA - я намагаюся з’ясувати, як фактичні робочі аналітики обробляють дані, які не зовсім відповідають припущенням. Я пережив багато питань на цьому сайті, шукаючи відповіді, і я постійно знаходжу повідомлення про те, коли не використовувати ANOVA (в …

1
Обчислити та графік межі рішення LDA
Я побачив графік LDA (лінійний дискримінантний аналіз) з межею прийняття рішень з "Елементів статистичного навчання" : Я розумію, що дані проектуються на нижній розмірний підпростір. Однак я хотів би знати, як ми отримуємо межі рішення у вихідному вимірі, щоб я міг проектувати межі рішення на нижній розмірний підпростір (подобається чорні …

3
Як оцінити скосистість від коробки?
Як визначити скасованість, подивившись на побудовану з цих даних коробку: 340, 300, 520, 340, 320, 290, 260, 330 В одній книзі сказано: "Якщо нижній квартал знаходиться далі від медіани, ніж верхній квартал, то розподіл негативно перекошений". Кілька інших джерел сказали більш-менш те саме. Я побудував боксер за допомогою Р. Це …

1
Коли доступний аналітичний якобіанець, чи краще наблизити гессея до , або по кінцевих відмінностях якобійців?
Скажімо, я обчислюю деякі параметри моделі, мінімізуючи суму залишків у квадраті, і я припускаю, що мої помилки є гауссовими. Моя модель виробляє аналітичні похідні, тому оптимізатору не потрібно використовувати кінцеві відмінності. Після завершення придатності я хочу обчислити стандартні похибки встановлених параметрів. Як правило, у цій ситуації гессіана функції помилки вважається …

3
Зв'язок між регресією хребта та регресією PCA
Я пам’ятаю, що десь в Інтернеті прочитав зв’язок між регресією хребта (з регуляризацією) та регресією PCA: використовуючи регресію з гіперпараметром , якщо , то регресія еквівалентна видаленню ПК змінна з найменшим власним значенням.ℓ2ℓ2\ell_2ℓ2ℓ2\ell_2λλ\lambdaλ → 0λ→0\lambda \to 0 Чому це правда? Чи має це щось спільне з процедурою оптимізації? Наївно, я …

2
Запуск завантаження - чи потрібно мені спочатку видалити інші люди?
Ми провели спліт-тест на нову функцію продукту і хочемо оцінити, чи значне підвищення доходу. Наші спостереження, безумовно, зазвичай не розподіляються (більшість наших користувачів не витрачають коштів, і в межах тих, хто це робить, він сильно перекошений до безлічі маленьких витрачальників і кількох дуже великих витрачених). Ми вирішили використати завантажувальну систему …

1
Карета та коефіцієнти (glmnet)
Мені цікаво використовувати каре для здійснення висновків для певного набору даних. Чи можливо зробити наступне: виробляють коефіцієнти моделі glmnet, яку я навчив каре. Я хотів би використовувати glmnet через властивий підбір функції, оскільки я не вірю, що в glm є? окрім метрики ROC, чи є інша метрика, яку я можу …
19 caret  glmnet 


2
Випадковий ліс є надмірним?
Я експериментую з випадковими лісами з scikit-learn, і я отримую чудові результати свого навчального набору, але порівняно погані результати на моєму тестовому наборі ... Ось проблема (натхненна покером), яку я намагаюся вирішити: Враховуючи дірові карти гравця A, картки гравців B з дірками та флоп (3 карти), який гравець має найкращу …

4
Чи потрібен аналіз потужності в байєсівській статистиці?
Останнім часом я досліджував байєсівську класичну статистику. Прочитавши про фактор Байєса, я не замислювався, чи необхідний аналіз потужності в цьому погляді на статистику. Моя головна причина, що цікаво, що це фактор Байєса, справді, просто виявляється співвідношенням ймовірності. Як тільки це 25: 1, здається, я можу назвати це ніч. Я далеко? …

1
Отримання р-значень для "мультинома" в R (пакет мережі)
Як отримати значення p за допомогою multinomфункції nnetпакета в R? У мене є набір даних, який складається з «показників патології» (відсутні, легкі, важкі) як змінної результату, та двох основних наслідків: вік (два фактори: двадцять / тридцять днів) та група лікування (чотири фактори: інфіковані без АТБ; інфіковані + ATB1; інфікований + …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.