Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Чи повинна відстань бути "метрикою", щоб ієрархічна кластеризація була дійсною на ній?
Скажімо, що ми визначаємо відстань, яка не є метрикою , між N елементами. На основі цієї відстані ми використовуємо агломераційну ієрархічну кластеризацію . Чи можемо ми використовувати кожен з відомих алгоритмів (одинарне / максимум / авангардний зв’язок тощо), щоб отримати значущі результати? Або по-іншому, в чому проблема їх використання, якщо …

2
Розподіл стандартного відхилення
Це питання стосувалося нормального розподілу, але мені цікаво, що відомо про розподіл стандартного відхилення вибірки розміром n, проведеного з довільного розподілу. Зокрема, що таке стандартне відхилення стандартного відхилення? Для нормального розподілу sd sd є . Це приблизно відповідає довільному розподілу як ?σ2n√σ2n\sigma \over{\sqrt{2n}}n→∞n→∞n \rightarrow \infty

2
Розуміння результатів регресії хребта
Я новачок у регресії хребта. Коли я застосував лінійну регресію хребта, я отримав такі результати: >myridge = lm.ridge(y ~ ma + sa + lka + cb + ltb , temp, lamda = seq(0,0.1,0.001)) > select(myridge) modified HKB estimator is 0.5010689 modified L-W estimator is 0.3718668 smallest value of GCV at …

3
Boxplot для декількох дистрибутивів?
Мені потрібно намалювати 20 розподілів в одному графіку на R, і це не виглядає добре (захаращено) для мене звичайним boxplot (20 коробок) навіть з boxwex = 0,3. Чи можете ви запропонувати мені, як я можу побудувати такий вид боксплотів у R для 20-ти розподілів, з крапками для медіани та просто …
9 r  boxplot 

2
Які хороші посилання / поради щодо вивчення статистики розмов Emacs (з R)?
Я використовую R кілька років, але завжди користувався графічним інтерфейсом, як Tinn-R, JGR, і останнім часом R-Studio. Хоча мені подобається інтерфейс R-Studio, я відчуваю, що для довших програм з малою кількістю графіки / без графіку я можу ефективніше кодувати, скориставшись ярликами, запропонованими більш базовим текстовим редактором, як Emacs. Я встановив …
9 r  software 

2
В яких умовах ви б очікували, що модель, знайдена LARS, сильно відрізняється від моделі, знайденої при вичерпному пошуку?
Трохи більше інформації; припустимо, що ви заздалегідь знаєте, скільки змінних вибрати, і що ви встановили штраф складності в LARS процедурі, щоб мати саме стільки змінних з не 0 коефіцієнтами, витрати на обчислення - це не проблема (загальна кількість змінної невелика, скажімо, 50), що всі змінні (y, x) є безперервними. У …

1
Як вибрати кількість розщеплень у rpart ()?
Я використовував rpart.controlдля minsplit=2та отримав наступні результати від rpart()функції. Щоб уникнути перевиконання даних, чи потрібно мені використовувати розбивки 3 або розбивки 7? Чи не слід використовувати спліт 7? Будь ласка, дай мені знати. Змінні, які фактично використовуються в будівництві дерев: [1] ct_a ct_b usr_a Root node error: 23205/60 = 386.75 …
9 r  cart  rpart 

4
Кластеризація за допомогою асиметричних відстаней
Як ви кластеризуєте функцію за допомогою асиметричної міри відстані? Наприклад, скажімо, ви кластеризуєте набір даних із днями тижня як особливістю - відстань з понеділка по п’ятницю не така, як відстань з п’ятниці на понеділок. Як ви включите це до вимірювання відстані в алгоритмі кластеризації?

1
Як підсумувати дві змінні, які знаходяться на різних масштабах?
Якщо у мене дві змінні після двох різних розподілів і мають різні стандартні відхилення ... Як мені потрібно перетворити дві змінні, щоб при підсумовуванні двох результатів не «керував» більш мінливим. Наприклад ... Змінна A є менш мінливою, ніж змінна B (становить від 0 до 3000), а змінна B переходить вперед. …

1
Як я можу обчислити оцінку задньої щільності за попередньою та ймовірною?
Я намагаюся зрозуміти, як використовувати теорему Байєса для обчислення задніх, але я застрягаю з обчислювальним підходом, наприклад, у наступному випадку мені незрозуміло, як взяти добуток попереднього та ймовірного, а потім обчислити задній: У цьому прикладі мені цікаво обчислити задню ймовірність і я використовую стандартний звичайний до , але я хочу …

2
Виправлення декількох порівнянь у межах предметів / повторні заходи ANOVA; надмірно консервативний?
Мене вражає, що наявні виправлення для кількох порівнянь у контексті повторних заходів ANOVA надмірно консервативні. Це насправді так? Якщо так, то які цитати я можу використати, щоб підтримати цю точку та дізнатися більше?

5
Виявлення частин пісні
Сподіваємось, це не надто суб'єктивно ... Я шукаю певного напряму в намаганнях виявити різні "частини" пісні, незалежно від музичного стилю. Я поняття не маю, де шукати, але, довіряючи силам інших сайтів StackOverflow, я подумав, що хтось тут може допомогти вказати напрямок. У більшості основних термінів можна було виявити різні частини …

1
Поширення помилки за допомогою серії Тейлора другого порядку
Я читаю текст "Математичної статистики та аналізу даних" Джона Райса. Йдеться про наближення очікуване значення і дисперсію випадкової величини . Ми можемо обчислити очікуване значення та дисперсію випадкової величини і знаємо відношення Y = g (X) . Отже, можна наблизити очікувану величину та дисперсію Y за допомогою розширення серії Тейлора …

2
ANOVA в поєднанні, повторна міра або змішана модель?
Мене попросили проаналізувати деякі дані клінічного випробування, розглядаючи два методи вимірювання артеріального тиску. У мене є дані 50 суб'єктів, кожен з яких має від 2 до 57 заходів, використовуючи кожен метод. Мені цікаво, як найкраще діяти. Очевидно, що мені потрібно рішення, яке враховуватиме факт вимірювання артеріального тиску (два методи, які …
9 r  anova  mixed-model  stata 

3
Вказівки щодо виявлення нових знань у даних
Я готую щось, щоб зробити точку зору собі чи комусь іншому. Зазвичай питання починає цей процес, і часто людина, яка задає надію на конкретну відповідь. Як я можу дізнатися цікаві речі про дані менш упередженим чином? Зараз я приблизно дотримуюся цього методу: Зведена статистика Стріпчарт. Діаграма розкиду. Можливо, повторіть із …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.