Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як слід порівняти та затвердити моделі змішаних ефектів?
Яким чином (лінійні) моделі змішаних ефектів зазвичай порівнюються одна з одною? Я знаю, що можна використовувати тести на коефіцієнт ймовірності, але це не працює, якщо одна модель не є "підмножиною" іншої правильної? Чи завжди оцінка моделей df прямолінійна? Кількість фіксованих ефектів + ​​кількість дисперсійних компонентів, що оцінюються? Чи ігноруємо ми …

4
Інтерпретація різниці між лонормальним та розподілом закону про потужність (розподіл мережевих ступенів)
По-перше, я не статистик. Однак я робив статистичний аналіз мережі для свого доктора наук. У рамках мережевого аналізу я побудував додаткову функцію кумулятивного розподілу (CCDF) мережевих ступенів. Я виявив, що на відміну від звичайних мережевих дистрибутивів (наприклад, WWW), розподіл найкраще відповідає лонормальному розподілу. Я намагався пристосувати його до закону про …

2
Як встановити набір даних до розподілу Парето в R?
Маємо, скажімо, такі дані: 8232302 684531 116857 89724 82267 75988 63871 23718 1696 436 439 248 235 Хочете простий спосіб пристосувати це (та кілька інших наборів даних) до дистрибутива Pareto. В ідеалі він виводить би відповідні теоретичні значення, а не ідеально параметри.


1
Розрахунок статистичної потужності
Як я це розумію, мені потрібно знати щонайменше три аспекти (із чотирьох) запропонованого нами дослідження, щоб провести аналіз потужності, а саме: тип тесту - я маю намір використати r Пірсона та ANCOVA / Regression - GLM рівень значущості (альфа) - я маю намір використовувати 0,05 очікуваний розмір ефекту - я …

2
Хороший інтернет-ресурс із порадами щодо асоціації графіків між двома числовими змінними за різних умов
Контекст: За цей час я придбав набір евристики щодо того, як ефективно побудувати зв'язок між двома числовими змінними. Я думаю, що більшість людей, які працюють з даними, мали б подібний набір правил. Прикладами таких правил можуть бути: Якщо одна із змінних є позитивно перекошеною, розгляньте побудову цієї осі в масштабі …

2
Про «силу» слабких учнів
У мене є декілька тісно пов’язаних питань щодо слабких учнів, що навчаються в ансамблі (наприклад, стимулювання). Це може здатися німим, але які переваги використання слабких на відміну від сильних учнів? (наприклад, чому б не підсилити "сильні" методи навчання?) Чи є якась "оптимальна" сила для слабких учнів (наприклад, зберігаючи всі інші …

1
Що може спричинити великі відмінності у коефіцієнті кореляції між співвідношенням Пірсона та Спірмена для даного набору даних?
Коефіцієнт Пірсона між двома змінними досить високий (r = .65). Але коли я ранжую змінні значення та запускаю співвідношення Спірмена, коефіцієнт коефіцієнта значно нижчий (r = .30). Що таке тлумачення?

3
Підтримка векторної регресії для прогнозування багатоваріантних часових рядів
Хтось намагався прогнозувати часові ряди, використовуючи регресію вектора підтримки? Я розумію, що підтримують векторні машини підтримки і частково розуміють регресію векторів підтримки, але не розумію, як їх можна використовувати для моделювання часових рядів, особливо багатоваріантних часових рядів. Я спробував прочитати кілька робіт, але вони занадто високі. Чи може хтось просто …

2
Кращий підхід для вибору моделі байесівської або перехресної перевірки?
Коли я намагаюся вибрати серед різних моделей або кількість функцій, які слід включити, скажімо, передбачення, я можу придумати два підходи. Розподіліть дані на навчальні та тестові набори. Ще краще, використовуйте завантажувальну чи перехресну перевірку k-кратну кількість разів. Тренуйтеся на навчальному наборі щоразу і обчислюйте помилку над тестовим набором. Помилка тесту …

1
Відмінності між важким хвостом і жировим розподілом хвоста
Я думав, що важкий хвіст = жирний хвіст, але деякі статті, які я читав, давали мені зрозуміти, що це не так. Один з них говорить: важкий хвіст означає, що розподіл має нескінченний j-й момент для деякого цілого j. Крім того, всі dfs у доменній області залучення Pareto df мають великі …

2
Пропозиції щодо покращення ймовірності та статистики шпаргалок
Контекст: Прагнучи побудувати центральні фрагменти, які я натрапив на теорію ймовірностей та статику, я створив довідковий документ, орієнтований на математичні основи (доступний тут ). Ділячись цим документом, я сподіваюся дати студентам статистики вичерпний підсумок основного матеріалу, що викладається на аспірантурах з цих тем. Хоча в основному призначений як навчальний ресурс, …
22 teaching 

2
Яке розподіл відношення двох випадкових величин Пуассона?
У мене є питання щодо випадкових змінних. Припустимо , що у нас є дві випадкові величини і . Скажімо, - Пуассон, розподілений з параметром , а - Пуассон, розподілений з параметром .Y X λ 1 Y λ 2XXXYYYXXXλ1λ1\lambda_1YYYλ2λ2\lambda_2 Коли ви будуєте перелом з і називаєте це випадковою змінною , як …

2
Чому нульова гіпотеза завжди є тестовим значенням, а не діапазоном у тестуванні гіпотез?
Це дещо пов'язане з іншим питанням, яке я задав. У мене виникає питання, коли я роблю тестування гіпотез, коли альтернативна гіпотеза - це діапазон, нульова гіпотеза все ще є точковим значенням. Наприклад, при тестуванні, чи є коефіцієнт кореляції більше 0,5, нульовою гіпотезою є "кореляція = 0,5" замість "кореляція <= 0,5". …

1
Чому R-функції "princomp" і "prcomp" дають різні власні значення?
Для відтворення цього ви можете використовувати набір даних десятиборства {FactoMineR}. Питання полягає в тому, чому обчислені власні значення відрізняються від матриць коваріації. Ось власні значення, використовуючи princomp: > library(FactoMineR);data(decathlon) > pr <- princomp(decathlon[1:10], cor=F) > pr$sd^2 Comp.1 Comp.2 Comp.3 Comp.4 Comp.5 Comp.6 1.348073e+02 2.293556e+01 9.747263e+00 1.117215e+00 3.477705e-01 1.326819e-01 Comp.7 Comp.8 …
22 r  pca 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.