Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Документ про тестування гіпотез на основі результатів іншого тесту
Добре відомо, що вибирати статистичний тест на підставі результатів іншого статистичного тесту проблематично, оскільки значення p важко неможливо інтерпретувати (наприклад, вибір статистичного тесту на основі результату іншого (наприклад, нормальності) ) . Однак це все ще є стандартною практикою у багатьох програмах і, як правило, не помічається або обговорюється у прикладних …

1
Оцінка нахилу прямої частини сигмовидної кривої
Мені було дано це завдання і застукали. Колега попросив мене оцінити та x l o w e r наступної діаграми:хu p p e rхуppеrx_{upper}хл о ш е рхлошеrx_{lower} Крива насправді є кумулятивним розподілом, а x - це якесь вимірювання. Йому цікаво знати, які є відповідні значення на x, коли сукупна …

1
Розуміння виводу завантажувальної програми, виконаної в R (tsboot, MannKendall)
У мене виникає запитання щодо інтерпретації виклику tsboot в Р. Я перевірив документацію як Kendall, так і завантажувального пакету, але я не розумніший, ніж раніше. Коли я запускаю завантажувальний інструмент, використовуючи, наприклад, приклад в пакеті Kendall, де тестовою статистикою є тау Kendall: library(Kendall) # Annual precipitation entire Great Lakes # …
11 r  bootstrap 

2
Чи є рандомізація надійною з невеликими зразками?
Джером Корнфілд написав: Одним з найкращих плодів рибальської революції була ідея рандомізації, і статистики, які погоджуються на кілька інших речей, принаймні погодились на це. Але, незважаючи на цю угоду і незважаючи на широке використання рандомізованих процедур розподілу в клінічній та інших формах експериментів, її логічний статус, тобто точна функція, яку …

1
Гіперприорна щільність для ієрархічної моделі Гамма-Пуассона
В ієрархічній моделі даних де y ∼ Пуассон ( λ ) λ ∼ Гамма ( α , β ) на практиці типово вибирати значення ( α , β ), такі, що середнє значення та дисперсія гамма-розподілу приблизно збігаються з середнє значення та відмінність даних y (наприклад, Клейтон та Калдор, 1987, …

1
Інтервал прогнозування = достовірний інтервал?
Мені цікаво, чи інтервал прогнозування та достовірний інтервал оцінюють те саме. Наприклад, з лінійною регресією, коли ви оцінюєте інтервал прогнозування встановлених значень, ви оцінюєте межі інтервалу, в якому ви очікуєте падіння вашої величини. Навпаки на довірчий інтервал, ви орієнтуєтесь не на такий параметр розподілу, як середнє значення, а на значення, …

2
Як працює «поетапна регресія»?
Я використовував наступний код R, щоб відповідати пробітній моделі: p1 <- glm(natijeh ~ ., family=binomial(probit), data=data1) stepwise(p1, direction='backward/forward', criterion='BIC') Я хочу знати, що саме stepwiseі що потрібно backward/forwardробити, і як вибрати змінні?

2
Як такі програми, як BUGS / JAGS, автоматично визначають умовні розподіли для вибірки Gibbs?
Здається, що повні умови часто бувають досить важкими, але такі програми, як JAGS та BUGS, отримують їх автоматично. Чи може хтось пояснити, як вони алгоритмічно генерують повні умови для будь-якої довільної специфікації моделі?

2
Як отримати об'єднані значення p на тестах, виконаних у декількох наборах даних?
Використовуючи Amelia в R, я отримав декілька імпутованих наборів даних. Після цього я провів повторну перевірку вимірювань у SPSS. Тепер я хочу об'єднати результати тестів. Я знаю, що я можу використовувати правила Рубіна (реалізовані через будь-який пакет множинних імпутацій в R) для об'єднання засобів і стандартних помилок, але як я …

1
Усереднення точності та відкликання при використанні перехресної перевірки
Я здійснив класифікацію, використовуючи декілька класифікаторів для даних, позначених двома класами, і використовував 5-кратну перехресну перевірку. На кожну складку я обчислював tp, tn, fp і fn. Тоді я підрахував точність, точність, відкликання та F-бал для кожного тесту. Моє запитання полягає в тому, що, коли я хочу оцінити результати, я взяв …

4
Як вибрати кількість дерев в узагальненій моделі посиленої регресії?
Чи існує стратегія вибору кількості дерев в ГБМ? Зокрема, ntreesаргумент у R's gbmфункції. Я не бачу, чому ви не повинні встановлювати ntreesмаксимальне розумне значення. Я помітив, що більша кількість дерев явно знижує мінливість результатів від кількох ГБМ. Я не думаю, що велика кількість дерев призведе до надмірного вбрання. Будь-які думки?

2
У яких налаштуваннях довірчі інтервали не покращаться, оскільки розмір вибірки збільшується?
У публікації в блозі я знайшов твердження, що "Я вважаю, що WG Cochrane вперше зазначив (приблизно в 1970-х роках), що з довірчими інтервалами в умовах спостереження невеликі розміри вибірки призводять до кращого покриття достатньо великими зразками, що забезпечують майже нульове покриття!" Тепер я припускаю, що ширина CI повинна наближатися до …

2
Класифікація часових рядів - дуже погані результати
Я працюю над проблемою класифікації часових рядів, де вхід - це дані про використання голосу часових рядів (у секундах) протягом перших 21 днів рахунку стільникового телефону. Відповідна цільова змінна - це чи скасовано цей обліковий запис у межах 35-45 днів. Отже, це проблема бінарної класифікації. Я отримую дуже погані результати …

1
Як інтерпретувати від'ємний коефіцієнт лінійної регресії для зареєстрованої змінної результату?
У мене є лінійна модель регресії, де залежна змінна реєструється, а незалежна змінна - лінійна. Коефіцієнт нахилу для ключової незалежної змінної від'ємний: . Не знаєте, як інтерпретувати.- .0564−.0564-.0564 Чи використовую я абсолютне значення, а потім перетворять його на такий : ( Досвід( 0,0564 ) - 1 ) ⋅ 100 = …

1
Приклад максимальної оцінки після
Я читав про оцінку максимальної ймовірності та максимальну післяорієнтовану оцінку, і поки що я зустрічав конкретні приклади лише з максимальною оцінкою ймовірності. Я знайшов декілька абстрактних прикладів максимальної оцінки після, але нічого конкретного з цифрами: S Це може бути дуже непосильним, працюючи лише з абстрактними змінними та функціями, і щоб …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.