Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Чи "розділений сюжет" ANOVA з двома факторами такий же, як двостороння ANOVA з повторними заходами в одному факторі?
Чи є "розділений сюжет" ANOVA з двома факторами, ідентичним двосторонній ANOVA з повторними заходами в одному факторі? якщо ні, то в чому відмінність?

3
Парадокс престижного фокусника
Ви, напевно, знаєте хитрість у фільмі Престиж : [MOVIE SPOILER] Чарівник знайшов вражаючу магічну хитрість: він заходить в автомат, закриває двері, а потім зникає і знову з’являється в іншій частині кімнати. Але машина не досконала: замість того, щоб просто телепортувати його, вона дублює його. Маг залишається там, де він є, …

2
Як знайти, коли графік досягає піку і плато?
Це може здатися дуже базовим, але у мене є ця проблема: у мене черга даних із розміром вікна 300. Нові дані додаються з одного кінця, старі значення видаляються з іншого кінця. Я очікую, що дані черги залишаться більш-менш послідовними, наприклад: 10,12,15,10,20, потім почнуть різко зростати: 15,10,20,22,25,26,28,30,32 ... аж до 150 …

5
Що я можу зробити поза кореляцією Пірсона?
Перевіряючи, чи співвідносяться дві змінні, я помітив, що застосування кореляції Пірсона дало цифри аж до 0,1, що вказує на відсутність кореляції. Чи можна щось зробити, щоб посилити цю претензію? Набір даних (підмножина через обмеження розміщення), на яку я дивлюсь, це: 6162.178176 0.049820046 4675.14432 0.145022261 5969.056896 0.47210138 5357.506176 0.052263122 33.796224 16.45154204 …

1
Оцініть довірчий інтервал середнього методом bootstrap t або просто bootstrap?
Оцінюючи довірчий інтервал середнього значення, я думаю, що може застосовуватися як метод bootstrap t, так і непараметричний метод завантаження, але для першого потрібно трохи більше обчислень. Цікаво, які переваги та недоліки завантажувального пристрою t перед звичайним непараметричним завантажувальним пристроєм? Чому? Чи є деякі посилання для пояснення цього?

3
Як перевірити надзвичайно низькі показники помилок
Я зіткнувся зі спробою продемонструвати за допомогою тестування надзвичайно низького рівня помилок для датчика (не більше 1 помилки в 1 000 000 спроб). У нас обмежений час на проведення експерименту, тому ми передбачаємо, що не зможемо отримати більше ніж 4000 спроб. Я не бачу проблем із тим, що датчик не …

2
Який тип регресії використовувати, враховуючи одну змінну із верхньою межею?
Я не впевнений, який метод використовувати для моделювання взаємозв'язку між двома змінними (xxx і yyy) в експерименті описано так: Є 3 змінні: xaimxaimx_{aim}, xxx і yyy. Значення xaimxaimx_{aim}встановлюється при роботі експерименту. Однак,xxx і xaimxaimx_{aim} не завжди рівні. Коефіцієнт кореляції Пірсона між xaimxaimx_{aim} і xxx становить приблизно 0,9. Коефіцієнт кореляції Пірсона …

3
Алгоритм Апріорі простою англійською?
Я читав статті Вікі про Апріорі. У мене проблеми з розумінням чорносливу та кроку приєднання. Чи може хто-небудь пояснити мені, як алгоритм Apriori працює простими словами (такий, що новачок, як я, може зрозуміти легко)? Буде добре, якщо хтось пояснить покроковий процес, що бере участь у ньому.

4
Чи можна залишити дані досліджень, оскільки вони не є суттєвими?
Я зіткнувся з цим реченням, читаючи статтю на sciencemag.org . Зрештою, було включено відповіді лише 7600 дослідників у 12 країнах, оскільки решта даних не вважалися статистично значимими. Це правильний спосіб проведення досліджень? Не залишати результатів, оскільки їх не вважали статистично значимими?

3
Як швидко вибрати важливі змінні з дуже великого набору даних?
У мене є набір даних з близько 2000 бінарних змінних / 200 000 рядків, і я намагаюся передбачити одну бінарну залежну змінну. Моя головна мета на цьому етапі - не отримання точності прогнозування, а скоріше визначити, яка з цих змінних є важливими провісниками. Я хотів би знизити кількість змінних у …

5
Чи потрібні численні виправлення порівнянь для неформальних / візуальних «багаторазових порівнянь»?
У мене є якесь філософське запитання про те, коли потрібно багаторазове виправлення порівняння. Я вимірюю сигнал безперервного часу, що змінюється (в окремі моменти часу). Час від часу відбуваються окремі події, і я хотів би встановити, чи мають ці події суттєвий вплив на вимірюваний сигнал. Тож я можу взяти середній сигнал, …

4
Чому потрібен t-тест, враховуючи, що у нас є z-тест?
Чи може хтось дати пояснення, чому t-тест "трапляється"? Мене вчили використовувати t-тест, коли ви не знаєте стандартного відхилення сукупності (тобто ви знаєте лише стандартне відхилення вашого зразка), але я не впевнений, чому це може відрізняти його від z-тесту .

2
Тестування різниці (деяких) квантилів-Q між групами?
Для деякої змінної Y, яка поділяється на 3 групи (X), я хочу порівняти групи та за гіпотезою, що квантил 90% однаковий між усіма трьома групами. Які тести можна використовувати? Один з варіантів, про який я можу придумати, - це використання квантильної регресії, чи є інші альтернативи / програми? Я думаю, …


2
Дозволити даним диктувати пріори, а потім запустити модель за допомогою цих пріорів? (наприклад, пріори, керовані даними з одного набору даних)
Наскільки я розумію, ми не повинні дозволяти тому самому набору даних, який ми аналізуємо, для визначення / визначення того, як виглядають попередні розподіли в байєсівському аналізі. Зокрема, недоцільно визначати попередні розподіли для байєсівського аналізу на основі зведених статистичних даних із того ж набору даних, який ви збираєтесь використовувати пріори, щоб …
9 bayesian  prior 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.