Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Питання про функцію автоковаріації зразка
Я читаю книгу аналізу часових рядів, а формула для автоковаріації зразків визначається в книзі як: γˆ(h)=n−1∑t=1n−h(xt+h−x¯)(xt−x¯)γ^(h)=n−1∑t=1n−h(xt+h−x¯)(xt−x¯)\widehat{\gamma}(h) = n^{-1}\displaystyle\sum_{t=1}^{n-h}(x_{t+h}-\bar{x})(x_t-\bar{x}) здля . - середнє значення.γˆ(−h)=γˆ(h)γ^(−h)=γ^(h)\widehat{\gamma}(-h) = \widehat{\gamma}(h)\;h=0,1,...,n−1h=0,1,...,n−1\;h = 0,1, ..., n-1x¯x¯\bar{x} Чи може хтось інтуїтивно пояснити, чому ми ділимо суму на а не на ? У книзі пояснюється, що це тому, що …

2
Які є хороші ресурси для історії аналізу часових рядів?
Я перевірив відповідь на це запитання на сайті stats.stackexchange: Які хороші ресурси надають історію статистики? Дійсно, книга Стиглера "Статистика на таблиці" виглядає чудово, і я з нетерпінням чекаю її. Але мене більше цікавить розробка сучасних моделей ARIMA. Думаю, я пам’ятаю, що чув, що великий прогрес був стимульований у спробі передбачити …


1
Зазначення терміну Error () у повторних заходах ANOVA в R
У мене виникають проблеми з визначенням помилок для двосторонніх повторних заходів ANOVA в Р. Мої дані складаються з оцінок щільності деревини для трьох радіальних положень (внутрішнього, середнього та зовнішнього) уздовж ядра, витягнутого з дерева. Всього існує 20 видів дерев, 6 особин кожного виду та по два ядра з кожного дерева. …


2
Книга для непараметричної статистики
Що було б гарною книгою для непараметричної статистики. Не просто вступ, а просунутий рівень. Також я дивлюсь на те, що я можу використовувати для навчання, а не для довідок. Зокрема, я шукаю книгу, яка може містити основи непараметричних методів, непараметричні умовиводи, методи оцінки непараметричних параметрів, наприклад, тест KS, тест тощо, …

3
Алгоритм машинного навчання для ранжирування
У мене набір елементів XXX яку я можу описати згідно nnnхарактеристики. Таким чином: xi:{ci1,ci2,…,cin}∣xi∈Xxi:{ci1,ci2,…,cin}∣xi∈Xx_i: \{c_{i1}, c_{i2}, \ldots, c_{in}\} \mid x_i \in X де cijcijc_{ij} є (числовою) оцінкою для елемента iii за характеристиками jjj. Тому мої елементи можна розглядати як точки в аnnn розмірний простір. Згідно з моїми показаннями, існують такі …

2
Невеликі та незбалансовані розміри вибірки для двох груп - що робити?
У мене є дані для двох груп (тобто вибірки), які я хочу порівняти, але загальний розмір вибірки невеликий (n = 29) і сильно незбалансований (n = 22 проти n = 7). Ці дані є логістично складними і дорогими для збору, тому, хоча "зібрати більше даних" як очевидне рішення в цьому …


1
Що таке точкова дисперсія?
Читаючи "Елементи статистичного навчання" , я кілька разів стикався з терміном "точкова різниця". Хоча я маю неясне уявлення про те, що це, ймовірно, означає, я буду вдячний знати Як це визначено? Як воно виводиться?
10 variance 

3
Чи є верхня межа кількості інтервалів в гістограмі?
Я прочитав кілька статей та уривків із книг, в яких пояснюється, як вибрати достатню кількість інтервалів (бункерів) для гістограми набору даних, але мені цікаво, чи існує жорстка максимальна кількість інтервалів на основі кількості балів у набір даних або якийсь інший критерій. Передумови: Причина, яку я запитую, полягає в тому, що …

2
REML проти ML stepAIC
Я відчуваю себе переповненим після спроби зануритися в літературу про те, як запустити мішаний аналіз моделі після його використання з використанням AIC для вибору найкращої моделі чи моделі. Я не думаю, що мої дані є настільки складними, але я шукаю підтвердження того, що те, що я зробив, є правильним, а …

1
Інтерпретація коефіцієнтів взаємодії категоріальної та безперервної змінної
У мене є питання про інтерпретацію коефіцієнтів взаємодії між неперервною та категоричною змінною. ось моя модель: model_glm3=glm(cog~lg_hag+race+pdg+sex+as.factor(educa)+(lg_hag:as.factor(educa)), data=base_708) Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 21.4836 2.0698 10.380 < 2e-16 *** lg_hag 8.5691 3.7688 2.274 0.02334 * raceblack -8.4715 1.7482 -4.846 1.61e-06 *** racemexican -3.0483 1.7073 -1.785 0.07469 . …

3
Winbugs та інші MCMC без інформації для попереднього розповсюдження
Що відбувається, коли ви не маєте уявлення про розподіл параметрів? Який підхід ми повинні використовувати? Більшу частину часу ми прагнемо підкреслити, якщо певна змінна має який-небудь вплив на наявність / відсутність певного виду, і змінна приймається чи ні відповідно до значення змінної. Це означає, що більшість випадків ми не замислюємось …
10 r  bayesian  mcmc  bugs  winbugs 

5
Чи нормально спочатку підходити байєсівська модель, а потім починати ослаблювати пріори?
Роблячи частоту статистику, існує довгий список великих нотаток, як-от переглядати результати статистичних тестів, перш ніж вирішити збирати більше даних. Мені цікаво взагалі, чи є подібний перелік "no-no" для методологій, що беруть участь у байєсівській статистиці, і конкретно, чи є наступна з них. Нещодавно я зрозумів, що для деяких моделей, до …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.