Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

5
Способи зменшення даних високих розмірів для візуалізації
Я працюю над 2D фізичним моделюванням і збираю дані в часі в декілька моментів. Ці дискретні точки розташовані уздовж вертикальних ліній, з кількома лініями в осьовому напрямку. Це робить набір даних ефективно 4D. Наприклад, припустимо, що у мене є точки збору за (X, Y) координатами: (0,0), (1,0), (2,0) (0,1), (1,1), …

4
Як почати з рейтингу та ранжирування на основі парних даних змагань?
Мені цікаво дізнатись про те, як оцінювати та класифікувати осіб у групі, які взаємодіють / змагаються лише попарно (тобто такі системи, як система рейтингових оцінок ELO для шахів). Чи є якісь методи переходу або більш точні та вдосконалені методи? Чи є R-пакети, які спрощують реалізацію? Чи існують методи, які можуть …

3
Як я можу генерувати дані заздалегідь визначеною кореляційною матрицею?
Я намагаюся генерувати корельовану випадкову послідовність із середнім = , дисперсією = , коефіцієнтом кореляції = . У наведеному нижче коді я використовую & як стандартні відхилення, і & як засіб.1 0,80001110,80.80.8s1s2m1m2 p = 0.8 u = randn(1, n) v = randn(1, n) x = s1 * u + m1 …

3
Підтвердження того, що функції, що генерують момент, однозначно визначають розподіли ймовірностей
Текст Вакерлі та ін стверджує цю теорему "Нехай мх( т )мх(т)m_x(t) і му( т )му(т)m_y(t) позначають функції, що генерують момент випадкових змінних X і Y відповідно. Якщо обидві функції, що генерують момент, існують і мх( t ) = mу( т )мх(т)=му(т)m_x(t) = m_y(t) для всіх значень t, тоді X і …

2
Стабільність перехресної валідації в байєсівських моделях
Я встановлюю байєсівський HLM в JAGS, використовуючи k-кратну перехресну перевірку (k = 5). Мені хотілося б знати, чи стабільні оцінки параметра у всіх складках. Який найкращий спосіб зробити це?ββ\beta Одна ідея полягає в тому, щоб знайти різниці постерів і побачити, чи 0 в 95% CI різниці. Іншими словами, 0 в …

3
Як обчислити довірчий інтервал для середнього набору даних для нормального журналу?
Я чув / бачив у кількох місцях, що ви можете перетворити набір даних у те, що нормально розподіляється, взявши логарифм кожного зразка, обчислити довірчий інтервал для перетворених даних та перетворити довірчий інтервал назад за допомогою зворотної операції (наприклад, підняти 10 до потужності нижньої та верхньої меж відповідно для log10log10\log_{10} ). …

3
Причина нормалізації евклідових дистанційних заходів в ієрархічній кластеризації
Мабуть, в ієрархічній кластеризації, в якій мірою відстані є евклідова відстань, дані потрібно спочатку нормалізувати або стандартизувати, щоб запобігти руху коваріату з найбільшою дисперсією від керування кластеризацією. Чому це? Хіба цей факт не бажаний?


3
Яке значення функції у статистиці?
У моєму класі обчислення ми зіткнулися з функцією , або "кривою дзвону", і мені сказали, що в статистиці вона часто застосовується.e−x2e−x2e^{-x^2} З цікавості хочу запитати: чи справді важлива в статистиці функція ? Якщо так, то що це з приводу що робить його корисним та які є його додатки?e−x2e−x2e^{-x^2}e−x2e−x2e^{-x^2} Я не …

6
Програміст, який хоче прорватися до машинного навчання
Я розробник програмного забезпечення (в основному .NET і Python близько 5 років досвіду). Що я можу зробити, щоб допомогти мені влаштуватися на роботу в галузі машинного навчання або насправді все, що змусить мене почати працювати в цій галузі? Чи є серйозною вимогою аспірантура?


3
Інтерпретація моделі ARIMA
У мене питання про моделі ARIMA. Скажімо, у мене є часовий ряд YtYtY_t який я хотів би прогнозувати, і модель ARIMA(2,2)ARIMA(2,2)\text{ARIMA}(2,2) здається хорошим способом проведення прогнозування. ΔYt=α1ΔYt−1+α2ΔYt−2+νt+θ1νt−1+θ2νт−2ΔYt=α1ΔYt-1+α2ΔYт-2+νт+θ1νт-1+θ2νт-2 \Delta Y_t = \alpha_1 \Delta Y_{t-1} + \alpha_2 \Delta Y_{t-2} + \nu_{t} + \theta_1 \nu_{t-1} + \theta_2 \nu_{t-2} Тепер відставання YYY означає, що …

1
Чи корекція Бенджаміні-Хохберга більш консервативна, оскільки кількість порівнянь збільшується?
Наскільки консервативна корекція багаторазового тестування Бенджаміні-Хохберга щодо загальної кількості порівнянь? Наприклад, якщо у мене є список з 18000 функцій для двох груп і я виконую тест Вілкоксона, щоб отримати p-значення. Я коригую це значення p за допомогою Бенджаміні-Хохберга і майже нічого не виходить настільки значним. Я знаю, що корекція Бонферроні …

1
Використання стандартної помилки розподілу завантажувальної програми
(ігноруйте R-код за потреби, оскільки моє головне питання - незалежне від мови) Якщо я хочу подивитися на мінливість простої статистики (наприклад: середня), я знаю, що можу це зробити за допомогою теорії, наприклад: x = rnorm(50) # Estimate standard error from theory summary(lm(x~1)) # same as... sd(x) / sqrt(length(x)) або з …

1
Передбачувальне моделювання - чи варто дбати про змішане моделювання?
Для прогнозного моделювання нам потрібно ставитись до таких статистичних понять, як випадкові ефекти та незалежність спостережень (повторні заходи)? Наприклад.... У мене є дані з 5 кампаній прямої пошти (які відбувалися протягом року) з різними атрибутами та прапором для покупки. В ідеалі я використовував би всі ці дані в поєднанні для …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.