Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Як перевірити, яка модель краща в аналізі простору часових рядів стану?
Я роблю аналіз даних часових рядів методами державного простору. З моїх даних, модель стохастичного локального рівня повністю перевершила детерміновану модель. Але детермінована модель рівня та схилу дає кращі результати, ніж при стохастичному рівні та стохастичному / детермінованому нахилі. Це щось звичайне? Всі методи в R вимагають початкових значень, і я …

1
Кластеризація: Чи слід використовувати розбіжність Дженсена-Шеннона або його квадрат?
Я кластеризую розподіл ймовірностей, використовуючи алгоритм розповсюдження афінності , і я планую використовувати дивергенцію Дженсена-Шеннона як мій показник відстані. Чи правильно використовувати JSD як відстань, або JSD у квадраті? Чому? Які відмінності випливали б із вибору того чи іншого?

2
Зв'язок статистики Баєса та генеративного моделювання
Чи може хтось віднести мене до хорошої довідки, яка пояснює зв’язок між байєсівською статистикою та методами генеративного моделювання? Чому ми зазвичай використовуємо генеративні моделі за допомогою байєсівської техніки? Чому особливо привабливо використовувати статистику Баєса за відсутності повних даних, якщо вони взагалі є? Зауважте, що я виходжу з більш орієнтованого на …


5
Різниця між термінами "спільний розподіл" та "багатоваріантний розподіл"?
Я пишу про використання "спільного розподілу ймовірностей" для аудиторії, яка з більшою ймовірністю зрозуміє "багатоваріантний розподіл", тому я розглядаю можливість використання пізніше. Однак я не хочу втрачати сенс, роблячи це. Вікіпедія, схоже, вказує, що це синоніми. Чи вони? Якщо ні, то чому б і ні?

3
Як узагальнити дані за хвилину за тиждень у погодинний засіб?
Як би ви отримали погодинний засіб для декількох стовпців даних за щоденний період та показували результати для дванадцяти "хостів" в одному графіку? Тобто, я хотів би накреслити, як виглядає 24-годинний період, на тижні даних. Можливою метою буде порівняння двох наборів цих даних до та після вибірки. dates Host CPUIOWait CPUUser …

2
Експоненціальна зважена рухомість / куртоз
Існують добре відомі он-лайн формули для обчислення експоненціально зважених ковзних середніх значень і стандартних відхилень процесу (xn)n=0,1,2,…(xn)n=0,1,2,…(x_n)_{n=0,1,2,\dots} . У середньому, μn=(1−α)μn−1+αxnμn=(1−α)μn−1+αxn\mu_n = (1-\alpha) \mu_{n-1} + \alpha x_n і для дисперсії σ2n=(1−α)σ2n−1+α(xn−μn−1)(xn−μn)σn2=(1−α)σn−12+α(xn−μn−1)(xn−μn)\sigma_n^2 = (1-\alpha) \sigma_{n-1}^2 + \alpha(x_n - \mu_{n-1})(x_n - \mu_n) з якого можна обчислити стандартне відхилення. Чи існують подібні формули …

3
Добре ознайомлення з часовими рядами (з R)
В даний час я збираю дані для експерименту психосоціальних особливостей, пов'язаних із відчуттям болю. В рамках цього я збираю вимірювання GSR та BP в електронному вигляді від моїх учасників, разом з різними самодоповідями та неявними заходами. Я маю психологічну основу і мені подобається факторний аналіз, лінійні моделі та експериментальний аналіз. …

3
Як оптимізувати свій R-скрипт, щоб використовувати "багатоядерний"
Я використовую GNU R на комп'ютері Ubuntu-Lucid, який має 4 процесора. Для використання всіх 4 процесорів я встановив пакет "r-cran-multicore". Оскільки в посібнику з пакета бракує практичних прикладів, які я розумію, мені потрібні поради щодо оптимізації мого сценарію для використання всіх 4 процесорів. Мій набір даних - це фрейм data.frame …
15 r 

5
Чи може емпіричний гессіан М-оцінювача бути невизначеним?
Джеффрі Уолдрідж у своєму Економетричному аналізі даних перерізів та панелей (стор. 357) говорить, що емпіричний Гессіан "не гарантується певним позитивним чи навіть позитивним напівфінітом для конкретного зразка, з яким ми працюємо". Мені це здається неправильним, оскільки (числові проблеми, крім) Гессіан повинен бути позитивним напівдефінітом у результаті визначення М-оцінника як значення …

3
Підручники з об'єктно-орієнтованого програмування в R [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Закрито 4 роки тому . Заблокований . Це запитання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Чи є хороші підручники з об'єктно-орієнтованого програмування в R? Було б …
15 r 


1
Релаксація Лагрангія в умовах регресії хребта
У статті "Елементи статистичного навчання" (2-е видання), с. 63, автори дають наступні дві постановки проблеми регресії хребта: β^ridge=argminβ{∑i=1N(yi−β0−∑j=1pxijβj)2+λ∑j=1pβ2j}β^ridge=argminβ{∑i=1N(yi−β0−∑j=1pxijβj)2+λ∑j=1pβj2} \hat{\beta}^{ridge} = \underset{\beta}{\operatorname{argmin}} \left\{ \sum_{i=1}^N(y_i-\beta_0-\sum_{j=1}^p x_{ij} \beta_j)^2 + \lambda \sum_{j=1}^p \beta_j^2 \right\} і β^ridge=argminβ∑i=1N(yi−β0−∑j=1pxijβj)2, subject to ∑j=1pβ2j≤t.β^ridge=argminβ∑i=1N(yi−β0−∑j=1pxijβj)2, subject to ∑j=1pβj2≤t. \hat{\beta}^{ridge} = \underset{\beta}{\operatorname{argmin}} \sum_{i=1}^N(y_i-\beta_0-\sum_{j=1}^p x_{ij} \beta_j)^2 \text{, subject to } \sum_{j=1}^p \beta_j^2 …

4
Інтервали довіри для параметрів регресії: Байесова проти класичної
З огляду на два масиви x і y, обидві довжиною n, я підходять до моделі y = a + b * x і хочу обчислити 95% довірчий інтервал для схилу. Це (b - дельта, b + дельта), де b зустрічається звичайним чином і delta = qt(0.975,df=n-2)*se.slope а se.slope - це …

5
Як моделювати ціни?
Я задав це запитання на сайті matemathics stackexchange і мені рекомендували задати тут. Я працюю над хобі-проектом і мені потрібна допомога з наступною проблемою. Трохи контексту Скажімо, є колекція предметів з описом особливостей та ціни. Уявіть список машин та ціни. Усі автомобілі мають перелік особливостей, наприклад, розмір двигуна, колір, потужність …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.