Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Сезонне коригування щомісячного зростання з базовою щотижневою сезонністю
Як побічне захоплення я досліджував часові ряди прогнозування (зокрема, використовуючи R). За моїми даними, я маю кількість відвідувань на день, за кожен день назад майже 4 роки. У цих даних є кілька чітких закономірностей: Понеділок-Пт має багато відвідувань (найвище в пн / вт), але різко менше на сб-нд. Певна пора …

2
Модель пропорційної небезпеки Кокса та обрана вибірка без випадкових ознак
Чи є якісь методи виправлення упередженості в пропорційній моделі Кокса, пов'язані з випадковою вибіркою (щось на зразок виправлення Гекмана)? Передумови : Скажімо, ситуація виглядає так: - Протягом перших двох років всіх клієнтів приймають. - Після цих двох років будується модель Cox PH. Модель передбачає, як довго клієнти будуть користуватися нашою …
9 bias  cox-model 

4
Як боротися з розривами / NaN в даних часових рядів при використанні Matlab для автокореляції та нейронних мереж?
У мене є часовий ряд вимірювань (висоти - одновимірний ряд). У період спостереження процес вимірювання за деякий час знижувався. Таким чином, отримані дані є вектором з NaN, де у даних були прогалини. Використовуючи MATLAB, це викликає у мене проблеми при обчисленні автокореляції ( autocorr) та застосуванні нейронних мереж ( nnstart). …

3
Прийняття кореляції до або після log-перетворення змінних
Чи існує загальний принцип щодо того, чи слід обчислювати кореляцію персона для двох випадкових величин X і Y, перш ніж приймати їх логічне перетворення чи після? Чи є процедура тестування, яка є більш підходящою? Вони дають подібні, але різні значення, оскільки перетворення журналу нелінійне. Це залежить від того, чи X …

7
Шукаємо 2D штучні дані для демонстрації властивостей алгоритмів кластеризації
Я шукаю набори даних з двомірних точок даних (кожна точка даних є вектором двох значень (x, y)) за різними розподілами та формами. Код для створення таких даних також буде корисним. Я хочу використовувати їх для побудови / візуалізації ефективності роботи деяких алгоритмів кластеризації. Ось кілька прикладів: зірка, як хмарні дані …

1
Створення максимальної ентропійської моделі Маркова з існуючого багатовхідного класифікатора максимальної ентропії
Мене заінтригує концепція моделі максимальної ентропії Маркова (MEMM), і я думаю про те, щоб використати її для тегера частини мови (POS). На даний момент я використовую звичайний класифікатор максимальної ентропії (ME) для позначення кожного окремого слова. Для цього використовується ряд функцій, включаючи попередні два теги. МЕМ використовують алгоритм Вітербі для …

4
Перевірка на значну різницю співвідношень нормально розподілених випадкових величин
Пов'язано з аналізом коефіцієнтів змінних та Як параметризувати відношення двох нормально розподілених змінних або зворотну одну? . Припустимо, у мене є декілька зразків із чотирьох різних безперервних випадкових розподілів, які ми можемо вважати приблизно нормальними. У моєму випадку вони відповідають деяким показникам продуктивності двох різних файлових систем (скажімо, ext4 та …

4
Найефективніше замовити навчання LaTeX, Sweave, Beamer? [зачинено]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 3 роки тому . Мені дуже цікаво дізнатися, як створювати повторювані звіти з мого коду R та візуалізації ggplot2. Я розумію, що LaTeX, здається, є можливою …
9 r 

1
Фільтр частинок на прикладі R - тривіального коду
Я шукаю простий приклад коду, як запустити фільтр частинок в Р. Здається, що пакет пам’яті підтримує біт математики простору стану, але приклади трохи складні, щоб програматично наслідувати простого розробника OO, такого як я, зокрема як завантажити спостережувані дані в помпезний об’єкт. Приклади тут: http://cran.r-project.org/web/packages/pomp/vignettes/intro_to_pomp.pdf Скажімо, у мене є вхідний файл …
9 r 

1
Яка різниця між GLM та GEE?
Чим відрізняється модель GLM (логістична регресія) від бінарної змінної відповіді, що включає предмет і час у вигляді коваріатів, і аналогічну модель GEE, яка враховує кореляцію між вимірюваннями в декількох часових точках? Мій GLM виглядає так: Y(binary) ~ A + B1X1(subject id) + B2X2(time) + B3X3(interesting continuous covariate) з функцією посилання …

1
Облік дискретних або бінарних параметрів у байєсівському критерії інформації
BIC штрафується на основі кількості параметрів. Що робити, якщо деякі параметри є певними змінними бінарних індикаторів? Чи вважають це повними параметрами? Але я можу поєднати бінарних параметрів в одну дискретну змінну, яка приймає значення в . Чи слід їх вважати параметрами або одним параметром?ммm{ 0 , 1 , . . …

4
Зменшення кількості змінних у множинній регресії
У мене є великий набір даних, що складається із значень кількох сотень фінансових змінних, які можна було б використовувати в декількох регресіях для прогнозування поведінки індексного фонду в часі. Я хотів би зменшити кількість змінних до десяти або більше, зберігаючи якомога більше прогнозних можливостей. Додано: Скорочений набір змінних повинен бути …

1
Як обчислити міру точності на основі RMSE? Мій великий набір даних зазвичай розподіляється?
У мене є кілька наборів даних в порядку тисячі балів. Значення у кожному наборі даних - X, Y, Z, що стосуються координати в просторі. Значення Z являє собою різницю висот у парі координат (x, y). Зазвичай в моєму полі ГІС на похибку висоти посилається в RMSE шляхом віднімання точки земної …

2
Помилка під час запуску glmnet у мультиноміальному [закритому]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 9 місяців тому . Проблема, згадана в цьому питанні, виправлена ​​у версії 1.7.3 glmnet пакета R. У мене виникають проблеми з керуванням glmnet з сім'єю = …
9 r  multinomial  glmnet 

1
Як справедливо визначити переможців регіонального наукового ярмарку?
Мені потрібна допомога у з'ясуванні правильного способу розрахунку переможців на нашій науковій ярмарці. Я не хочу, щоб моє незнання статистики та математики заважало шансам на перемогу дитини. (багато виплат на стипендію та підвищення кваліфікації). Заздалегідь дякую за вашу допомогу. Спочатку трохи про те, як ми налаштували речі: Наш ярмарок, як …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.