Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Які загальні моделі прогнозування можна розглядати як особливі випадки моделей ARIMA?
Сьогодні вранці я прокинувся, дивуючись (це може бути пов’язано з тим, що минулої ночі я не спав багато): оскільки перехресне підтвердження здається наріжним каменем правильного прогнозування часових рядів, які моделі я повинен "зазвичай" "перехресне підтвердження проти? Я придумав декілька (легких), але незабаром зрозумів, що це все, крім особливих випадків моделей …

4
Як обчислити кумулятивний розподіл у R?
Заблокований . Це питання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Мені потрібно обчислити сукупну функцію розподілу вибірки даних. Чи є щось подібне до hist () в R, яке вимірює функцію кумулятивної щільності? У мене є спроби …
23 r  distributions  cdf 

4
Чи є реалізація Random Forest, яка добре працює з дуже рідкими даними?
Чи є R випадкова реалізація лісу, яка добре працює з дуже рідкими даними? У мене є тисячі або мільйони булевих вхідних змінних, але лише сотні або близько того будуть ПРАВИЛЬНИми для будь-якого прикладу. Я відносно новий в R і помітив, що існує пакет "Матриця" для роботи з розрідженими даними, але …

3
Візуалізація калібрування передбачуваної ймовірності моделі
Припустимо, у мене є прогнозована модель, яка створює для кожного примірника ймовірність для кожного класу. Тепер я визнаю, що існує багато способів оцінити таку модель, якщо я хочу використовувати ці ймовірності для класифікації (точність, відкликання тощо). Я також усвідомлюю, що крива ROC та площа під нею можна використовувати для визначення …

4
Чи є непараметричний еквівалент HSD Tukey?
Я використовую JMP для вивчення відмінностей рослинного покриву в групах росту (дерева, кущі, кущі тощо) до та після трьох обробок контролем. Розмір моєї вибірки невеликий (n = 5), і більшість моїх розподілів зазвичай не розподіляються. Для нормальних розподілів я використовував ANOVA для аналізу різниць (відсоткової зміни) між результатами лікування, потім …

2
Розподіл відстані махаланобіса на рівні спостереження
Якщо у мене є багатоваріантний нормальний зразок iid X1,…,Xn∼Np(μ,Σ)X1,…,Xn∼Np(μ,Σ)X_1, \ldots, X_n \sim N_p(\mu,\Sigma) , і визначити (яка є різновидом відстані махаланобіса [в квадраті] від вибіркової точки до вектора використовуючи матрицю для зважування), який розподіл (відстань махаланобіса до вибірки середнє значення використанням матриці коваріації вибірки )?a Ad2i(b,A)=(Xi−b)′A−1(Xi−b)di2(b,A)=(Xi−b)′A−1(Xi−b)d_i^2(b,A) = (X_i - b)' …

3
Як перевірити автокореляцію залишків?
У мене є матриця з двома стовпцями, які мають багато цін (750). На зображенні нижче я накреслив залишки наступної лінійної регресії: lm(prices[,1] ~ prices[,2]) Дивлячись на зображення, здається, дуже сильна автокореляція залишків. Однак як я можу перевірити, чи є автокореляція цих залишків сильною? Який метод я повинен використовувати? Дякую!

3
Сайти для змагань з прогнозного моделювання
Я беру участь у змаганнях з прогнозування моделювання на Kaggle , TunedIt та CrowdAnalytix . Я вважаю, що ці сайти є хорошим способом "відпрацювати" статистику / машинне навчання. Чи є інші сайти, про які я повинен знати? Як ви ставитесь до змагань, де господар має намір отримати прибуток від подання …

4
Чи завжди існує максимізатор для будь-якої проблеми з MLE?
Цікаво, чи завжди існує максимізатор для будь-якої проблеми з оцінкою ймовірності максимальної (log-)? Іншими словами, чи є деякий розподіл та деякі його параметри, для яких проблема MLE не має максимізатора? Моє запитання випливає із твердження інженера, що функція витрат (вірогідність чи схожість на журнал, я не впевнений, що було призначено) …

4
Як рецензент, чи можу я обґрунтувати запит про надання даних та коду, навіть якщо журнал цього не робить?
Оскільки наука повинна бути відтвореною, за визначенням зростає визнання того, що дані та код є важливим компонентом відтворюваності, про що йдеться в Єльському круглому столі для обміну даними та кодом . Переглядаючи рукопис журналу, який не потребує обміну даними та кодом, чи можу я вимагати надання даних та коду доступними …

3
Створення випадкових корельованих даних між бінарною та суцільною змінною
Я хочу генерувати дві змінні. Один - бінарний змінний результат (скажімо, успіх / невдача), а другий - вік у роках. Я хочу, щоб вік позитивно співвідносився з успіхом. Наприклад, має бути більше успіхів у старших вікових сегментах, ніж у нижчих. В ідеалі я повинен бути в змозі контролювати ступінь кореляції. …

4
Чи слід видаляти випадки, які зазначаються статистичними програмними засобами як переживаючі при здійсненні багаторазової регресії?
Я роблю кілька регресійних аналізів, і не впевнений, чи слід видаляти застарілі дані з моїх даних. Дані, які мене турбують, з’являються як "кола" на скриньках SPSS, однак зірочок немає (що змушує мене думати, що вони не такі "погані"). Випадки, які мене турбують, відображаються у таблиці "Діагностика випадкових випадків" на виході …


4
Які ефективні способи впорядкувати R-код і вихід? [зачинено]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для Cross Valified. Закритий минулого року . Я шукаю інформацію про те, як інші організовують свій R-код та вихід. Моя нинішня практика - писати код у блоках у текстовий файл …

2
Чим відрізняється PCA від асимптотичного PCA?
У двох роботах у 1986 та 1988 роках Коннор та Корайчик запропонували підхід до моделювання прибутку активів. Оскільки в цих часових рядах зазвичай є більше активів, ніж спостереження за часовий період, вони запропонували виконати PCA на поперечному перерізі коефіцієнтів повернення активів. Цей метод вони називають асимптотичним аналізом основних компонентів (APCA, …
23 pca  econometrics 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.