Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Що це за трюк із додаванням сюди 1?
Я дивився на цю сторінку про реалізацію Монте-Карло тесту Ліллефорса. Я не розумію цього речення: Існує випадкова помилка в цьому розрахунку від моделювання. Однак через хитрість додавання 1 до чисельника та знаменника при обчисленні значення P це може бути використане прямо, без огляду на випадковість. Що вони означають під хитрістю …

1
Коли використовувати домішки Джині і коли використовувати інформаційний приріст?
Може хтось, будь ласка, пояснить мені, коли слід використовувати домішки Джині та отримання інформації для дерев рішень? Чи можете ви надати мені ситуації / приклади, коли найкраще використовувати який?

3
Чи є якесь значення зменшення розмірності набору даних, де всі змінні приблизно ортогональні?
Припустимо, у мене є -вимірний набір даних, де розміри приблизно ортогональні (мають нульову кореляцію).NNNNNNN Чи є якась утиліта з точки зору: Візуалізація Представлення (для ефективності класифікатора) Або інші критерії виконати зменшення розмірності даних?

1
Як отримати вибірку Гіббса?
Я насправді вагаюся з цим запитати, бо боюся, що мене віднесуть до інших питань або Вікіпедії щодо вибірки Гіббса, але я не маю відчуття, що вони описують те, що під рукою. Дана умовна ймовірність : p ( x | y ) y = y 0 y = y 1 x …
11 sampling  mcmc  gibbs 

3
Чи є в США відомі упередження щодо телефонних опитувань?
Я дивився опитування у WashingtonTimes / ABC, і результати, особливо за віком, здалися мені дивовижними. Тому я пішов шукати упередження. У ньому сказано: "опитування було проведено по телефону 11-14 грудня 2014 року серед випадкової вибірки 1000 дорослих людей. Інтерв'ю проводили англійською та іспанською мовами на стаціонарних та мобільних телефонах". Опитування …
11 polling  politics 

2
Економетрика байєсівського підходу до методології вивчення подій
Дослідження подій широко поширені в економіці та фінансах, щоб визначити вплив події на ціну акцій, але вони майже завжди базуються на частоталістичних міркуваннях. Регресія OLS - протягом еталонного періоду, що відрізняється від вікна події - зазвичай використовується для визначення параметрів, необхідних для моделювання нормальної віддачі для активу. Потім визначається статистична …

2
Якщо моя гістограма показує дзвіноподібну криву, чи можу я сказати, що мої дані зазвичай розподіляються?
Я створив гістограму для епохи респондента і зумів отримати дуже гарну криву дзвоникоподібної форми, з якої я зробив висновок, що розподіл нормальний. Тоді я провів тест на нормальність у SPSS, з n = 169. Р- значення (Сиг.) Тесту Колмогорова-Смірнова менше 0,05, і тому дані порушили припущення про нормальність. Чому тест …

2
p-значення тонкощі: більший-рівний проти більший
Коли я читаю книгу «Вся статистика» Вассермана, я помічаю тонку тонкість у визначенні p-значень, яку я не можу мати сенс. Неофіційно Wassermann визначає значення p як [..] ймовірність (під ) спостереження за значенням тестової статистики такою ж, як і більше, ніж те, що фактично спостерігалось.Н0Н0H_0 Акцент додано. Те ж саме …

1
Що говорить мій графік ACF про мої дані?
У мене є два набори даних: Мій перший набір даних - це вартість інвестицій (у мільярдах доларів) за часом, кожен одиниця часу становить одну чверть з першого кварталу 1947 року. Час поширюється на 3 квартал 2002 року. Мій другий набір даних "є результатом перетворення значень інвестицій [першого набору даних] у …

1
Яка різниця між керуванням змінною в регресійній моделі від контрольної для змінної у вашому проекті дослідження?
Я думаю, що контроль за змінною у вашому проекті дослідження є більш ефективним для зменшення помилок, ніж контроль за нею пост-хок у вашій регресійній моделі. Хтось міг би офіційно пояснити, чим відрізняються ці два випадки "контролю"? Наскільки порівняно ефективні вони при зменшенні помилок та більш точних прогнозах?

1
Моделювання в Монте-Карло в R
Я намагаюся вирішити наступну вправу, але фактично не маю поняття, як почати це робити. У своїй книзі я знайшов якийсь код, який виглядає так, але це зовсім інша вправа, і я не знаю, як їх пов’язати з іншим. Як я можу почати моделювати прибуття та як дізнатися, коли вони закінчуються? …

1
Використання стандартних інструментів машинного навчання на даних, що цензуруються ліворуч
Я розробляю програму прогнозування, мета якої - дозволити імпортеру прогнозувати попит на свою продукцію із своєї мережі клієнтів дистриб'юторів. Показники продажів є досить хорошим показником попиту, якщо існує достатня кількість запасів, щоб заповнити попит. Однак, коли товарний запас знижується до нуля (ситуація, яку ми прагнемо допомогти нашому клієнту уникнути), ми …

4
Виявлення поза часом у часовій серії: Як зменшити помилкові позитиви?
Я намагаюся автоматизувати зовнішнє виявлення у часових рядах, і я використав модифікацію рішення, запропонованого тут Роб Хайндманом . Скажімо, я вимірюю щоденні відвідування веб-сайту з різних країн. Для деяких країн, де щоденних відвідувань є кілька тисяч або тисячі, мій метод, здається, працює розумно. Однак у тих випадках, коли країна веде …

2
Чому руніф не створює однаковий результат кожного разу?
Чому так, що генератори випадкових чисел, як runif()у R, не створюють однаковий результат кожного разу? Наприклад: X <- runif(100) X щоразу генерує різні результати. Яка причина щоразу створювати різні результати? Які функції функціонують у фоновому режимі для цього?

2
glmnet: Як зрозуміти багаточленну параметризацію?
Наступна проблема: Я хочу передбачити категоричну змінну відповіді з однією (або більше) категоричними змінними за допомогою glmnet (). Однак я не можу зрозуміти, що вихідний glmnet дає мені. Гаразд, спочатку сгенеруємо дві пов'язані категоріальні змінні: Створення даних p <- 2 #number variables mu <- rep(0,p) sigma <- matrix(rep(0,p^2), ncol=p) sigma[1,2] …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.