Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як використовувати аналіз основних компонентів для вибору змінних для регресії?
В даний час я використовую аналіз основних компонентів для вибору змінних, які використовуватимуться при моделюванні. На даний момент я роблю вимірювання A, B і C у своїх експериментах. Що я дійсно хочу знати: чи можу я зробити менше вимірювань і припинити запис C і або B, щоб заощадити час і …

1
Умовна гомоскедастичність проти гетерокедастичності
З економетрики , Фуміо Хаяші (гл. 1): Беззастережна гомоскедастичність: Другий момент термінів помилки E (εᵢ²) є постійним у всіх спостереженнях Функціональна форма E (εᵢ² | xi) є постійною в спостереженнях Умовна гомоскедастичність: Знімається обмеження, що другий момент термінів помилки E (εᵢ²) є постійним у всіх спостереженнях Таким чином, умовний другий …

2
Пошук точності оцінки імітації Монте-Карло
Фон Я розробляю моделювання Монте-Карло, що поєднує в собі результати ряду моделей, і я хочу бути впевненим, що моделювання дозволить мені висловити обґрунтовані твердження щодо ймовірності імітованого результату та точності цієї оцінки ймовірності. Моделювання знайде ймовірність того, що присяжні, складені із визначеної громади, засудять певного підсудного. Це етапи моделювання: Використовуючи …

1
Тестова еквівалентність вкладених моделей
Скажімо, - лінійна функція і манекен . Моя гіпотеза полягає в тому, що само по собі , як гедоністичні індексу вектора інших змінних, . У мене є підтримка цього в з (тобто , , ..., ) на . Чи є можливість перевірити еквівалентність цих двох моделей:ууyххxггdггdZZZМА НО VАМАNОVАMANOVAZZZz1z1z_1z2z2z_2zнzнz_nггd Модель 1:у= …


4
Пірсонова кореляція наборів даних з можливо нульовим стандартним відхиленням?
У мене виникають проблеми з обчисленням коефіцієнта кореляції грушевих наборів даних з можливо нульовим стандартним відхиленням (тобто всі дані мають однакове значення). Припустимо, у мене є такі два набори даних: float x[] = {2, 2, 2, 3, 2}; float y[] = {2, 2, 2, 2, 2}; Коефіцієнт кореляції "r" обчислюється …

3
Перехід від використання статистичного програмного забезпечення до розуміння математичних рівнянь?
Контекст: Я докторант психології. Як і у багатьох аспірантів з психології, я знаю, як проводити різні статистичні аналізи за допомогою статистичного програмного забезпечення, аж до таких методів, як PCA, класифікаційні дерева та кластерний аналіз. Але це насправді не задовольняє, оскільки, хоча я можу пояснити, чому я робив аналіз та що …

3
Відповідний спосіб поводження з 3-х рівневою таблицею надзвичайних ситуацій
У мене є трирівнева таблиця на випадок надзвичайних ситуацій, що містить дані про декілька видів, рослину-господаря, з якої вони були зібрані, і чи відбулося це збирання в дощовий день (це насправді має значення!). Використовуючи R, підроблені дані можуть бути приблизно подібними: count <- rpois(8, 10) species <- rep(c("a", "b"), 4) …

1
Загальна помилка I типу при повторному тестуванні накопичувальних даних
У мене є питання про групові послідовні методи . За даними Вікіпедії: У рандомізованому дослідженні з двома групами лікування класичне групове послідовне тестування використовується таким чином: Якщо наявне n суб'єктів у кожній групі, проводиться проміжний аналіз на 2n суб'єктів. Статистичний аналіз проводиться для порівняння двох груп, і якщо альтернативна гіпотеза …

2
Що я повинен знати про створення хорошого гібридного / гамільтонівського алгоритму Монте-Карло?
Я розробляю гібридний алгоритм вибірки Монте-Карло для PyMC , і я намагаюся зробити це максимально вільним і загальним, тому шукаю гарних порад щодо розробки алгоритму HMC. Я прочитав розділ опитування Радфорда та Beskos et. Нещодавній документ про оптимальну настройку HMC (розмір кроку), і я зібрав наступні поради: Змінні імпульсу повинні …

2
Як швидко взяти вибірку X, якщо exp (X) ~ Gamma?
У мене проста проблема вибірки, де виглядає моя внутрішня петля: v = sample_gamma(k, a) де sample_gammaзразки з розподілу Гамми утворюють зразок Діріхле. Це працює добре, але для деяких значень k / a деякі з обчислень нижче за течією підпадають. Я адаптував його до використання змінних простору журналу: v = log(sample_gamma(k, …

7
Які пакети пошуку текстових програм для R та чи існують інші програми з відкритим кодом текстового видобутку?
Чи можете ви порекомендувати пакет для видобутку тексту в R, який можна використовувати проти великих обсягів даних? По-друге, чи доступний графічний інтерфейс для будь-якого з пакетів обміну тексту в R? По-третє, чи існує інша програма з відкритим кодом для розробки тексту, яка є простою та інтуїтивно зрозумілою у використанні?
12 r  text-mining 

1
Інтернет, масштабовані статистичні методи
На це надихнула Ефективна лінійна регресія в Інтернеті , що мені здалося дуже цікавою. Чи є тексти чи ресурси, присвячені великомасштабним статистичним обчисленням, за допомогою яких обчислення з наборами даних занадто великі, щоб вміститися в основній пам'яті, і, можливо, занадто різноманітні, щоб ефективно підпробовувати. Наприклад, чи можна встановити моделі змішаних …

2
GLM після вибору моделі або регуляризації
Я б хотів поставити це питання у двох частинах. Обидва стосуються узагальненої лінійної моделі, але перша стосується вибору моделі, а друга стосується регуляризації. Передумови: я використовую GLM (лінійні, логістичні, гамма-регресії) моделі як для прогнозування, так і для опису. Коли я маю на увазі " нормальні речі, що робиться з регресією …

5
Краща відстань у використанні
Контекст У мене є два набори даних, які я хочу порівняти. Кожен елемент даних в обох наборах є вектором, що містить 22 кути (всі між і ). Кути відносяться до заданої конфігурації пози людини, тому поза визначається 22 кутами суглоба.π−π−π-\piππ\pi Що я в кінцевому підсумку намагаюся зробити, це визначити "близькість" …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.