Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як зробити перехресну перевірку за пропорційною моделлю небезпеки Кокса?
Припустимо, я побудував модель прогнозування виникнення певної хвороби в одному наборі даних (набір даних щодо побудови моделі) і тепер хочу перевірити, наскільки добре працює модель у новому наборі даних (валідація даних). Для моделі, побудованої з логістичною регресією, я обчислював би прогнозовану ймовірність для кожної людини в наборі даних перевірки на …

2
Як вибрати рівень значущості для великого набору даних?
Я працюю з набором даних, що має близько 200 000. У регресії я бачу дуже малі значення значущості << 0,001, пов'язані з дуже малими розмірами ефекту, наприклад r = 0,028. Що я хотів би знати, чи існує принциповий спосіб визначення відповідного порогу значущості щодо розміру вибірки? Чи є якісь важливі …

2
Розбиття дерев на R: сторона проти rpart
Минув час, як я подивився на перегородки дерев. Востаннє я робив подібні речі, мені подобається вечірка в R (створена Hothorn). Ідея умовного умовиводу через вибірку має для мене сенс. Але rpart також мав звернення. У поточній заявці (я не можу дати деталей, але це передбачає спробу визначити, хто потрапить до …
15 r  cart  rpart  partitioning 

3
Який хороший підхід до навчання R в комп'ютерній лабораторії?
Було кілька хороших запитань і наборів відповідей щодо вступних книг або підходів до вивчення R, наприклад, тут і тут . Але у мене є дещо інша проблема - найкращий спосіб провести годину сеансу (або декілька таких сеансів) у комп'ютерній лабораторії, яка допоможе людям розпочати роботу в R, ознайомитись з її …
15 r  teaching 

1
Як слід реалізувати розбиття дерева рішень при прогнозуванні постійних змінних?
Я фактично пишу реалізацію випадкових лісів, але я вважаю, що питання стосується дерев рішень (незалежно від РФ). Отже, контекст полягає в тому, що я створюю вузол у дереві рішень, і змінні прогнозування, і цілі є безперервними. Вузол має розділений поріг для даних розділів на два набори, і я створюю новий …

1
Щільність нормального розподілу по мірі збільшення розмірів
Питання, яке я хочу задати, таке: як змінюється частка вибірок в межах 1 SD середнього значення нормального розподілу зі збільшенням кількості змінних? (Майже) всім відомо, що при 1-мірному нормальному розподілі 68% зразків можна знайти в межах 1 стандартного відхилення середнього значення. Як щодо розмірів 2, 3, 4, ...? Я знаю, …

3
Коли слід розглянути можливість використання GMM?
Однією з речей, яка робить економетрику унікальною, є використання техніки Узагальненого методу моментів. Які типи проблем роблять GMM більш доцільним, ніж інші методи оцінки? Що за допомогою використання GMM купує вас з точки зору ефективності, зменшення упередженості або більш конкретної оцінки параметрів? І навпаки, що ви втрачаєте, використовуючи GMM через …

3
Як я можу оцінити кількість унікальних випадків за допомогою випадкової вибірки даних?
Скажімо, у мене є великий набір значень які іноді повторюються. Я хочу оцінити загальну кількість унікальних значень у великій множині.SSS Якщо я беру випадкову вибірку значень і визначаю, що вона містить унікальні значення , чи можу я використати це для оцінки кількості унікальних значень у великій множині?ТТTТуТуT_u

4
Яка кореляція, якщо стандартне відхилення однієї змінної дорівнює 0?
Як я розумію, ми можемо отримати кореляцію, нормалізуючи коваріацію за допомогою рівняння ρi,j=cov(Xi,Xj)σiσjρi,j=cov(Xi,Xj)σiσj\rho_{i,j}=\frac{cov(X_i, X_j)}{\sigma_i \sigma_j} де - стандартне відхилення . Xiσi=E[(Xi−μi)2]−−−−−−−−−−−√σi=E[(Xi−μi)2]\sigma_i=\sqrt{E[(X_i-\mu_i)^2]}XiXiX_i Мене хвилює те, що якщо стандартне відхилення дорівнює нулю? Чи є якась умова, яка гарантує, що вона не може бути нульовою? Спасибі.

2
Збільшення кількості функцій призводить до падіння точності, але збільшення попереднього / відкликання
Я новачок у машинному навчанні. На даний момент я використовую класифікатор Naive Bayes (NB), щоб класифікувати невеликі тексти у 3-х класах як позитивні, негативні чи нейтральні, використовуючи NLTK та python. Провівши деякі тести, з набором даних, що складається з 300 000 екземплярів (16 924 позитивні, 7 477 негативів і 275 …

6
Як виявити суттєву зміну даних часових рядів через зміну “політики”?
Я сподіваюся, що це правильне місце для публікації цього запису, я розглядав питання щодо скептиків, але вважаю, що вони просто скажуть, що дослідження було статистично неправильним. Мені цікаво зворотний бік питання, як це зробити правильно. На веб-сайті Quantified Self , автор розмістив результати експерименту певної метрики виробленої на ньому часу …

9
Чи може стандартне відхилення негативних даних перевищувати середнє?
У мене є трикутні 3D-сітки. Статистика для районів трикутника: Мінімум 0,000 Макс 2341,141 Має на увазі 56.317 Std dev 98.720 Отже, чи означає щось особливо корисне щодо стандартного відхилення чи припускаєте, що в його обчисленні є помилки, коли цифри виходять, як описано вище? Території, безумовно, далеко не звичайні. І як …

5
Що таке хороший ресурс, який включає порівняння плюсів і мінусів різних класифікаторів?
Який найкращий класичний класифікатор 2-го класу? Так, я думаю, це питання про мільйон доларів, і так, я знаю, що немає теореми про безкоштовний обід , і я також прочитав попередні питання: Який найкращий класичний класифікатор 2-х класів для вашої програми? і Найгірший класифікатор І все-таки мені цікаво читати більше на …

1
Як побудувати функцію сходових сходів за допомогою ggplot?
Заблокований . Це запитання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. У мене такий графік: R код для його генерації: DF <- data.frame(date = as.Date(runif(100, 0, 800),origin="2005-01-01"), outcome = rbinom(100, 1, 0.1)) DF <- DF[order(DF$DateVariable),] #Sort by …

1
Власні функції матриці суміжності часового ряду?
Розглянемо простий часовий ряд: > tp <- seq_len(10) > tp [1] 1 2 3 4 5 6 7 8 9 10 ми можемо обчислити матрицю суміжності для цього часового ряду, що представляє часові зв’язки між зразками. Обчислюючи цю матрицю, ми додаємо уявний сайт у момент часу 0, а зв'язок між …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.