Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Які припущення щодо нормальності необхідні для непарного тесту? А коли їх зустрічають?
Якщо ми хочемо провести парний t-тест, вимога полягає (якщо я правильно розумію), щоб середня різниця між зібраними одиницями вимірювання розподілялася нормально. У парному t-тесті це сформульовано (AFAIK) з вимогою, щоб різниця між зібраними одиницями вимірювання розподілялася нормально (навіть якщо розподіл кожної з двох порівняних груп не є нормальним). Однак у …

1
Одностороння Чебішева нерівність на вищий момент
Чи є аналог вищому моменту нерівності Чебишева в однобічному випадку? Нерівність Чебишева-Кантеллі, здається, працює лише на дисперсію, тоді як нерівність Чебишева може бути легко вироблена для всіх показників. Хтось знає про однобічну нерівність із використанням вищих моментів?

1
Hosmer-Lemeshow vs AIC для логістичної регресії
Якщо Hosmer-Lemeshow вказує на відсутність придатності, але AIC є найнижчим серед усіх моделей .... чи варто все-таки використовувати модель? Якщо я видаляю змінну, статистика Хосмера-Лемешоу не є істотною (це означає, що немає грубої недостатності придатності). Але АПК збільшується. Редагувати : Я думаю, загалом, якщо AIC різних моделей близькі (тобто ) …

2
Модифікація Лассо для ЛАРС
Я намагаюся зрозуміти, як алгоритм Ларса можна модифікувати для генерації Лассо. Поки я розумію LARS, я не в змозі побачити модифікацію Лассо з статті Tibshirani et al. Зокрема, я не бачу, чому умова знаку в тому, що знак ненульової координати має відповідати знаку поточної кореляції. Може хтось, будь ласка, допоможе …
12 lasso 

1
Різниця в реалізації двійкових розщеплень у деревах рішень
Мені цікаво практична реалізація бінарного розколу на дереві рішень - оскільки це стосується рівнів категоричного предиктора .ХjХjX{j} Зокрема, я часто буду використовувати якусь схему відбору зразків (наприклад, розфасування, пересимплінг тощо), коли будую модель прогнозування за допомогою дерева рішень, щоб поліпшити її точність прогнозування та стабільність. Під час цих процедур вибірки …

3
Варіанти розміщення для загальнодоступних даних
Тож ви вирішили підтримати ідею відтворюваних досліджень і хочете зробити свої дані доступними в Інтернеті, щоб люди могли їх бачити та використовувати. Питання в тому, де ви його приймаєте? Моя перша схильність - це, звичайно, приватне веб-простір, який я маю на університетському сервері, але ці речі насправді не є настільки …

2
SVM з неоднаковими розмірами груп у навчальних даних
Я намагаюся створити SVM з навчальних даних, де одна група представлена ​​більше, ніж інша. Однак групи будуть однаково представлені у кінцевих даних тесту. Тому я хотів би використовувати class.weightsпараметр e1071інтерфейсу пакету R, libsvmщоб збалансувати вплив двох груп на навчальні дані. Оскільки я не знав, як саме слід вказати ці ваги, …

2
Наближення інтегралів з використанням моделювання Монте-Карло в R
Як я можу наблизити наступний інтеграл за допомогою моделювання MC? ∫1−1∫1−1|x−y|dxdy∫−11∫−11|x−y|dxdy \int_{-1}^{1} \int_{-1}^{1} |x-y| \,\mathrm{d}x \,\mathrm{d}y Дякую! Правка (деякий контекст): Я намагаюся навчитися використовувати моделювання для наближення інтегралів, і я отримую певну практику, коли зіткнувся з деякими труднощами. Редагувати 2 + 3 : Якось заплутався і подумав, що потрібно розділити …

9
Як я можу створювати приємні графіки автоматично?
Напр. наприклад, на цій сторінці http://store.steampowered.com/hwsurvey Чи є якесь готове програмне забезпечення, яке може це зробити? Як альтернатива, будь-які рекомендації щодо іншого програмного забезпечення, яке робить щось подібне? Я знаю, що це насправді не питання статистики, але я дуже наголошую, що дані повинні бути представлені акуратно і привабливо, щоб бути …

2
Параметричне моделювання дисперсії даних лічильників
Я шукаю, щоб моделювати деякі дані, але я не впевнений, який тип моделі я можу використовувати. У мене є дані про підрахунок, і я хочу, щоб модель дала параметричні оцінки як середнього, так і дисперсійного даних. Тобто, у мене є різні прогнозні чинники, і я хочу визначити, чи впливає який-небудь …

4
Довідники для консультацій зі статистиками, які пропонують своїм клієнтам
Це питання ілюструє труднощі людини опановувати статистику та ймовірність самостійно, за умови слабко розвинених ресурсів, таких як Вікіпедія. Мені прийшло в голову, що консультації зі статистиками, а їх тут небагато, можуть звичайно стикатися з проблемою пояснення клієнтові певних понять і методів. Це зворотний бік педагогічної монети. Коли хтось освоїв цю …

3
Читання лише двох з трьох стовпців з read.csv
Заблокований . Це запитання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. У мене є набір даних ascii, який складається з трьох стовпців, але лише два останні є фактичними даними. Тепер я хочу створити точку діаграм даних за …
12 r 

4
Приклади дорогих наслідків від неправильного використання статистичних інструментів
Я підозрюю, що більшість користувачів статистичних інструментів є допоміжними користувачами (люди, які майже не мали офіційного навчання статистиці). Для дослідників та інших фахівців дуже спокусливо застосовувати статистичні методи до своїх даних просто тому, що вони бачили це "зроблено раніше" у рецензованих роботах, сірій літературі, в Інтернеті або на конференції. Однак, …

5
Чи можна використовувати PCA, щоб зробити змінний вибір для кластерного аналізу?
Я повинен зменшити кількість змінних для проведення кластерного аналізу. Мої змінні сильно корелюються, тому я думав зробити факторний аналіз PCA (аналіз основних компонентів). Однак якщо я використовую отримані оцінки, мої кластери не зовсім коректні (порівняно з попередніми класифікаціями в літературі). Питання: Чи можу я використовувати матрицю обертання для вибору змінних …

4
Прогнозування двійкових часових рядів
У мене є двійковий часовий ряд з 1, коли машина не рухається, і 0, коли машина рухається. Я хочу зробити прогноз на часовий горизонт до 36 годин вперед і на кожну годину. Першим моїм підходом було використання Naive Bayes, використовуючи такі входи: t-24 (щоденний сезон), t-48 (сезонний тиждень), година дня. …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.