Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Вибір моделі PCA за допомогою AIC (або BIC)
Я хочу використати інформаційний критерій Akaike (AIC), щоб вибрати відповідну кількість факторів для вилучення в PCA. Єдине питання полягає в тому, що я не впевнений, як визначити кількість параметрів. Розглянемо матрицю , де представляє кількість змінних, а кількість спостережень, таких що . Оскільки матриця коваріації симетрична, то при максимальній оцінці …

1
Залежність між кількістю векторів підтримки та кількістю функцій
Я запустив SVM проти заданого набору даних і зробив наступне спостереження: Якщо я зміню кількість функцій для побудови класифікатора, то кількість векторів підтримки в результаті також буде змінена. Мені хотілося б знати, як пояснити такий сценарій.

1
Навіщо використовувати зареєстровані змінні?
Напевно, це дуже основне питання, але я, здається, не зможу знайти на нього твердої відповіді. Я тут сподіваюся, можу. Зараз я читаю документи як підготовку до власної магістерської роботи. Наразі я читаю документ, який досліджує взаємозв’язок між твітами та особливостями фондового ринку. В одній зі своїх гіпотез вони припускають, що …

3
SVD матриці з відсутніми значеннями
Припустимо, у мене є матриця рекомендацій у стилі Netflix, і я хочу створити модель, яка передбачає потенційні майбутні рейтинги фільмів для даного користувача. Використовуючи підхід Саймона Функ, можна використовувати стохастичний градієнтний спуск, щоб мінімізувати норму Фробеніуса між повною матрицею і матрицею «за пунктом * користувач-користувач» у поєднанні з терміном регуляції …


5
Чи стверджують, що байєсисти коли-небудь існують випадки, коли їхній підхід узагальнює / збігається з частістським підходом?
Чи заперечують Байєси, що їхній підхід узагальнює частістський підхід, тому що можна використовувати неінформативні пріори і, отже, можна відновити типову структуру частолістської моделі? Чи може хтось направити мене до місця, де я можу прочитати про цей аргумент, якщо він справді використовується? РЕДАКТУВАННЯ: Можливо, це запитання не точно так, як я …

2
Різниця між дослідницьким та підтверджуючим факторним аналізом при визначенні незалежності конструкції
Дослідники часто використовують два заходи, у яких є дуже схожі предмети і стверджують, що вони вимірюють різні речі (наприклад, "Я завжди хвилююся, коли навколо автомобілів"; "Я боюся машин"). Дозвольмо назвати гіпотетичні заходи міра страху та тривоги від автомобільної шкали. Мене цікавить емпіричне тестування, чи дійсно вони оцінюють різні приховані конструкції, …

2
PCA та випадкові ліси
Для нещодавнього змагання Kaggle я (вручну) визначив 10 додаткових функцій для мого навчального набору, які потім будуть використовуватися для тренування випадкового класифікатора лісів. Я вирішив запустити PCA на набір даних з новими функціями, щоб побачити, як вони порівнюють один одного. Я виявив, що ~ 98% дисперсії несе перший компонент (перший …

2
Як зменшити кількість елементів, використовуючи аналіз факторів, внутрішню узгодженість та теорію відгуку елементів разом?
Я зараз емпірично розробляю анкету, і я буду використовувати в якості прикладу довільні числа для ілюстрації. Для контексту я розробляю психологічну анкету, спрямовану на оцінку думок, які зазвичай виявляються у людей, які мають тривожні розлади. Елемент може виглядати так: "Мені потрібно кілька разів перевірити духовку, оскільки я не можу бути …

4
Чи можу я використовувати показник Z зі скасованими та ненормальними даними? [зачинено]
Закрито . Це питання потребує деталей або ясності . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Додайте деталі та уточніть проблему, відредагувавши цю публікацію . Закрито 5 років тому . Я працював з деякими даними про час циклу процесу та масштабуванням, використовуючи стандартний z-бал, щоб порівняти між частинами повного …

1
Що таке корекція зміщення? [зачинено]
Закрито . Це питання потребує деталей або ясності . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Додайте деталі та уточніть проблему, відредагувавши цю публікацію . Закрито 4 роки тому . Я бачив багато місць, де вони мають набори даних вводу / виводу, де спочатку створюють лінійну лінію регресії, виправляють …

2
Лінійний дискримінантний аналіз та правило Байєса: класифікація
Яке відношення між лінійним дискримінантним аналізом та правилом Байєса? Я розумію, що LDA використовується в класифікації, намагаючись мінімізувати співвідношення між груповою дисперсією та між дисперсією групи, але я не знаю, як в ній використовується правило Байєса.

2
Залишковий аналіз логістичної регресії
Це питання є загальним і довготривалим, але будь ласка, майте на увазі мене. У своєму застосуванні у мене є безліч наборів даних, кожен складається з ~ 20000 точок даних з ~ 50 особливостями та однією залежною бінарною змінною. Я намагаюся моделювати набори даних за допомогою регульованої логістичної регресії (пакет R …

1
Графікування кривої ймовірності для моделі Logit з кількома прогнозами
У мене є така функція ймовірності: Проблема = 11 + е- zProb=11+e−z\text{Prob} = \frac{1}{1 + e^{-z}} де z= В0+ В1Х1+ ⋯ + BнХн.z=B0+B1X1+⋯+BnXn.z = B_0 + B_1X_1 + \dots + B_nX_n. Моя модель виглядає так Пр ( У= 1 ) = 11 + експ( - [ - 3,92 + 0,014 …

1
Як можна оптимізувати обчислювальну ефективність при підгонці складної моделі до великого набору даних неодноразово?
У мене виникають проблеми з ефективністю використання MCMCglmmпакету в R для запуску моделі зі змішаними ефектами. Код виглядає так: MC1<-MCMCglmm(bull~1,random=~school,data=dt,family="categorical" , prior=list(R=list(V=1,fix=1), G=list(G1=list(V=1, nu=0))) , slice=T, nitt=iter, ,burnin=burn, verbose=F) За даними є близько 20 000 спостережень, вони об'єднані приблизно в 200 шкіл. Перед запуском я видалив усі невикористані змінні з …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.