Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Різний сюжет прогнозування від виживання кокс і rms cph
Я створив власну трохи вдосконалену версію термплота, яку я використовую в цьому прикладі, ви можете знайти її тут . Я раніше розміщував повідомлення про SO, але чим більше я думаю про це, я вважаю, що це, ймовірно, більше пов'язане з інтерпретацією моделі небезпеки Кокса, ніж з фактичним кодуванням. Проблема Коли …
9 r  survival  cox-model 

1
Коли вибрати PCA проти LSA / LSI
Питання: Чи є якісь загальні вказівки щодо характеристик вхідних даних, які можна використовувати для вирішення між застосуванням PCA та LSA / LSI? Короткий підсумок PCA проти LSA / LSI: Принциповий компонентний аналіз (PCA) та латентний семантичний аналіз (LSA) або латентна семантична індексація (LSI) подібні в тому сенсі, що всі вони …

1
Найкращий спосіб обробляти незбалансований набір даних багаторівневих класів за допомогою SVM
Я намагаюся побудувати модель прогнозування з SVM на досить незбалансованих даних. Мій етикетки / вихід мають три класи: позитивний, нейтральний та негативний. Я б сказав, що позитивний приклад становить приблизно 10 - 20% моїх даних, нейтральний - 50 - 60%, а негативний - 30 - 40%. Я намагаюся збалансувати класи, …

1
Як визначити, що таке «зразок»?
Якщо я даю вам три числа, які незалежно і однаково виведені зі стандартного нормального розподілу, то я дав вам три зразки або один зразок? Якщо відповідь - один зразок, то чи є коротке ім’я того, що я дав вам три?

1
Поради для аспірантів зі статистики
Я розпочав докторську ступінь зі статистики цього року, і шукаю ваші найкращі практики, поради та (мета-поради) щодо того, як вирости та стати добрим науковим дослідником у галузі статистики / МЗ. Загальні думки та посилання вітаються, але для того, щоб почати прокручування м'яча, ось низка питань, зібраних із чудової статті Майкла …
9 careers  phd  academia 

1
Як поєднати прогнози, коли змінна відповідь у моделях прогнозування була різною?
Вступ В поєднанні прогнозів одне з популярних рішень базується на застосуванні певного інформаційного критерію. Взявши для прикладу критерій AkaikeAICjAICjAIC_j оцінено для моделі jjj, можна обчислити відмінності AICjAICjAIC_j з AIC∗=minjAICjAIC∗=minjAICjAIC^* = \min_j{AIC_j}і тоді RPj=e(AIC∗−AICj)/2RPj=e(AIC∗−AICj)/2RP_j = e^{(AIC^*-AIC_j)/2} можна інтерпретувати як відносну ймовірність того, що модель jjj є справжньою. Потім ваги визначаються як …

2
Як вписати регресію типу в R?
У мене є дані часових рядів, де вимірювана змінна - це дискретні додатні цілі числа (рахунки). Я хочу перевірити, чи є тенденція до зростання (чи ні). Незалежна змінна (x) знаходиться в діапазоні 0-500, а залежна змінна (y) знаходиться в діапазоні 0-8. Я подумав, що відповідаю на це, встановлюючи регресію форми …
9 r  regression  python 

4
Як реалізувати фіктивну змінну за допомогою змінних n-1?
Якщо у мене є змінна з 4 рівнями, теоретично мені потрібно використовувати 3 фіктивні змінні. На практиці, як це насправді здійснюється? Чи використовую 0-3, чи використовую 1-3, а 4 залишаю порожнім? Будь-які пропозиції? ПРИМІТКА. Я буду працювати в Р. ОНОВЛЕННЯ: Що буде, якщо я просто використовую один стовпець, який використовує …

4
Як кількісно сказати, чи 1D дані кластеризовані навколо 1 або 3 значень?
У мене є деякі дані про час між серцебиттями у людини. Однією з ознак позаматкових (зайвих) ударів є те, що ці інтервали кластеризовані навколо трьох значень замість одного. Як я можу отримати кількісну міру цього? Я хочу порівняти кілька наборів даних, і ці дві 100-бінкові гістограми є репрезентативними для всіх. …

1
Розподіл коефіцієнта зворотної регресії
Припустимо, у нас є лінійна модель яка відповідає всім стандартним припущенням регресії (Гаусса-Маркова). Нас цікавить .уi=β0+β1хi+ϵiуi=β0+β1хi+ϵiy_i = \beta_0 + \beta_1 x_i + \epsilon_iθ = 1 /β1θ=1/β1\theta = 1/\beta_1 Запитання 1: Які припущення необхідні, щоб розподіл був чітко визначений? буде важливим --- будь-які інші?θ^θ^\hat{\theta}β1≠ 0β1≠0\beta_1 \neq 0 Питання 2: Додайте припущення, …

2
Чи можна довіряти регресії, якщо змінні автокорельовані?
Обидві змінні (залежні та незалежні) демонструють ефекти автокореляції. Дані часові ряди та стаціонарні Під час запуску регресії залишки не співвідносяться. Моя статистика Дурбіна-Уотсона більша за верхнє критичне значення, тому є докази того, що терміни помилок не є позитивно співвіднесеними. Крім того, коли я будую ACF для помилок, схоже, що там …

3
Що може бути чітким, практичним визначенням для "сім'ї гіпотез" (стосовно рівня помилок у сімейному режимі)?
Коли я намагався оцінити, що являє собою сімейні гіпотези в рамках експерименту / проекту / аналізу, я виявив "подібні за призначенням" та "подібні за змістом", що даються як рекомендації щодо розмежування сімей, але вони залишають досить багато відкритих для тлумачення ( щонайменше). Здається зрозумілим, що якщо в ході аналізу я …



1
Візуалізація послідовних пропорцій
Я намагаюся візуалізувати деякі дані споживачів, у яких є 4 категорії. Користувачі можуть перемикатися між різними категоріями. Я хотів би візуалізувати останні три-чотири вимикачі для кожної людини. Отже, ми б почали з сюжету зі стовпцем з 4 складеними пропорціями. Після цього у нас було б 16, оскільки кожна категорія розбивається …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.