Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Як знайти інтервал прогнозування GBM
Я працюю з моделями GBM, використовуючи пакет caret і шукаю спосіб вирішити інтервали передбачення для моїх прогнозованих даних. Я широко шукав, але придумав лише кілька ідей, щоб знайти інтервали передбачення для Random Forest. Будь-який код допомоги / R буде дуже вдячний!

3
Розуміння параметрів функції Гаусса Базиса, що використовуються в лінійній регресії
Я хотів би застосувати функцію бази Гаусса в реалізації лінійної регресії. На жаль, мені важко зрозуміти пару параметрів у базовій функції. Зокрема μμ\mu і σσ\sigma . Мій набір даних - матриця 10 000 х 31. 10 000 зразків та 31 особливість. Я читав, що "Кожна основна функція перетворює вхідний вектор …

3
Як я можу інтерпретувати графік відсоткового обрізання проти обрізаного середнього?
У частині запитання домашнього завдання мене попросили обчислити обрізану середню для набору даних, видаливши найменше і найбільше спостереження, та інтерпретувати результат. Обрізана середня була нижчою, ніж середня середня. Моя інтерпретація полягала в тому, що основний розподіл був позитивно перекошений, тому лівий хвіст щільніше, ніж правий хвіст. В результаті цього перекосу …

4
Яке співвідношення незалежних розподілів дає нормальне розподіл?
Співвідношення двох незалежних нормальних розподілів дає розподіл Коші. T-розподіл - це нормальний розподіл, розділений на незалежний розподіл chi-квадрата. Співвідношення двох незалежних чі-квадратних розподілів дає F-розподіл. Я шукаю співвідношення незалежних безперервних розподілів, яке дає нормально розподілену випадкову змінну із середнім та дисперсією ?σ 2мкмк\muσ2σ2\sigma^2 Можливо, існує нескінченний набір можливих відповідей. Чи …


4
Хороша форма для видалення залишків?
Я працюю над статистикою для побудови програмного забезпечення. У мене є дані про кожну збірку про пропуск / відмову та минулий час, і ми генеруємо ~ 200 таких / тиждень. Коефіцієнт успішності легко агрегувати, я можу сказати, що 45% пройшли будь-який тиждень. Але я також хотів би узагальнити минулий час, …

3
тестування логістичних коефіцієнтів регресії з використанням
Короткий зміст: Чи існує яка-небудь статистична теорія, яка б підтримувала використання -розподілу (зі ступенями свободи на основі залишкового відхилення) для тестів коефіцієнтів логістичної регресії, а не стандартного нормального розподілу?ttt Деякий час тому я виявив, що при встановленні логістичної регресійної моделі в SAS PROC GLIMMIX, за замовчуванням, коефіцієнти логістичної регресії перевіряються …

2
Чому SAS PROC GLIMMIX дає мені ДУЖЕ різні випадкові нахили, ніж glmer (lme4) для двочленного glmm
Я користувач, більш знайомий з R, і намагаюся оцінити випадкові схили (коефіцієнти відбору) приблизно для 35 осіб протягом 5 років за чотирма змінними середовища проживання. Змінна відповіді - це те, чи місце розташування "використано" (1) або "доступне" (0) середовище ("використання" нижче). Я використовую 64-розрядний комп'ютер Windows. У R версії 3.1.0 …

1
Осягання результатів аналізу медіації в R
Я намагаюся обвести голову навколо пакета посередництва в R, використовуючи віньєтку для пакета. Я намагаюся зрозуміти вихід mediate()функції. require("mediation") require("sandwich") data("framing") med.fit <- lm(emo ~ treat + age + educ + gender + income, data = framing) out.fit <- glm(cong_mesg ~ emo + treat + age + educ + gender …
12 r  mediation 

3
Ідея складання даних має нульове значення
Я часто бачу, як люди, які роблять розмір / особливість набору даних, мають нульове значення, видаляючи середнє з усіх елементів. Але я ніколи не розумів, навіщо це робити? Який ефект робити це як крок попередньої обробки? Чи покращує це ефективність класифікації? Чи допомагає це відповісти щось про набір даних? Чи …

4
Чи можна моделювати стаціонарну серію за допомогою ARIMA?
У мене є питання / плутанина щодо стаціонарних серій, необхідних для моделювання з ARIMA (X). Я думаю про це більше з точки зору висновку (ефекту від втручання), але хотів би знати, чи прогнозування проти умовиводу має якусь різницю у відповіді. Питання: Усі прочитані вами вступні ресурси стверджують, що серія повинна …

2
Чи неправильно використовувати графіки ліній для дискретних даних?
Я часто бачив дискретні набори даних, побудовані у вигляді графіків ліній, але мені здається, що лінія визначає значення в точці між інтервалами вимірювання, що не має сенсу для дискретних наборів даних. Чи не так це використання лінійних графіків для дискретних даних неправильно? Як приклад, візьміть два набори даних часового ряду, …

3
Який найкращий спосіб змінити / змінити дані?
Я науковий співробітник лабораторії (волонтер). Я та мала група отримали завдання щодо аналізу даних для набору даних, отриманих із великого дослідження. На жаль, дані були зібрані за допомогою якогось інтернет-додатка, і вони не були запрограмовані для виведення даних у найбільш зручній формі. На малюнках нижче зображено основну проблему. Мені сказали, …
12 r  excel  data-cleaning 

2
Чи більш імовірно, що зазвичай розподілені X і Y призводять до нормально розподілених залишків?
Тут обговорюється неправильне трактування припущення про нормальність в лінійній регресії (що "нормальність" позначає X та / або Y, а не залишки), і плакат запитує, чи можливо не нормально розподілені X і Y і все ще мають нормально розподілені залишки. Моє запитання: як правило, розподілені X і Y мають більше шансів …

3
Експоненціальна верхня межа
Припустимо, у нас є IID випадкові величини з розподілом B e r ( θ ) . Ми будемо спостерігати зразок X я «S наступним чином: нехай Y 1 , ... , Y п незалежні В е г ( 1 / +2 ) випадкові величини, припустимо , що всі X я …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.