Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Приміщення багатофакторного, натурального кубічного сплайну
зауважте: не маючи правильних відповідей через місяць, я відправив повідомлення в ТА Фон У мене є модель, , де Y = f ( X )fffY= f( X )Y=f(Х)Y=f(\textbf{X}) ХХ\textbf{X} - матриця зразків з параметрів, а - вектор модельних виходів.n × mн×мn \times mммmYYYn × 1н×1n \times 1 fff обчислювально інтенсивно, …

2
Обчислення 95-го перцентиля: Порівняння підходів нормального розподілу, R квантілі та Excel
Я намагався обчислити 95-й процентиль на наступному наборі даних. Я натрапив на кілька онлайн-довідок про це. Підхід 1: На основі вибіркових даних Перший один говорить мені , для отримання TOP 95 Percentнабору даних , а потім виберіть MINабо AVGз результуючого набору. Це робиться для наступного набору даних: AVG: 29162 MIN: …
17 r  dataset  quantiles  sql 

5
Як класифікувати за випадковими лісами в R, як слід регулювати незбалансовані розміри класів?
Я вивчаю різні методи класифікації проекту, над яким я працюю, і мені цікаво спробувати випадкові ліси. Я намагаюся просвітити себе, коли я йду разом, і буду вдячний за будь-яку допомогу, надану спільнотою CV. Я розділив свої дані на навчальні / тестові набори. Від експериментів зі випадковими лісами в R (використовуючи …

7
Чи передбачає проста лінійна регресія причинного зв'язку?
Я знаю, що кореляція не означає причинно-наслідкових зв’язків, а натомість силу та напрямок відносин. Чи передбачає проста лінійна регресія причинного зв'язку? Або для цього необхідний інфекційний (t-тест тощо)?

2
Як інтерпретувати Exp (B) в регресії Кокса?
Я студент-медик, який намагається зрозуміти статистику (!) - тож будь ласка, будь ласка! ;) Я пишу есе, що містить неабияку кількість статистичного аналізу, включаючи аналіз виживання (регрес Каплана-Мейєра, Регрес-Рейтингу та Кокса). Я провів регрес Кокса за своїми даними, намагаючись з’ясувати, чи можу я виявити значну різницю між смертністю пацієнтів у …

5
Як додати періодичну складову до лінійної регресійної моделі?
У мене є деякі дані накопичувальної частоти. Рядок виглядає так, що він надзвичайно добре відповідає даним, але в циклі є циклічне / періодичне хитання. Я хотів би оцінити, коли сукупна частота досягне певного значення c . Коли я будую графіки залишків та встановлених значень, я отримую прекрасну синусоїдальну поведінку.у= a …

1
Використання HMM у кількісному фінансуванні. Приклади HMM, яка працює на виявлення тенденції / поворотних точок?
Я відкриваю дивовижний світ таких під назвою "прихованих моделей Маркова", які також називаються "моделями перемикання режимів". Я хотів би адаптувати HMM в R для виявлення тенденцій та поворотних моментів. Я хотів би побудувати модель якомога загальнішою, щоб я міг її протестувати за багатьма цінами. Хтось може порекомендувати папір? Я бачив …

4
Які плюси та мінуси використання методу реєстрації та порівняння методу Мантеля-Хаенцеля для обчислення коефіцієнта небезпеки в аналізі виживання?
Одним із способів узагальнити порівняння двох кривих виживань є обчислення коефіцієнта небезпеки (HR). Існують (принаймні) два способи обчислення цього значення. Метод Логранка. У рамках обчислень Каплана-Мейєра обчисліть кількість спостережуваних подій (як правило, випадків смерті) у кожній групі ( і O b ), а також кількість очікуваних подій, припускаючи нульову гіпотезу …
17 survival  hazard 

2
Розуміння t-тесту на лінійну регресію
Я намагаюся розробити тестування гіпотез на лінійній регресії (нульова гіпотеза не має кореляції). Кожен путівник і сторінка з теми, на яку я стикаюся, начебто використовують t-тест. Але я не розумію, що насправді означає t-тест на лінійну регресію. Т-тест, якщо я не маю абсолютно неправильного розуміння чи розумової моделі, використовується для …

1
Вибір між неінформативними бета-пріорами
Я шукаю неінформативні пріори для бета-розподілу для роботи з біноміальним процесом (Hit / Miss). Спочатку я думав про використання які створюють єдиний PDF, або Джефрі попереднього . Але я насправді шукаю пріорів, які мають мінімальний вплив на задній результат, і тоді я подумав про те, щоб скористатись неналежним попереднім значенням …

2
Чому для гіпотези використовується тестування коефіцієнта лінійної регресії для розподілу Т?
На практиці звичайне використання стандартного Т-тесту для перевірки значущості коефіцієнта лінійної регресії. Механіка розрахунку має для мене сенс. Чому так, що розподіл Т можна використовувати для моделювання стандартної статистики тесту, яка використовується при тестуванні гіпотез лінійної регресії? Стандартна тестова статистика, про яку я маю на увазі тут: T0=βˆ−β0SE(βˆ)T0=β^−β0SE(β^) T_{0} = …

2
Чому Lasso або ElasticNet працюють краще, ніж Ridge, коли функції співвідносяться
У мене є набір з 150 функцій, і багато з них сильно співвідносяться між собою. Моя мета - передбачити значення дискретної змінної, діапазон якої становить 1-8 . Розмір мого зразка - 550 , і я використовую 10-кратну перехресну перевірку. AFAIK серед методів регуляризації (Lasso, ElasticNet і Ridge), Ridge більш жорсткий …


3
Оновлення байесів з новими даними
Як ми можемо обчислити задню частину з попередньою N ~ (a, b) після дотримання n точок даних? Я припускаю, що ми повинні обчислити середню вибірку та дисперсію точок даних і зробити якийсь розрахунок, який поєднує задній з попереднім, але я не зовсім впевнений, як виглядає формула комбінації.

5
Міра "дисперсії" від матриці коваріації?
Якщо дані дорівнюють 1d, дисперсія показує, наскільки точки даних відрізняються одна від одної. Якщо дані багатовимірні, ми отримаємо матрицю коваріації. Чи є міра, яка дає єдине число того, чим точки даних відрізняються взагалі для багатовимірних даних? Я вважаю, що може бути вже багато рішень, але я не впевнений, що правильно …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.