Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

6
Швидкість обчислення в R?
Мені було доручено перенести одну з наших нині великих великих стохастичних моделей з SAS і перейти на нову мову. Особисто я віддаю перевагу традиційній компільованій мові, але ІП хоче, щоб я перевірив R, яким я ніколи не користувався. Нашою мотивацією для виведення моделі з SAS є (1) багато людей не …
16 r  computing 

1
Необхідність центрування та стандартизації даних при регресії
Розглянемо лінійну регресію з деякою регуляризацією: Eg Знайдіть що мінімізуєxxx||Ax−b||2+λ||x||1||Ax−b||2+λ||x||1||Ax - b||^2+\lambda||x||_1 Зазвичай стовпці А стандартизовані, щоб мати нульове середнє і одиничну норму, а - по центру, щоб мати нульове середнє. Хочу переконатися, чи правильно я розумію причину стандартизації та центрування.bbb Створюючи засоби стовпців AAA і bbb нульових, нам більше …


2
Чому матриця проекцій ортогональної проекції симетрична?
Я зовсім новачок у цьому, тому сподіваюся, що ви пробачте мене, якщо питання буде наївним. (Контекст: я вивчаю економетрику з книги "Економетрична теорія та методи" Девідсона та МакКіннона , і, схоже, це не пояснюють; я також роздивився оптимізаційну книгу Луенбергера, яка займається прогнозами на трохи більш просунутому рівні, але без …

4
Класична лінійна модель - вибір моделі
У мене є класична лінійна модель, з 5 можливими регресорами. Вони некорельовані між собою і мають досить низьку кореляцію з відповіддю. Я прийшов до моделі, де 3 регресори мають значні коефіцієнти для їх t-статистики (p <0,05). Додавання однієї або обох решти двох змінних дає p значення> 0,05 для статистики t, …

1
Як обчислити смуги прогнозування для нелінійної регресії?
Сторінка довідки для призми дає наступне пояснення того, як вона обчислює смуги прогнозування для нелінійної регресії. Вибачте, будь ласка, довгу цитату, але я не дотримуюся другого абзацу (це пояснює, як визначено G|xG|xG|x і dY/dPdY/dPdY/dP обчислюється). Будь-яка допомога буде дуже вдячна. Розрахунок смуг довіри та прогнозування є досить стандартним. Прочитайте детальніше …

1
Коли використовувати зважену евклідову відстань і як визначити ваги, які слід використовувати?
У мене є набір даних, де кожна інформація складається з ннn різних заходів. Для кожного заходу у мене є базове значення. Мені хотілося б знати, наскільки близькі дані для базового значення. Я думав використовувати зважену евклідову відстань так: гх , б= ( ∑нi = 1шi( хi- бi)2) )1 / 2гх,б=(∑i=1ншi(хi-бi)2))1/2\hspace{0.5in} …

4
Інтерпретація досвіду (B) у багаточленній логістичній регресії
Це дещо питання для початківців, але як інтерпретувати результат exp (B) 6.012 в мультиноміальній логістичній регресії? 1) це 6.012-1.0 = 5.012 = 5012% збільшення ризику? або 2) 6,012 / (1 + 6,012) = 0,857 = 85,7% збільшення ризику? Якщо обидві альтернативи є невірними, може хтось, будь ласка, зазначити правильний шлях? …

3
Як найкраще графічно відобразити помилку, потужність та розмір вибірки графічно типу II (бета)?
Мене просять написати вступ до статистики, і я намагаюся, як графічно показати спосіб співвідношення p-значення та потужності. Я придумав цей графік: Моє запитання: чи є кращий спосіб відображення цього? Ось мій R-код x <- seq(-4, 4, length=1000) hx <- dnorm(x, mean=0, sd=1) plot(x, hx, type="n", xlim=c(-4, 8), ylim=c(0, 0.5), ylab …
16 r  teaching  power 

2
Аналіз зміни точки за допомогою Rs nls ()
Я намагаюся здійснити аналіз "точки зміни" або багатофазну регресію за допомогою nls()Р. Ось кілька фальшивих даних, які я зробив . Формула, яку я хочу використати для пристосування даних, така: у= β0+ β1x + β2max ( 0 , x - δ)у=β0+β1х+β2макс(0,х-δ)y = \beta_0 + \beta_1x + \beta_2\max(0,x-\delta) Що потрібно зробити, це …

1
Послідовне тестування гіпотез у фундаментальній науці
Я фармаколог, і, за моїм досвідом, майже всі статті в базових біомедичних дослідженнях використовують t-тест Стьюдента (або для підтримки висновку, або для відповідності очікуванням ...). Пару років тому мені стало відомо, що t-тест Стьюдента - не найефективніший тест, який може бути використаний: послідовні тести пропонують набагато більше енергії для будь-якого …

2
Чи існує модель коінтеграції для нерегулярно розташованих часових рядів?
Мені не зрозуміло, як обчислити коінтеграцію з нерегулярними часовими рядами (в ідеалі, використовуючи тест Йохансена з VECM). Моєю початковою думкою було б регуляризувати ряд та інтерполювати пропущені значення, хоча це може змістити оцінку. Чи є література на цю тему?

2
Чому верхівка броунівського мосту має розподіл Колмогорова – Смірнова?
Розподіл Колмогорова – Смирнова відомий з тесту Колмогорова – Смірнова . Однак, це також поширення надмости Браунівського мосту. Оскільки це далеко не очевидно (для мене), я хотів би попросити інтуїтивно пояснити цей збіг. Посилання також вітаються.

3
Міцне виявлення зовнішньої торгівлі у фінансових періодах
Я шукаю кілька надійних методів усунення випадків та помилок (незалежно від причини) з даних фінансових часових рядів (тобто тикдатів). Дані про фінансові часові серії "Позначте за кліком" дуже брудні. Він містить величезні (часові) прогалини, коли обмін закритий, і роблять величезні стрибки, коли обмін відкриється знову. Коли біржа відкрита, усі види …

2
Вибір між "статистикою" від Freedman et al. Та "Статистичними моделями: теорія та практика" від Freedman
Я не статистик, але мене дуже цікавить статистика, і я хотів би придбати книгу, яку я б зберігав як орієнтир. У мене є кілька книг з конкретних предметів (наприклад, «Елементи статистичного навчання для машинного навчання» або « Байєсівський аналіз даних» для ... ну, Байєсівський аналіз даних :) Я також шукав …
16 references 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.