Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Що таке змішування даних?
Цей термін часто з’являється у потоках, пов’язаних із методом . Чи поєднуються конкретний метод у вивченні даних та статистичному навчанні? Я не можу отримати релевантний результат від google. Здається, суміш поєднує результати багатьох моделей і призводить до кращого результату. Чи є якийсь ресурс, який допомагає мені більше знати про це?

2
Чи застосовується принцип байдужості до парадоксу Бореля-Колмогорова?
Розглянемо рішення Джейнса для парадокса Бертрана, використовуючи принцип байдужості . Чому подібний аргумент не стосується парадокса Бореля-Колмогорова ? Чи щось не так у тому, щоб стверджувати, що оскільки проблема не визначає орієнтацію на сферу, обертання сфери не повинно впливати на результуюче розподіл, досягнуте обраним обмежувальним процесом?
15 theory  paradox 

3
Які варіанти пропорційної моделі регресії небезпеки, коли залишки Шенфельда не є хорошими?
Я роблю пропорційну регресію небезпеки Кокса в R coxph, яка включає багато змінних. Залишки Мартингейла виглядають чудово, а залишки Шенфельда чудово підходять для всіх змінних. Існує три змінні, залишки яких по Шенфельду не є плоскими, а природа змінних така, що має сенс, що вони могли змінюватися з часом. Це змінні, …

3
Або квадратичний, або термін взаємодії є значущим ізольовано, але вони не є разом
У рамках завдання мені довелося підходити до моделі з двома змінними предиктора. Тоді мені довелося намалювати графік залишків моделей проти одного з включених прогнозів і внести зміни на основі цього. Сюжет показав криволінійну тенденцію, і тому я включив квадратичний термін для цього прогноктора. Нова модель показала, що квадратичний термін є …

3
Автоматизована процедура вибору підмножини точок даних з найсильнішим співвідношенням?
Чи існує якась стандартна процедура (така, яку можна цитувати як посилання) для вибору підмножини точок даних з більшого пулу з найсильнішою кореляцією (уздовж всього двох вимірів)? Наприклад, скажімо, у вас є 100 точок даних. Ви хочете підмножину в 40 балів з найсильнішим співвідношенням, можливим уздовж розмірів X і Y. Я …

3
Визначення та походження "перехресної ентропії"
Не посилаючись на джерела, Вікіпедія визначає перехресну ентропію дискретних розподілів і мають бутиППPQQQ Н×( С; Q )= - ∑хp ( x )журналq( х ) .Н×(П;Q)=-∑хp(х)журнал⁡q(х).\begin{align} \mathrm{H}^{\times}(P; Q) &= -\sum_x p(x)\, \log q(x). \end{align} Хто перший почав вживати цю кількість? А хто винайшов цей термін? Я заглянув: JE Shore та RW …

3
Плутанина щодо використання -statistics порівняно з -statistics
Я мав на увазі цю відео лекцію для обчислення довірчого інтервалу . Однак у мене є деяка плутанина. Цей хлопець використовує -статистику для розрахунку. Однак я думаю, що це мала бути -статистика. Нам не задано справжнє стандартне відхилення чисельності. Ми використовуємо стандартне відхилення вибірки для оцінки справжнього.zzzttt То чому він …

2
Створіть три співвідносні однаково розподілені випадкові величини
Припустимо, у нас є X1∼unif(n,0,1),X1∼unif(n,0,1),X_1 \sim \textrm{unif}(n,0,1), X2∼unif(n,0,1),X2∼unif(n,0,1),X_2 \sim \textrm{unif}(n,0,1), де unif(n,0,1)unif(n,0,1)\textrm{unif}(n,0,1) є рівномірною випадковою вибіркою розміру n та Y=X1,Y=X1,Y=X_1, Z=0.4X1+1−0.4−−−−−−√X2.Z=0.4X1+1−0.4X2.Z = 0.4 X_1 + \sqrt{1 - 0.4}X_2. Тоді кореляція між і Z дорівнює 0,4 .YYYZZZ0.40.40.4 Як я можу поширити це на три змінні: , X 2 , X 3 …

1
Чому оціночні коефіцієнти регресії rlm () відрізняються від lm () в R?
Я використовую rlm в пакеті R MASS для регресу багатовимірної лінійної моделі. Він добре працює для декількох зразків, але я отримую квазінульові коефіцієнти для конкретної моделі: Call: rlm(formula = Y ~ X1 + X2 + X3 + X4, data = mymodel, maxit = 50, na.action = na.omit) Residuals: Min 1Q …

4
Як дізнатись, чи справжній інтернет-покер-сайт справедливий?
Минулого тижня у мене була цікава дискусія з моїм хорошим другом. Він грав у онлайн-покер і припустив, що існує новий зв’язок між новою підпискою / додатковим грошовим переказом і картками, які вам роздають, тобто ви отримуєте хороші картки, щоб підключитись. Сайти, мабуть, ризикують багато, якби це було правдою, але проблема …

2
Виявлення часових рядів та аномалії
Я хотів би налаштувати алгоритм виявлення аномалії у часових рядах, і я планую використовувати для цього кластеризацію. Чому я повинен використовувати матрицю відстані для кластеризації, а не необроблені дані часових рядів ?, Для виявлення аномалії я буду використовувати кластеризацію на основі щільності, алгоритм як DBscan, щоб це працювало в цьому …

2
Поєднання класифікаторів, гортаючи монету
Я вивчаю курс машинного навчання, а слайди лекцій містять інформацію, що мені суперечить рекомендованій книзі. Проблема полягає в наступному: є три класифікатори: класифікатор A, що забезпечує кращі показники роботи в нижньому діапазоні порогів, класифікатор B, що забезпечує більш високу продуктивність у більш високому діапазоні порогів, класифікатор C, що ми отримуємо, …

2
Як перевірити дію групувальної змінної з нелінійною моделлю?
У мене є питання щодо використання змінної групування в нелінійній моделі. Оскільки функція nls () не дозволяє змінювати коефіцієнти, я намагаюся зрозуміти, чи можна перевірити вплив фактора на придатність моделі. Нижче я включив приклад, у якому я хочу пристосувати модель росту "сезонного фон Берталанфі" до різних методів росту (найчастіше застосовуваних …
15 r  mixed-model  nls 

3
Найкращий спосіб візуалізації виснаження за допомогою R?
Через цей сайт я нещодавно відкрив діаграми Sankey - прекрасний спосіб візуалізації того, що відбувається в традиційній схемі потоків. Ось хороший приклад діаграми Санкі Джорджа М. Уайтсайдса та Джорджа В. Кребтрі , Джерело; Не забувайте про довгострокові фундаментальні дослідження в галузі енергетики , наука 9 лютого 2007: Вип. 315. ні. …

1
Коли / де використовувати функціональний аналіз даних?
Я дуже новачок у функціональному аналізі даних (FDA). Я читаю: Рамсей, Джеймс О. та Сільверман, Бернар В. (2006), Функціональний аналіз даних, 2-е видання, Спрингер, Нью-Йорк. Однак мені все ще не дуже зрозуміло, де / коли використовувати FDA? Може хтось, будь ласка, надати мені приклад, особливо в медичних дослідженнях? Я дійсно …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.