Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Непараметричні значення p завантаження та довірчі інтервали
Контекст Це дещо схоже на це питання , але я не думаю, що це точний дублікат. Коли ви шукаєте, як інструкції, як виконати тест гіпотези завантажувальної програми, зазвичай зазначається, що добре використовувати емпіричний розподіл для довірчих інтервалів, але що вам потрібно правильно завантажити завантаження з розподілу під нульовою гіпотезою, щоб …

3
У чому переваги різних підходів до виявлення колінеарності?
Я хочу виявити, чи колінеарність є проблемою в моїй регресії OLS. Я розумію, що коефіцієнти інфляції дисперсії та індекс стану є двома загальноприйнятими заходами, але мені важко знайти щось певне щодо достоїнств кожного підходу чи таких, якими мають бути оцінки. Видатне джерело, яке вказує, який підхід робити та / або …

2
Класифікація з частково "невідомими" даними
Припустимо, я хочу вивчити класифікатор, який приймає вектор чисел як вхідний і дає мітку класу як вихід. Мої дані навчання складаються з великої кількості пар вхід-вихід. Однак, коли я приходжу до тестування деяких нових даних, ці дані, як правило, лише частково завершені. Наприклад, якщо вектор вводу має довжину 100, лише …

1
Чому вибір завдань важливий для класифікаційних завдань?
Я дізнаюся про вибір функції. Я бачу, чому це було б важливо і корисно для побудови моделей. Але зупинімося на контрольованих навчальних (класифікаційних) завданнях. Чому вибір завдань важливий для класифікаційних завдань? Я бачу багато літератури, написаної про вибір функції та її використання для контрольованого навчання, але це спантеличує мене. Вибір …

1
Який правильний спосіб обчислення оцінки щільності ядра за географічними координатами?
Я повинен обчислити 2d оцінку щільності ядра (kde) зі списку координат широти та довготи. Але один градус широти не є такою ж відстані, як один градус по довготі, це означає, що окремі ядра були б овальними, особливо чим далі точка від екватора. У моєму випадку всі точки досить близькі один …

1
Які є "бажані" статистичні властивості тесту на коефіцієнт ймовірності?
Я читаю статтю , метод якої повністю заснований на тесті коефіцієнта ймовірності. Автор каже, що тест LR проти однобічних альтернатив - це UMP. Він продовжує, стверджуючи, що "... навіть коли це [тест LR] не може бути показаний рівномірно найпотужнішим, тест LR часто має бажані статистичні властивості." Мені цікаво, що тут …


2
Об'єднання спостережень у Гауссовому процесі
Я використовую Гауссовий процес (GP) для регресії. У моїй проблемі досить часто два або більше точок даних бути близькими один до одного, відносно масштабів довжини проблеми. Також спостереження можуть бути надзвичайно галасливими. Для прискорення обчислень та підвищення точності вимірювання здається природним об'єднання / інтеграція кластерів точок, близьких одна до одної, …

1
Чи застосовують статистики попередній досвід Джефріса в реальній роботі?
Коли я дізнався про попередній Джефріс у своєму випускницькому класі статистичних висновків, то мої професори звучали так, ніби це було цікаво здебільшого з історичних причин, а не тому, що хтось коли-небудь ним користуватиметься. Тоді, коли я взяв аналіз даних Баєса, нас ніколи не просили використовувати пріори Джефріса. Хтось насправді використовує …

2
Межа помилок у сімейному режимі: Чи повторне використання наборів даних для різних досліджень незалежних питань призводить до численних проблем тестування?
Якщо команда дослідників виконує декілька (гіпотезних) тестів на даному наборі даних, є обсяг літератури, що стверджує, що вони повинні використовувати певну форму корекції для багаторазового тестування (Бонферроні тощо), навіть якщо тести є незалежними. Моє запитання таке: чи застосовується така сама логіка до кількох команд, які тестують гіпотези на одному наборі …

4
Як вибрати, чи вийти з черги на шину чи залишитися там за допомогою теорії ймовірностей?
Я щось про це думав уже деякий час, і оскільки я не дуже досвідчений в теорії ймовірностей, я подумав, що це може бути гарним місцем, щоб задати це питання. Це те, що підійшло до мене у довгих чергах громадського транспорту. Припустимо, ви знаходитесь на автовокзалі, і ви знаєте, що автобус …

1
Оцініть дисперсію сукупності, якщо середня кількість населення відома
Я знаю, що ми використовуємо для оцінки дисперсії популяції. Я пам’ятаю відео з Академії Хана, де інтуїція полягала в тому, що наша передбачувана середня величина, ймовірно, трохи перевищує фактичну, тому відстані насправді будуть більшими, тому ми ділимо на менше ( замість ) щоб отримати більшу цінність, в результаті чого можна …
11 variance  sample 

1
Вибір байесівської моделі в PyMC3
Я використовую PyMC3 для запуску моделей Bayesian на моїх даних. Я новачок у байєсівському моделюванні, але, згідно з повідомленнями в деяких блогах , Вікіпедії та QA з цього сайту, здається, що це правильний підхід до використання коефіцієнта Байєса та критерію BIC, щоб можна було вибрати, яка модель найкраще представляє мої …

1
Скільки дистрибутивів у GLM?
Я визначив декілька місць у підручниках, де ГЛМ описується 5 розподілами (а саме: Гамма, Гаусса, Біноміал, Зворотна Гаусса та Пуассона). Про це свідчить і сімейна функція у Р. Інколи мені трапляються посилання на GLM, де додаткові дистрибутиви включаються ( приклад ). Чи може хтось пояснити, чому ці 5 є спеціальними …

2
Байєсівська модель Logit - інтуїтивне пояснення?
Я мушу зізнатися, що раніше я не чув про цей термін в жодному з моїх класів, нижчих класів чи ступенів. Що означає для логістичної регресії бути баєсівською? Я шукаю пояснення з переходом від звичайної логістичної до байесівської логістики, подібної до наступної: Це рівняння в моделі лінійної регресії: .Е( у) = …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.