Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
щодо умовної незалежності та її графічного зображення
Під час вивчення відбору коваріації я одного разу прочитав наступний приклад. Щодо наступної моделі: Його матриця коваріації та матриця зворотної коваріації наведені наступним чином, Я не розумію, чому незалежність і визначається тут зворотною коваріацією?xxxyyy Яка математична логіка лежить в основі цього взаємозв'язку? Також лівий графік на наступному малюнку стверджує, що …

1
Перерахуйте ймовірність журналу з простої моделі R lm
Я просто намагаюся перерахувати за допомогою dnorm () імовірність журналу, яку забезпечує функція logLik з lm-моделі (в R). Він працює (майже ідеально) для великої кількості даних (наприклад, n = 1000): > n <- 1000 > x <- 1:n > set.seed(1) > y <- 10 + 2*x + rnorm(n, 0, 2) …

1
Визначення розміру вибірки з пропорцією та біноміальним розподілом
Я намагаюся вивчити деякі статистичні дані за допомогою книги «Біометрія Сокаля та Рольфа» (3е). Це вправа в 5-й главі, яка висвітлює вірогідність, біноміальний розподіл та розподіл Пуассона. Я усвідомлюю, що існує формула, щоб дати відповідь на це питання: n = 4( с-√- q√)2n=4(p−q)2 n = \frac 4 {( \sqrt{p} - …

4
Наслідки поточної дискусії щодо статистичної значущості
В останні кілька років різні вчені поставили згубну проблему тестування наукової гіпотези, яка отримала назву "ступінь свободи дослідника", тобто вчені мають численні можливості зробити під час свого аналізу те, що ухил до пошуку з р-значенням <5%. Ці неоднозначні варіанти є, наприклад, який випадок включити, який випадок віднесений до категоричності, який …

1
У яких реалізаціях необхідні масштабування змінних (функціональних) дерев рішень та нормалізація змінної (функції), в яких реалізаціях?
У багатьох алгоритмах машинного навчання масштабування функцій (так само змінне масштабування, нормалізація) є поширеним попереднім етапом Вікіпедії - Масштабування функцій - це питання було закритим Питання № 41704 - Як і чому працюють нормалізація та масштабування функцій? У мене є два питання, зокрема, щодо дерев рішень: Чи є реалізація дерева …

1
Чи варто використовувати приблизний ступінь свободи Вельча (1947) або «Саттертвайт» (1946)?
Мене бентежить правильна формула для приблизних ступенів свободи використання тесту Вельча. Формула Satterthwaite (1946) - це найчастіше цитується формула, але Велч дав альтернативу в 1947 році. Я не впевнений, що є кращим (або використовується більшості статистичних програм). Формула : (s2x/nx+s2y/ny)2(s2x/nx)2/(nx−1)+(s2y/ny)2/(ny−1)(sx2/nx+sy2/ny)2(sx2/nx)2/(nx−1)+(sy2/ny)2/(ny−1)\frac{\left(s_x^2/n_x +s_y^2/n_y\right)^2}{(s_x^2/n_x )^2/(n_x-1)+(s_y^2/n_y )^2/(n_y-1)} Формула : −2+(s2x/nx+s2y/ny)2(s2x/nx)2/(nx+1)+(s2y/ny)2/(ny+1)−2+(sx2/nx+sy2/ny)2(sx2/nx)2/(nx+1)+(sy2/ny)2/(ny+1)-2+ \frac{\left(s_x^2/n_x +s_y^2/n_y\right)^2}{(s_x^2/n_x )^2/(n_x+1)+(s_y^2/n_y )^2/(n_y+1)} …

3
Як інтерпретувати коефіцієнт небезпеки від суцільної змінної - одиниця різниці?
Я читаю статтю, де показано коефіцієнти небезпеки для безперервних змінних, але не знаю, як інтерпретувати задані значення. Моє сучасне розуміння коефіцієнтів небезпеки полягає в тому, що число представляє відносну ймовірність [події] за певної умови. Напр .: якщо коефіцієнт небезпеки від смерті від раку легенів від куріння (бінарний випадок) становить 2, …

2
Чи підходить двостороння ANOVA?
Це опис мого дослідження. Я експериментую з трьома рослинами: A, B і C. Ці рослини повинні знижувати рівень глюкози в крові для хворих на діабет. Я хочу визначити, яка з цих трьох рослин має більш тривалий вплив на зниження глюкози в крові після одноразового введення мишам. Це робиться шляхом вимірювання …

1
Пояснення фільтрів Калмана в моделях простору держав
Які кроки використовуються у використанні фільтрів Калмана у моделях простору держав? Я бачив пару різних рецептур, але в деталях не впевнений. Наприклад, Cowpertwait починає з цього набору рівнянь: θt=Gtθt-1+wtут= F'тθт+ vтyt=Ft′θt+vty_{t} = F^{'}_{t}\theta_{t}+v_{t} θт= Gтθt - 1+ штθt=Gtθt−1+wt\theta_{t} = G_{t}\theta_{t-1}+w_{t} де і w_ {t} \ sim N (0, W_ { …

2
PyMC для непараметричної кластеризації: Процес Діріхле для оцінки параметрів суміші Гаусса не вдається кластеризувати
Налаштування проблеми Однією з перших іграшкових проблем, до якої я хотів застосувати PyMC, є непараметричне кластеризація: давши деякі дані, моделюйте її як гауссову суміш та дізнайтеся кількість кластерів та середнє значення та коеваріантність кожного кластеру. Більшість того, що я знаю про цей метод, походить з відео-лекцій Майкла Джордана та Йе-Уу-Тех, …

2
Поширення помилок SD проти SE
Я маю від 3 до 5 мір ознаки на людину в двох різних умовах (А і В). Я креслення в середньому для кожної людини в кожному стані , і я використовую стандартну помилку ( тобто , , з = число вимірювань) як похибками.SD/N−−√SD/NSD/\sqrt{N}NNN Тепер я хочу побудувати різницю між середньою …

2
Чи має сенс обчислювати довірчі інтервали та перевіряти гіпотези, коли дані цілої сукупності доступні?
Чи є сенс обчислювати довірчі інтервали та перевіряти гіпотези, коли дані доступні для всієї сукупності? На мою думку, відповідь - ні, оскільки ми можемо точно обчислити справжні значення параметрів. Але тоді, яка максимальна частка даних від вихідної сукупності дозволяє нам використовувати вищезгадані методи?

2
Тест на придатність: питання про тест Андерсона – Дарлінга та критерій Крамера – фон Мізеса
Я читаю веб-сторінки на користь тестів на придатність, коли потрапив до тесту Андерсона – Дарлінга та критерію Крамера – фон Мізеса . Поки я отримав бал; здається, тест Андерсона – Дарлінга та критерій Крамера – фон Мізеса схожі, лише засновані на іншій ваговій функції . Також є варіант критерію Крамера …

6
Гнучкі та негнучкі моделі в машинному навчанні
Я зіткнувся з простим питанням щодо порівняння гнучких моделей (тобто сплайнів) та негнучких моделей (наприклад, лінійної регресії) за різних сценаріїв. Питання: Загалом, чи очікуємо, чи ефективність гнучких методів статистичного навчання може бути кращою чи гіршою, ніж негнучка методика, коли: Кількість предикторів надзвичайно велика, а кількість спостережень невелика? нpppнnn Дисперсія термінів …

1
Загальні теореми про послідовність та асимптотичну нормальність максимальної вірогідності
Мене цікавить хороша довідка щодо результатів щодо асимптотичних властивостей оцінювачів максимальної ймовірності. Розглянемо модель , де е п ( х | & thetas ; ) є п - мірне щільність і & thetas п є MLE на основі вибірки X 1 , ... , X n від f n ( …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.