Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних


2
Простий приклад, який показує переваги байєсівського усереднення моделей (BMA)
Я включаю підхід Байєсового модельного усереднення (BMA) у своїх дослідженнях і незабаром викладу про свою роботу колегам. Однак BMA насправді не так добре відомий у моїй галузі, тому, представивши їх усією теорією та перед тим, як реально застосувати її до своєї проблеми, я хочу навести простий, але повчальний приклад того, …



2
Інтерпретація логістичної регресійної моделі з декількома предикторами
Я здійснив багатоваріантну логістичну регресію, залежною від якої є зміна Y- смерть у будинку престарілих протягом певного періоду вступу, і я отримав такі результати (зауважте, якщо змінні починаються в Aній є безперервним значенням, а ті, що починаються з B, категоричні): Call: glm(Y ~ A1 + B2 + B3 + B4 …
12 r  regression  logistic 

1
MLE для розподілу трикутників?
Чи можливо застосувати звичайну процедуру MLE до розподілу трикутників? - Я намагаюся, але, схоже, блокується на тому чи іншому кроці в математиці шляхом визначення розподілу. Я намагаюся використати той факт, що я знаю кількість проб вище та нижче c (не знаючи c): ці 2 числа - cn і (1-c) n, …

3
Варіаційно-коваріаційна матриця помилок у лінійній регресії
Як на практиці обчислюється матриця помилок var / cov статистичними пакетами аналізу? Ця ідея мені зрозуміла в теорії. Але не на практиці. Я маю на увазі, якщо у мене є вектор випадкових змінних , я розумію, що матриця дисперсії / коваріації буде надано зовнішній добуток векторів відхилення від середнього значення: …

1
Що таке "вихідні значення" у функції glm ()?
Які параметри start, etastart, mustartв GLM () функцію ? Я шукав документи та Інтернет, але не знайшов чіткого пояснення, що це означає. Це нагадує байєсівські "початкові значення" для ланцюгів, але я сумніваюсь, що це пов'язано, оскільки функція glm () в R - частофілістська статистика ...

2
Початківець PyMC: як насправді зробити вибірку з пристосованої моделі
Я пробую дуже просту модель: підходити до нормальної, де я припускаю, що знаю точність, і просто хочу знайти середнє значення. Код нижче, здається, правильно відповідає нормальному. Але після встановлення я хочу взяти вибірку з моделі, тобто генерувати нові дані, схожі на мою dataзмінну. Я знаю, що можу використовувати trace("mean")для отримання …
12 mcmc  pymc 

1
Яка оптимальна функція відстані для індивідів, коли атрибути номінальні?
Я не знаю, яку функцію відстані між особами використовувати у випадку номінальних (не упорядкованих категоричних) атрибутів. Я читав підручник, і вони пропонують функцію простого узгодження, але деякі книги пропонують мені змінити номінальний на двійкові атрибути і використовувати коефіцієнт Жаккарда . Однак що робити, якщо значення номінального атрибута не дорівнюють 2? …

2
Як вектор змінних може представляти гіперплощину?
Я читаю Елементи статистичного навчання і на сторінці 12 (розділ 2.3) лінійну модель позначають як: Yˆ=XTβˆY^=XTβ^\widehat{Y} = X^{T} \widehat{\beta} ... де - це транспозиція вектора стовпців предикторів / незалежних змінних / входів. (Він раніше зазначав, що "всі вектори вважаються векторами стовпців", тож чи не це зробить вектором рядків і векторним …

1
Що робити, коли матриця коваріації зразка не обернена?
Я працюю над деякими методами кластеризації, де для заданого кластера d-розмірних векторів я припускаю багатоваріантне нормальне розподіл і обчислюю вибірковий d-розмірний середній вектор та матрицю коваріації вибірки. Тоді, намагаючись вирішити, чи належить новий, невидимий, d-мірний вектор до цього кластеру, я перевіряю його відстань за допомогою цієї міри: (Xi−μ^X)′σ^−1X(Xi−μ^X)>B0.95(p2,−p2)(Xi−μ^X)′σ^X−1(Xi−μ^X)>B0.95(p2,−p2)\left(X_i-\hat{\mu}_X\right)'\hat{\sigma}_X^{-1}\left(X_i-\hat{\mu}_X\right)>B_{0.95}\left(\frac{p}{2},\frac{-p}{2}\right) Що вимагає …

1
Як знайти відхилення між багатовимірними точками?
Припустимо, у мене є матриця X, яка n на p, тобто вона має n спостережень, з кожним спостереженням у p-мірному просторі. Як я можу знайти дисперсію цих російських спостережень? У випадку, коли p = 1, мені просто потрібно використовувати звичайну формулу дисперсії. Як щодо випадків, коли p> 1.
12 variance 

3
Кількість значущих цифр, які потрібно повідомити
Чи існує більш науковий спосіб визначення кількості значущих цифр, які потрібно повідомити за середній або довірчий інтервал у ситуації, яка є досить стандартною - наприклад, перший рік в коледжі. Я бачив Кількість значущих цифр , щоб помістити в таблицю , Чому ми не використовуємо значущі цифри і числа значущих цифр …

4
Лінійні моделі журналу
Чи може хто-небудь пояснити, чому ми використовуємо лінійні моделі журналу дуже просто? Я родом з інженерного походження, і це справді виявляється для мене важким предметом, тобто статистикою. Буду вдячний за відповідь.

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.