Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Як побудувати графік виведення даних кластеризації?
Я спробував згрупувати набір даних (набір знаків) і отримав 2 кластери. Я хотів би це графічно представити. Трохи розгублений у поданні, оскільки у мене немає координат (x, y). Також шукає функцію MATLAB / Python для цього. EDIT Я думаю, що розміщення даних робить питання зрозумілішим. У мене є два кластери, …

3
CDF підняли до влади?
Якщо - це CDF, схоже, що ( ) також є CDF.FZFZF_ZFZ(z)αFZ(z)αF_Z(z)^\alphaα>0α>0\alpha \gt 0 Питання: Це стандартний результат? З: Чи є хороший спосіб знайти функцію допомогою st , де x \ equiv g (z)gggX≡g(Z)X≡g(Z)X \equiv g(Z)FX(x)=FZ(z)αFX(x)=FZ(z)αF_X(x) = F_Z(z)^\alphax≡g(z)x≡g(z) x \equiv g(z) В основному, у мене є ще один CDF, FZ(z)αFZ(z)αF_Z(z)^\alpha . …

3
Інтерпретація прогнозованих передбачень журналів в логістичній регресії
Одним із прогнозів моєї логістичної моделі був перетворений журнал. Як ви інтерпретуєте розрахунковий коефіцієнт прогнозованого прогнозування журналу і як ви обчислюєте вплив цього прогноктора на коефіцієнт шансів?
15 logistic 

2
Розуміння відставання в розширеному тесті R Діккі Фуллера
Я розігрувався з деяким тестуванням одиничного кореневого контролю в R, і я не зовсім впевнений, що робити з параметром k lag. Я використовував розширений тест Діккі Фуллера та тест Філіпса Перрона з пакету церій . Очевидно, що параметр за замовчуванням (для ) залежить лише від довжини серії. Якщо я вибираю …
15 r  time-series  trend 

1
Яке точне визначення "справи Хейвуда"?
Я використовував термін "кейс Хейвуд" дещо неофіційно для позначення ситуацій, коли в Інтернеті, "обмежена відповідь", ітеративно оновлена ​​оцінка дисперсії стала негативною через числові проблеми з точністю. (Я використовую варіант методу Велфорда для додавання даних та видалення старих даних.) Я мав враження, що він застосовується до будь-якої ситуації, коли оцінка дисперсії …

3
Чому завжди використовуються розподіли середнього значення 0 та стандартного відхилення 1?
Моя статистика була самоучкою, але багато матеріалу, який я читаю, вказує на набір даних із середнім значенням 0 та стандартним відхиленням 1. Якщо це так, то: Чому середнє значення 0 і SD 1 є приємною властивістю? Чому випадкова величина, проведена з цього зразка, дорівнює 0,5? Шанс намалювати 0,001 такий же, …

2
Моделювання розподілу Пуассона з наддисперсією
У мене є набір даних, який я б очікував, що слідкує за розповсюдженням Пуассона, але він перерозподілений приблизно в 3 рази. В даний час я моделюю цю наддисперсію, використовуючи щось подібне до наступного коду в Р. ## assuming a median value of 1500 med = 1500 rawdist = rpois(1000000,med) oDdist …

3
Коли використовувати GAM vs GLM
Я усвідомлюю, що це може бути широким питанням, але мені було цікаво, чи існують узагальнюючі припущення, які вказують на використання GAM (Узагальнена модель добавок) для GLM (Узагальнена лінійна модель)? Хтось нещодавно сказав мені, що GAM слід використовувати лише тоді, коли я вважаю, що структура даних є "аддитивною", тобто я очікую, …

1
Чому жоден ReLU не може вивчити RELU?
У процесі моєї нейронної мережі навіть не можна вивчити евклідову відстань, я ще більше спростив і спробував навчити один РеЛУ (з випадковою вагою) до одного РеЛУ. Це найпростіша мережа, яка є, і все ж половину часу вона не зможе конвергуватися. Якщо початкова здогадка має таку саму орієнтацію, що і ціль, …

3
Яке максимальне значення розбіжності Kullback-Leibler (KL)
Я буду використовувати розбіжність KL в коді python, і я отримав цей підручник . У цьому підручнику реалізувати розбіжність KL досить просто. kl = (model * np.log(model/actual)).sum() Як я розумію, розподіл ймовірностей modelі actualповинен бути <= 1. Моє запитання, яке максимальне обмежене / максимально можливе значення k ?. Мені потрібно …

2
Розрахунок довірчих інтервалів для логістичної регресії
Я використовую біноміальну логістичну регресію, щоб визначити, has_xчи has_yвпливає або впливає ймовірність того, що користувач щось натисне. Моя модель така: fit = glm(formula = has_clicked ~ has_x + has_y, data=df, family = binomial()) Це вихід з моєї моделі: Call: glm(formula = has_clicked ~ has_x + has_y, family = binomial(), data …

4
Прийняття нульової гіпотези
Це дискусійне питання про перетин статистики та інших наук. Я часто стикаюся з однією і тією ж проблемою: дослідники моєї галузі схильні говорити, що ефекту немає, коли значення p не менше рівня значущості. На початку я часто відповідав, що це не тестування гіпотез. З огляду на те, як часто виникає …

3
Методи вирішення проблеми відсутності даних у машинному навчанні
Практично будь-яка база даних, яку ми хочемо передбачити, використовуючи алгоритми машинного навчання, знайде відсутні значення для деяких характеристик. Існує кілька підходів для вирішення цієї проблеми, щоб виключити рядки, у яких відсутні значення, поки вони не заповняться середніми значеннями характеристик. Я хотів би скористатися дещо більш надійним підходом, який би в …

2
Що таке помилка Байєса в машинному навчанні?
http://www.deeplearningbook.org/contents/ml.html Сторінка 116 пояснює помилку Байєса, як показано нижче Ідеальна модель - це оракул, який просто знає справжній розподіл ймовірностей, який генерує дані. Навіть така модель все-таки матиме певну помилку у багатьох проблемах, оскільки все ще може бути якийсь шум у розподілі. У випадку керованого навчання відображення від x до …

2
Корельовані випробування Бернуллі, багатофакторний розподіл Бернуллі?
Я спрощую дослідницьке питання, яке у мене є на роботі. Уявіть, що у мене є 5 монет, і давайте назвемо голову успіху. Це ДУЖЕ упереджені монети з вірогідністю успіху p = 0,1. Тепер, якщо монети були незалежними, то отримати ймовірність принаймні на 1 голову і більше дуже просто, . За …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.