Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Лінійна комбінація двох залежних багатоваріантних нормальних випадкових величин
Припустимо, у нас є два вектори випадкових величин, обидва є нормальними, тобто і . Нас цікавить розподіл їх лінійної комбінації , де і - матриці, - вектор. Якщо і незалежні, . Питання полягає у залежному випадку, якщо припустити, що ми знаємо співвідношення будь-якої пари . Дякую.X∼N(μX,ΣX)X∼N(μX,ΣX)X \sim N(\mu_X, \Sigma_X)Y∼N(μY,ΣY)Y∼N(μY,ΣY)Y \sim …

2
Інтерпретація коефіцієнтів захворюваності
Отже, я хочу підходити до випадкової ефекти негативно-біноміальної моделі. Для такої моделі STATA може виробляти коефіцієнти експоненції. Відповідно до файлу довідки такі коефіцієнти можна інтерпретувати як коефіцієнти захворюваності. На жаль, я не є носієм англійської мови, і я не дуже розумію, що таке коефіцієнт частоти захворюваності або як я міг …

3
Які повинні бути оптимальні параметри для класифікатора випадкових лісів?
В даний час я використовую RF інструментарій на MATLAB для проблеми бінарної класифікації Набір даних: 50000 зразків та понад 250 функцій Отже, якою має бути кількість дерев та випадково обрана функція на кожному розрізі, щоб виростити дерева? може будь-який інший параметр сильно впливає на результати?

5
Кластеризація (k-означає або інше) з обмеженням мінімального розміру кластера
Мені потрібно об'єднати одиниці в кластери, щоб мінімізувати суму квадратів у межах групи (WSS), але мені потрібно забезпечити, щоб кожен кластер містив принаймні m одиниць. Будь-яка ідея, чи дозволяє будь-яка з кластеризуючих функцій R об'єднати в k кластери з обмеженням мінімального розміру кластера? kmeans (), здається, не пропонує варіант обмеження …
14 r  clustering 

2
Яка різниця між випуском «coef» та «(exp) coef» у coxph у R?
Я намагався розрізнити, що саме означають "coef" та "(exp) coef" coxph. Здається, що "(exp) coef" - це порівняння першої змінної в моделі відповідно до групи, призначеної в команді. Як функція coxph доходить до значень "coef" та "(exp) coef"? Окрім того, як coxph визначає ці значення, коли проводиться цензура?

3
OLS - СВІЙ. Але що робити, якщо я не дбаю про неупередженість та лінійність?
Теорема Гаусса-Маркова говорить нам, що ОЦП-оцінювач є найкращим лінійним неупередженим оцінником для моделі лінійної регресії. Але припустимо, що я не переймаюся лінійністю та неупередженістю. Тоді чи існує якийсь інший (можливий нелінійний / упереджений) оцінювач для лінійної регресійної моделі, який є найбільш ефективним за припущеннями Гаусса-Маркова чи іншим загальним набором припущень? …

6
Лінійна регресія, коли Y обмежена і дискретна
Питання просте: Чи доцільно використовувати лінійну регресію, коли Y обмежена і дискретна (наприклад, тестовий бал 1 ~ 100, деякий заздалегідь визначений рейтинг 1 ~ 17)? У цьому випадку, чи "не добре" використовувати лінійну регресію, або цілком неправильно її використовувати?

5
Навіщо нам потрібна альтернативна гіпотеза?
Коли ми робимо тестування, ми отримуємо два результати. 1) Ми відкидаємо нульову гіпотезу 2) Ми не можемо відкинути нульову гіпотезу. Ми не говоримо про прийняття альтернативних гіпотез. Якщо ми не говоримо про прийняття альтернативної гіпотези, навіщо нам взагалі існувати альтернативна гіпотеза? Ось оновлення: чи міг би хтось надати мені два …

2
Яке очікуване значення логарифму розподілу гамми?
Якщо очікуване значення Gamma(α,β)Gamma(α,β)\mathsf{Gamma}(\alpha, \beta) дорівнює αβαβ\frac{\alpha}{\beta} , яке очікуване значенняlog(Gamma(α,β))log⁡(Gamma(α,β))\log(\mathsf{Gamma}(\alpha, \beta))? Чи можна це обчислити аналітично? Параметризація, яку я використовую, є швидкістю форми.

3
Чому нейронні мережі потребують вибору / інженерії функцій?
Особливо в контексті змагань з караглів я помітив, що продуктивність моделі - це все, що стосується вибору / інженерії функцій. Хоча я цілком можу зрозуміти, чому це стосується тих випадків, коли ми маємо справу з більш звичайними / старошкільними алгоритмами ML, я не розумію, чому це було б у випадку …

2
Навіщо використовувати посилання logit в бета-регресії?
Нещодавно мене зацікавило впровадження бета-регресійної моделі, для результатів якої пропорція. Зауважимо, що цей результат не впишеться у двочленний контекст, оскільки в цьому контексті немає змістовної концепції дискретного "успіху". Насправді результат насправді є часткою тривалості; чисельник - це кількість секунд, коли певна умова активна за загальну кількість секунд, протягом яких умова …

1
Яка різниця між епізодом та епохою у глибокому навчанні Q?
Я намагаюся зрозуміти відомий документ "Гра в Атарі з вивченням глибокого підкріплення" ( pdf ). Мені незрозуміло щодо різниці між епохою та епізодом . В алгоритмі зовнішній цикл знаходиться над епізодами , тоді як на малюнку2 вісь x позначенаепохою. У контексті підкріплення навчання мені не зрозуміло, що означає епоха. Чи …

2
Яким чином перехресне підтвердження k-кратного розміщення вписується в контекст навчальних / перевірочних / тестових наборів?
Моє головне питання - це намагання зрозуміти, як перехресна перевірка k-кратна вписується в контекст набору навчальних / валідаційних / тестувальних наборів (якщо вона взагалі відповідає такому контексту). Зазвичай люди говорять про розбиття даних на навчальний, валідаційний та тестовий набір - скажімо, у співвідношенні 60/20/20 за курс Ендрю Нґ - при …

5
Чи має значення перехресна ентропія в контексті регресії?
Чи має значення перехресна ентропія в контексті регресії (на відміну від класифікації)? Якщо так, чи могли б ви навести приклад іграшки через TensorFlow? Якщо ні, то чому б і ні? Я читав про крос-ентропію в нейронних мережах та глибоке навчання Майкла Нільсена, і, здається, щось таке, що природно можна було …

2
Як Naive Bayes працює з безперервними змінними?
На моє (дуже базове) розуміння, Naive Bayes оцінює ймовірності на основі частоти класів кожної функції у навчальних даних. Але як він обчислює частоту безперервних змінних? І коли робите прогнозування, як воно класифікує нове спостереження, яке може не мати однакових значень у будь-якого спостереження у навчальному наборі? Він використовує якусь міру …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.