Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Прогнозування теми за допомогою прихованого розподілу Діріхле
Я використав LDA на корпусі документів і знайшов деякі теми. Вихід мого коду - дві матриці, що містять ймовірності; ймовірності однієї док-теми та інші ймовірності слова-теми. Але я фактично не знаю, як використовувати ці результати, щоб передбачити тему нового документа. Я використовую вибірку Гіббса. Хтось знає як? Спасибі

1
Підвищення та захоплення дерев (XGBoost, LightGBM)
Є багато повідомлень в блогах, відео на YouTube і т.д. про ідеях розфасовки або підвищення дерев. Моє загальне розуміння полягає в тому, що псевдокод для кожного такий: Мішок: Візьміть N випадкових вибірок x% зразків і y% ознак Встановіть свою модель (наприклад, дерево рішень) на кожен з N Прогнозуйте з кожним …

5
Яка різниця між прогнозами "у вибірці" та "поза вибіркою"?
Я не розумію, у чому саме різниця між прогнозом "у вибірці" та "поза вибіркою"? Прогноз у вибірці використовує підмножину наявних даних до прогнозних значень поза періодом оцінки. За вибірковим прогнозом натомість використовуються всі доступні дані Чи правильно це ? Дуже конкретно правильне таке визначення? В рамках вибіркового прогнозу використовується підмножина …

2
Як використовувати порядкову логістичну регресію з випадковими ефектами?
У своєму дослідженні я буду вимірювати навантаження на роботу за допомогою декількох показників. З мінливістю частоти серцевих скорочень (ВСР), електродермальною активністю (ЕДА) та з суб'єктивною шкалою (ІРС). Після нормалізації IWS має три значення: Навантаженість нижче норми Навантаженість середня Навантаженість вище норми. Хочу побачити, наскільки добре фізіологічні заходи можуть передбачити суб'єктивне …

1
Чи є зв’язок між косинусною схожістю, грунтовою кореляцією та z-балом?
Мені цікаво, чи є якийсь зв’язок серед цих 3 заходів. Я, здається, не можу зв’язатись між ними, посилаючись на визначення (можливо, тому, що я новачок у цих визначеннях і маю дещо нерозумілий час, що їх розуміє). Я знаю, що діапазон подібності косинусів може бути від 0 до 1, і кореляція …

2
Визначення природних кубічних сплайнів для регресії
Я дізнаюся про сплайни з книги "Елементи статистичного вивчення даних, висновок та прогнозування" від Hastie et al. На сторінці 145 я виявив, що природні кубічні сплайни лінійні за межі вузлів. У є KKK вузлів, і про такий сплайн у книзі наведено наступне.ξ1,ξ2,...ξKξ1,ξ2,...ξK\xi_1, \xi_2, ... \xi_K Питання 1: Як звільняються 4 …

2
Розуміння тесту Колмогорова-Смірнова в R
Я намагаюся зрозуміти вихід тестової функції Колмогорова-Смірнова (два зразки, двосторонній). Ось простий тест. x <- c(1,2,2,3,3,3,3,4,5,6) y <- c(2,3,4,5,5,6,6,6,6,7) z <- c(12,13,14,15,15,16,16,16,16,17) ks.test(x,y) # Two-sample Kolmogorov-Smirnov test # #data: x and y #D = 0.5, p-value = 0.1641 #alternative hypothesis: two-sided # #Warning message: #In ks.test(x, y) : cannot compute …

2
Класифікація з підвищенням градієнта: як зберегти прогноз у [0,1]
Питання Я намагаюся зрозуміти, як прогноз зберігається в інтервалі [0,1][0,1][0,1] коли робимо бінарну класифікацію з підвищенням градієнта. Припустимо, що ми працюємо над проблемою бінарної класифікації, і наша цільова функція - втрата журналу, −∑yilog(Hm(xi))+(1−yi)log(1−Hm(xi))−∑yilog⁡(Hm(xi))+(1−yi)log⁡(1−Hm(xi))-\sum y_i \log(H_m(x_i)) + (1-y_i) \log(1-H_m(x_i)) , де yyy - цільова змінна ∈{0,1}∈{0,1}\in \{0,1\} а HHH - наша …

1
Як знайти / оцінити функцію щільності ймовірності з функції щільності в R
Припустимо, у мене є така змінна, як Xіз невідомим розподілом. У Mathematica, використовуючи SmoothKernelDensityфункцію, ми можемо мати функцію оціночної щільності. Ця розрахункова функція густини може бути використана разом з PDFфункцією для обчислення функції щільності ймовірності значення, як Xу вигляді PDF[density,X]припущення, що "щільність" є результатом SmoothKernelDensity. Було б добре, якщо в …
17 r  pdf  cdf 

3
Як вибрати попереднє в оцінці параметрів Байєса
Я знаю 3 методи для оцінки параметрів, ML, MAP та підходу Байєса. А для підходу MAP та Bayes нам потрібно вибрати пріори для параметрів, правда? Скажімо, у мене є модель , в якій α , β - параметри, для того, щоб зробити оцінку за допомогою MAP або Bayes, я прочитав …

2
Чи можливий / практичний випадковий ліс з кількома виходами?
Випадкові ліси (RFs) - конкурентоспроможний метод моделювання / видобутку даних. Модель РФ має один вихід - змінну виводу / прогнозування. Наївним підходом до моделювання декількох виходів з радіочастотними сигналами було б побудова RF для кожної вихідної змінної. Таким чином, ми маємо N незалежних моделей, і там, де є кореляція між …

2
Як боротися з помилкою, такою як "Коефіцієнти: 14 не визначено через особливості" у R?
Коли ви робите GLM, і ви отримуєте помилку "не визначено через особливості" у виході anova, як можна протидіяти цій помилці? Деякі припустили, що це пов'язано з колінеарністю між коваріатами або що один із рівнів відсутній у наборі даних (див.: Інтерпретація "не визначено через особливості" в мкм ) Якби я хотів …

2
Огляд літератури про нелінійну регресію
Хтось знає про хорошу статтю з огляду статистичної літератури про нелінійну регресію? Мене насамперед цікавлять результати послідовності та асимптотика. Особливий інтерес представляє модель yit=m(xit,θ)+ϵit,yit=m(xit,θ)+ϵit,y_{it} = m(x_{it},\theta) + \epsilon_{it}, для панельних даних. Менший інтерес представляють непараметричні методи. Пропозиції для публікації журналів також дуже вітаються. На даний момент я читаю «Амемію» (1983) …


2
Чи є загальною практикою мінімізація середньої втрати за партіями замість суми?
Tensorflow має приклад навчального посібника щодо класифікації CIFAR-10 . У підручнику середня поперечна втрата ентропії по всій партії зведена до мінімуму. def loss(logits, labels): """Add L2Loss to all the trainable variables. Add summary for for "Loss" and "Loss/avg". Args: logits: Logits from inference(). labels: Labels from distorted_inputs or inputs(). 1-D …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.