Яку функцію втрати я повинен використовувати, щоб оцінити модель RNN seq2seq?
Я працюю над документом Cho 2014, який представив архітектуру кодер-декодер для моделювання seq2seq. У статті вони, здається, використовують ймовірність виходу даного входу (або це негативна ймовірність журналу) як функцію втрати для входу довжини та виходу довжини :xxxMMMyyyNNN P(y1,…,yN|x1,…,xM)=P(y1|x1,…,xm)P(y2|y1,x1,…,xm)…P(yN|y1,…,yN−1,x1,…,xm)P(y1,…,yN|x1,…,xM)=P(y1|x1,…,xm)P(y2|y1,x1,…,xm)…P(yN|y1,…,yN−1,x1,…,xm)P(y_1, …, y_N | x_1, …, x_M) = P(y_1 | x_1, …, x_m) …