2
Вимірювання подібності документа
Для кластеризації (текстових) документів потрібен спосіб вимірювання подібності між парами документів. Дві альтернативи: Порівняйте документи як термінові вектори, використовуючи косинулогічну подібність - і TF / IDF як коефіцієнти зважування для термінів. Порівняйте кожен розподіл вірогідності документів, використовуючи f-дивергенцію, наприклад, дивергенцію Куллбека-Лейблера Чи є якась інтуїтивна причина віддати перевагу одному методу …