Перейти к содержимому
15 / 15

Какие основные метрики качества в NLP — BLEU, ROUGE, METEOR, perplexity, F1 — и когда какую использовать?

BLEU — n-gram precision с brevity penalty, для перевода. ROUGE — n-gram recall + LCS, для summarization. METEOR — учитывает синонимы и стемминг, лучше коррелирует с человеком. Perplexityexp(loss) языковой модели, насколько модель «удивляется» тексту. F1 — для классификации/NER (precision и recall сущностей). LLM-as-judge сейчас часто дополняет.

Какие основные метрики качества в NLP — BLEU, ROUGE, METEOR, perplexity, F1 — и когда какую использовать? | JScriptiser