15 / 15
Какие основные метрики качества в NLP — BLEU, ROUGE, METEOR, perplexity, F1 — и когда какую использовать?
BLEU — n-gram precision с brevity penalty, для перевода. ROUGE — n-gram recall + LCS, для summarization. METEOR — учитывает синонимы и стемминг, лучше коррелирует с человеком. Perplexity — exp(loss) языковой модели, насколько модель «удивляется» тексту. F1 — для классификации/NER (precision и recall сущностей). LLM-as-judge сейчас часто дополняет.