Перейти к содержимому
20 / 23

Что такое самопроверка и самоулучшение у агентов — Reflexion, циклы самокритики, агенты-оценщики — и когда они оправданы?

Самопроверка и самоулучшение (reflection / self-refine) — использовать модель как критика собственных ответов. Цикл «сгенерировал → раскритиковал → переделал» повторяется до стабилизации, улучшая качество ценой дополнительных прогонов модели. Подходы: self-refine (одна модель, sequential critique-refine), Reflexion (verbal self-feedback по failed attempts, эффективен для tool-use задач с external verifier), scoring loops (0-10 score → refine при score < threshold), multi-agent debate, LLM-as-judge для evaluation. Оправдано там, где цена ошибки высока (код, юридические тексты) и есть чем проверить результат. Не оправдано в живом чате и в задачах без объективного критерия правильности.