4 / 20
Model routing и cascades: как отправлять простое в дешёвую модель, а сложное — в дорогую?
Два разных приёма, которые часто путают. Routing решает до вызова, какой модели отдать запрос — classifier по сложности или semantic по теме. Cascade вызывает дешёвую модель и после ответа решает об escalation — по confidence или по verifier. Routing дешевле по latency (один вызов), cascade точнее (решение по фактическому ответу). Экономия работает потому, что распределение по сложности перекошено: большинство запросов простые.