Когда брать маленькую специализированную модель, а когда — большую универсальную: как принимать решение?
Маленькая специализированная модель (Phi-4-mini 3.8B, Gemma 3 4B, Llama 3.3 8B, Qwen3 8B, Qwen3.5) после дообучения на ваших данных догоняет и обгоняет флагманскую на вашей узкой задаче — при этом дешевле в 10–50 раз и отвечает в 10 раз быстрее. Большая универсальная модель (Claude Opus 4.8, GPT-5.6, Gemini 3.5) выигрывает там, где задача открытая: сложные рассуждения, длинный контекст (сотни тысяч токенов), работа с картинками и звуком, агентские сценарии и умение подхватить задачу с пары примеров. Как решать: есть ли у вас размеченный набор для замера качества → сможет ли дообученная маленькая модель повторить результат большой → если да, берите маленькую с дообучением; если нет — большую. Стандарт для прода — маршрутизатор: массовые запросы уходят маленькой модели, сложные — большой.