20 / 20
Как честно измерить производительность инференса: что не так с большинством бенчмарков?
Типичные ошибки: замер на одинаковых коротких промптах (у вас они разные и длинные), одна метрика вместо четырёх (нужны время до первого токена, время на токен, токены в секунду с узла и p99), нагрузка ровным потоком вместо всплесков, и измерение без учёта попаданий в кэш. Правильный замер воспроизводит ваш профиль: реальное распределение длин промпта и ответа, реальный уровень параллелизма и реальную долю повторяющихся префиксов.