1 / 20
Спекулятивное декодирование: как ускорить генерацию, ничего не потеряв в качестве?
Генерация упирается не в вычисления, а в чтение весов из памяти: чтобы выдать один токен, надо прогнать через шину всю модель. Спекулятивное декодирование пользуется тем, что проверить несколько токенов за один проход стоит почти столько же, сколько выдать один: лёгкая черновая голова предлагает несколько токенов вперёд, основная модель проверяет их одним проходом и оставляет принятый префикс. Распределение выходов при корректной схеме проверки совпадает с обычной генерацией — это ускорение без потери качества. Выигрыш максимален при малых батчах и тает при больших.