Перейти к содержимому
1 / 20

Спекулятивное декодирование: как ускорить генерацию, ничего не потеряв в качестве?

Генерация упирается не в вычисления, а в чтение весов из памяти: чтобы выдать один токен, надо прогнать через шину всю модель. Спекулятивное декодирование пользуется тем, что проверить несколько токенов за один проход стоит почти столько же, сколько выдать один: лёгкая черновая голова предлагает несколько токенов вперёд, основная модель проверяет их одним проходом и оставляет принятый префикс. Распределение выходов при корректной схеме проверки совпадает с обычной генерацией — это ускорение без потери качества. Выигрыш максимален при малых батчах и тает при больших.

Спекулятивное декодирование: как ускорить генерацию, ничего не потеряв в качестве? | JScriptiser