6 / 21
Как реализовать стриминг ответа LLM на бэке и фронте (SSE)?
Стриминг отдаёт токены по мере генерации, вместо ожидания полного ответа — это критично для UX, потому что 5-секундный wait превращается в живой печатающийся текст. На бэке используешь client.responses.stream(...) (OpenAI) или client.messages.stream(...) (Anthropic) и пушишь чанки в SSE-ответ. На фронте читаешь через EventSource или ReadableStream из fetch.