1 / 10
Как проследить путь запроса в LLM-системе целиком: вызовы модели, инструментов и поиска в одной трассировке?
Сквозная трассировка LLM-запроса — это дерево вложенных отрезков (span'ов): корневой = запрос пользователя, дочерние покрывают каждый этап — вызов эмбеддингов, поиск по векторам, переранжирование, генерация модели, вызовы инструментов, постобработка. Без неё разбор «почему ответ медленный или неточный» превращается в раскопки по логам. Стек: Langfuse (Apache 2.0, open-source, self-host или cloud), LangSmith (LangChain экосистема), Helicone (proxy-style), Phoenix Arize (OpenInference spec), W&B Weave. Разметка декораторами (@observe, traceable) сама собирает входы, выходы, задержку и токены; для своих инструментов span'ы добавляют вручную. Сколько трасс сохранять: 100% на стенде, 10–20% в проде плюс все с ошибками.