Prometheus в проде: HA-пара, потеря данных при рестарте, agent mode
Prometheus не реплицируется: высокая доступность делается двумя независимыми серверами с одинаковой конфигурацией, которые скрейпят одни и те же цели и шлют алерты в один Alertmanager — дедупликация происходит там. Данные при этом не идентичны: моменты скрейпа у серверов разъезжаются, поэтому графики с разных половин пары слегка различаются, и запрос надо адресовать одной из них либо ставить дедуплицирующий слой (Thanos Query, Mimir). Рестарт — не бесплатная операция: сервер воспроизводит WAL, и на базе с миллионами серий это минуты недоступности; ускоряет дело флаг --enable-feature=memory-snapshot-on-shutdown. Данные, не попавшие в скрейп во время простоя, потеряны навсегда — «дослать» их нечем, и это ключевое отличие pull-модели. Agent mode (--agent) превращает Prometheus в сборщик без хранения, запросов, правил и UI: он только скрейпит и шлёт remote write; уместен на краю — в закрытых сегментах и на узлах, где локальная база не нужна.