Перейти к содержимому
10 / 10

Обновление кластера и узлов: как пережить drain, PDB и снятые версии API

Обновление кластера состоит из трёх независимых частей, и путаница между ними — источник большинства неприятностей. Плоскость управления обновляется первой и обычно безболезненно, но именно здесь снимаются устаревшие версии API: манифест, работавший вчера, перестаёт применяться, а установленные контроллеры могут оказаться несовместимыми. Узлы обновляются по одному: узел помечается неназначаемым, поды вытесняются (drain), и здесь всё зависит от того, есть ли у сервисов бюджет отказа (PodDisruptionBudget) и корректно ли они завершаются — без PDB вытеснение может унести все реплики сразу, а с некорректным завершением пользователи получат обрывы. Рабочие нагрузки проверяются заранее: сканирование манифестов на снятые версии API, проверка совместимости операторов и агентов. Практический порядок: прочитать примечания к версии, просканировать манифесты, обновить тестовый кластер, обновить плоскость управления, обновлять узлы по одному с наблюдением за метриками.