Как возникает каскадный отказ и чем его останавливают?
Каскад начинается с малого: часть мощности выпала, оставшиеся инстансы получили больше нагрузки, время ответа выросло, клиенты словили таймауты и начали повторять. Повторы умножают трафик на уже перегруженную систему, очереди растут, память и пулы кончаются, проверки живости начинают падать — инстансы выводят из ротации, и нагрузка на остальных растёт ещё сильнее. Система входит в метастабильное состояние: исходной причины уже нет, а восстановиться она не может, потому что сама себя перегружает накопленной очередью и повторами. Останавливают это отбрасыванием лишнего трафика (load shedding), ограниченными очередями, бюджетом повторов, предохранителями и отказом от проверок живости, зависящих от чужих сервисов. Восстанавливают ступенчато, сняв нагрузку и сбросив очереди.