Перейти к содержимому

Инфраструктура

Инфраструктура, которая переживает потерю дата-центра

Мощности в нескольких регионах, которые масштабируются сами и продолжают работать, когда один из них падает.

Высокие нагрузки · Проект · 20 недель

01 · Заявка

Платформа жила в одном дата-центре одного провайдера. Мощности добавлял человек накануне рекламной кампании, релизы выкладывались руками по SSH, а root-доступ был один на всех инженеров. Сбой у провайдера означал простой, а всплеск трафика — вечер догадок.

02 · Работа

Три региона, в которых трафик направляется по здоровью сервисов, а не человеком; автомасштабирование по длине очереди и времени ответа вместо CPU; частная сеть между регионами; доступ выдаётся отдельно каждому сервису и сгорает по времени вместо общего ключа. Выкладка переехала в репозиторий: Argo CD применяет то, что в нём записано, Nix собирает один и тот же артефакт везде, а любой релиз откатывается одним обратным коммитом. Раз в месяц регион выключают намеренно — чтобы убедиться, что всё работает.

03 · Что выдержало

Целый регион может погаснуть, а клиенты увидят секунду задержки, а не недоступный сайт. Мощности сами идут за нагрузкой, о кампании больше не нужно предупреждать, а дежурство перестало быть ночной сменой.

Стек

  • Kubernetes
  • Terraform
  • Argo CD
  • Nix
  • Cilium

Ещё проекты