Перейти к содержимому

AI

Запуск AI-моделей под нагрузкой

Мощности GPU с автомасштабированием и реальным ограничением по времени ответа.

AI-продукты · Проект · 14 недель

01 · Заявка

Модель стояла рядом с продуктом как неизмеряемое дополнение. Когда она замедлялась, обещанное время ответа продукта становилось фикцией.

02 · Работа

Обслуживание перевели на vLLM с разделением клиентов, пакетной обработкой и общим со всем остальным мониторингом. Выключатель — в том же дашборде, что и остальная эксплуатация.

03 · Что выдержало

Время ответа, под которым готов подписаться руководитель инфраструктуры. Модель перестала быть тем, что пугает эксплуатацию.

Стек

  • vLLM
  • CUDA
  • Kubernetes
  • Cilium
  • OpenTelemetry

Ещё проекты