Перейти к содержимому

AI и автоматизация

Запуск AI-моделей

Обслуживание моделей, которое отвечает за миллисекунды и не падает на пике.

Обслуживание моделей, которое отвечает за миллисекунды и не падает на пике.

Обслуживание на vLLM и TensorRT с разделением клиентов, автомасштабированием и понятными эксплуатации ограничениями по времени ответа. Нужно там, где модель стоит внутри продукта и её медлительность становится медлительностью продукта.

  • Обслуживание на vLLM / TensorRT с заданным временем ответа
  • Разделение GPU, пакетная обработка и автомасштабирование при всплесках
  • Вспомогательные сервисы видны в той же трассировке, что и кластер
Обсудить задачу

Как идёт работа

  1. 01

    Разбираемся в задаче

    Для кого продукт и что считается результатом. Созвон и короткий документ.

  2. 02

    Дизайн или AI-first

    Есть макеты — работаем по ним. Нет — интерфейс AI-first на готовых компонентах.

  3. 03

    Разработка и проверка

    Настоящий контент, проверка на телефонах и медленной связи. Статус — каждый день.

  4. 04

    Запуск и сопровождение

    Выкатываем и ведём дальше. Поддержка, срок ответа и цена — записаны до запуска.

Ещё в разделе AI и автоматизация