Data Plane
Контур обработки запроса
- API / LiteLLM
- llm-d
- vLLM
- GPU
Обрабатывает каждый запрос: приём, применение политик, выбор экземпляра модели, исполнение на ускорителе, возврат ответа.
Корпоративная AI-инфраструктура
Предприятие строит не сервис, а инфраструктуру. Вычисления, сеть и хранилище уже стали корпоративной инфраструктурой — AI проходит тот же путь.
Исходная ситуация
Запросы обрабатываются на стороне провайдера, вне периметра предприятия.
Чем шире применение AI внутри компании, тем выше счёт.
Состав моделей, лимиты и приоритеты задаёт поставщик.
Закупленные ускорители не задействованы — вложения не работают.
Ограничение не в качестве внешних сервисов — в модели потребления.
Что это
Подразделения, филиалы и приложения используют корпоративные AI-модели по единому API.
Один контракт для приложений, агентов, RAG-сервисов и разработчиков.
Inference-сервисы создаются в интерфейсе, без ручной сборки манифестов.
Конфигурация из портала уходит в GitOps-контур и разворачивается в Kubernetes.
NVIDIA, Huawei Ascend и Moore Threads сегодня; AMD ROCm — в дорожной карте.
HLD
Уровни с зафиксированными контрактами: любой слой заменяется без риска сломать вышестоящий.
Потребители
Граница платформы
Прикладной AI-слой
RAG-сервисы · MCP-сервисы
Data Plane
Обрабатывает каждый запрос: приём, применение политик, выбор экземпляра модели, исполнение на ускорителе, возврат ответа.
Control Plane
Отвечает за жизненный цикл inference-сервисов: создание, изменение, размещение и контроль состояния. В обработке запросов не участвует.
Платформенные сервисы
Обеспечивают наблюдаемость, безопасность и воспроизводимость.
Инфраструктура и системы предприятия
Смена движка инференса затрагивает один уровень из пяти. Портал, API, SDK, мультитенантность, квоты и GitOps-эксплуатация сохраняются — вложения предприятия тоже.
Control Plane
Цикл создания и изменения
Задаёт параметры сервиса
Формирует целевую конфигурацию и манифесты
Источник целевого состояния, версионирование
Приведение кластера к целевому состоянию
Размещение и запуск inference-сервиса
Доступен потребителям через API
Цикл контроля состояния
Сбор метрик
Метрики платформы, inference-сервисов, запросов и GPU-ускорителей.
Журналирование
Централизованный сбор и хранение журналов компонентов.
Визуализация
Дашборды по нагрузке, доступности и состоянию компонентов.
Сводка
Статус, состояние и потребление ресурсов в одном месте
Свойства
От GPU до портала
Без привязки к производителю ускорителей
Взаимозаменяемые компоненты
Защищённый контур предприятия
Воспроизводимая эксплуатация
От пилота до холдинга
Мультивендорность
Верхние уровни не зависят от производителя GPU. Поддерживаем NVIDIA, Huawei Ascend и Moore Threads: смена ускорителя затрагивает только нижний уровень — драйверы, образы, операторы кластера, — но не API и не модель управления.
Сравнение подходов
| Критерий | Внешний сервис | Платформа предприятия |
|---|---|---|
| Размещение | Инфраструктура провайдера | Контур предприятия |
| Контроль данных | По условиям сервиса | На стороне предприятия |
| Собственные GPU | Не используются | Задействуются |
| Модель затрат | Операционная, зависит от объёма | Капитальная, уже понесена |
| Управление | На стороне провайдера | На стороне предприятия |
| Vendor lock-in | Определяется поставщиком | Компоненты заменяемы |
Примеры внешних сервисов: Яндекс, VK, Сбер, Turbo.
Функции
Нагрузка
Распределение
Равномерное распределение запросов между запущенными подами.
Масштабирование
Изменение количества экземпляров сервиса по метрикам и текущей нагрузке.
Размещение
Распределение подов по GPU-узлам и отказоустойчивость при сбоях.
Производительность
Расчёт VRAM, необходимой для размещения и работы модели.
Производительность
Параллелизация и запуск сверхкрупных моделей на нескольких GPU и нодах.
Производительность
Расчёт производительности и прогноз стоимости инференса по сценариям.
Внедрение
Архитектура не меняется — расширяется только объём ресурсов. Согласуем приоритеты дорожной карты и разберём любой уровень платформы.
Сегмент имеющегося парка GPU
Промышленная эксплуатация
Дочерние общества и филиалы
Единая AI-инфраструктура