Перейти к содержимому
Uncode

Корпоративная AI-инфраструктура

AI-платформа предприятия

Предприятие строит не сервис, а инфраструктуру. Вычисления, сеть и хранилище уже стали корпоративной инфраструктурой — AI проходит тот же путь.

  • Защищённый контур
  • Собственные GPU
  • Полный контроль над развитием
Десятки тысяч
пользователей в контуре холдинга
Сотни
приложений и внутренних сервисов
On-Prem
данные не покидают предприятие

Исходная ситуация

Почему внешняя модель не масштабируется

  • Данные покидают контур

    Запросы обрабатываются на стороне провайдера, вне периметра предприятия.

  • Затраты растут с объёмом

    Чем шире применение AI внутри компании, тем выше счёт.

  • Развитие определяется извне

    Состав моделей, лимиты и приоритеты задаёт поставщик.

  • GPU простаивают

    Закупленные ускорители не задействованы — вложения не работают.

Ограничение не в качестве внешних сервисов — в модели потребления.

Что это

Управляемая инференс-платформа в вашем контуре

Подразделения, филиалы и приложения используют корпоративные AI-модели по единому API.

  1. 01

    Единая точка доступа к инференсу

    Один контракт для приложений, агентов, RAG-сервисов и разработчиков.

  2. 02

    Управление через портал

    Inference-сервисы создаются в интерфейсе, без ручной сборки манифестов.

  3. 03

    GitOps-подход

    Конфигурация из портала уходит в GitOps-контур и разворачивается в Kubernetes.

  4. 04

    Мультивендорная поддержка GPU

    NVIDIA, Huawei Ascend и Moore Threads сегодня; AMD ROCm — в дорожной карте.

HLD

Архитектура платформы

Уровни с зафиксированными контрактами: любой слой заменяется без риска сломать вышестоящий.

Потребители

  • Бизнес-приложения
  • AI-агенты
  • RAG-сервисы
  • Филиалы и ДО
  • Разработчики
  • Copilot управления

Граница платформы

Прикладной AI-слой

RAG-сервисы · MCP-сервисы

Data Plane

Контур обработки запроса

  • API / LiteLLM
  • llm-d
  • vLLM
  • GPU

Обрабатывает каждый запрос: приём, применение политик, выбор экземпляра модели, исполнение на ускорителе, возврат ответа.

Control Plane

Контур управления

  • Портал
  • GitOps
  • Kubernetes / KServe

Отвечает за жизненный цикл inference-сервисов: создание, изменение, размещение и контроль состояния. В обработке запросов не участвует.

Платформенные сервисы

Обеспечивают наблюдаемость, безопасность и воспроизводимость.

  • Prometheusметрики
  • Grafanaвизуализация
  • Lokiжурналирование
  • OpenBAOсекреты
  • Реестр образовобразы

Инфраструктура и системы предприятия

  • GPU-серверы
  • CPU-узлы
  • Сеть
  • Хранилище
  • Kubernetes
  • Identity Provider
  • SIEM

Меняется компонент. Не платформа.

Смена движка инференса затрагивает один уровень из пяти. Портал, API, SDK, мультитенантность, квоты и GitOps-эксплуатация сохраняются — вложения предприятия тоже.

Реализация

  • Kubernetes
  • vLLM
  • llm-d
  • LiteLLM
  • KServe
  • Qdrant
  • OpenBAO
  • Prometheus
  • Grafana
  • Harbor
  • Gitea

Control Plane

Управление через портал и GitOps

Цикл создания и изменения

  1. 01

    Администратор

    Задаёт параметры сервиса

  2. 02

    Портал

    Формирует целевую конфигурацию и манифесты

  3. 03

    Git-репозиторий

    Источник целевого состояния, версионирование

  4. 04

    Flux / GitOps

    Приведение кластера к целевому состоянию

  5. 05

    Kubernetes / KServe

    Размещение и запуск inference-сервиса

  6. 06

    Inference-сервис

    Доступен потребителям через API

Цикл контроля состояния

  • Prometheus

    Сбор метрик

    Метрики платформы, inference-сервисов, запросов и GPU-ускорителей.

  • Loki

    Журналирование

    Централизованный сбор и хранение журналов компонентов.

  • Grafana

    Визуализация

    Дашборды по нагрузке, доступности и состоянию компонентов.

Портал

Сводка

Статус, состояние и потребление ресурсов в одном месте

Свойства

Что определяет применимость на масштабе

  • Полный стек

    От GPU до портала

  • Мультивендорность

    Без привязки к производителю ускорителей

  • Открытая архитектура

    Взаимозаменяемые компоненты

  • On-Prem

    Защищённый контур предприятия

  • GitOps

    Воспроизводимая эксплуатация

  • Масштабирование

    От пилота до холдинга

Мультивендорность

Работаем на NVIDIA и китайских ускорителях

Верхние уровни не зависят от производителя GPU. Поддерживаем NVIDIA, Huawei Ascend и Moore Threads: смена ускорителя затрагивает только нижний уровень — драйверы, образы, операторы кластера, — но не API и не модель управления.

  • NVIDIAсегодня
  • Huawei Ascendсегодня
  • Moore Threadsсегодня
  • AMD ROCmroadmap

Сравнение подходов

Внешний сервис и платформа предприятия

Сравнение внешнего AI-сервиса и собственной платформы предприятия
КритерийВнешний сервисПлатформа предприятия
РазмещениеИнфраструктура провайдераКонтур предприятия
Контроль данныхПо условиям сервисаНа стороне предприятия
Собственные GPUНе используютсяЗадействуются
Модель затратОперационная, зависит от объёмаКапитальная, уже понесена
УправлениеНа стороне провайдераНа стороне предприятия
Vendor lock-inОпределяется поставщикомКомпоненты заменяемы

Примеры внешних сервисов: Яндекс, VK, Сбер, Turbo.

Функции

Функциональный состав платформы

Управление моделями

  • Подключение
  • Публикация
  • Версионирование
  • Конфигурирование
  • Обновление и откат

Инференс-сервисы

  • Создание через портал
  • Развёртывание
  • Масштабирование
  • Маршрутизация
  • Health check

Управление потребителями

  • API-доступ
  • Права и роли
  • API-ключи
  • Лимиты и квоты
  • Учёт и биллинг потребления

Эксплуатация

  • GitOps-развёртывание
  • Метрики и журналы
  • Управление секретами
  • Реестр образов
  • Автомасштабирование

Прикладные сценарии

  • RAG-сервисы
  • AI-агенты
  • Интеграция с бизнес-приложениями
  • ChatUI

Дорожная карта

  • Поддержка MCP
  • Полноценный MLOps
  • Пользовательский портал

Нагрузка

Масштабирование и распределение нагрузки

  • Распределение

    llm-d

    Равномерное распределение запросов между запущенными подами.

  • Масштабирование

    KEDA

    Изменение количества экземпляров сервиса по метрикам и текущей нагрузке.

  • Размещение

    Kubernetes

    Распределение подов по GPU-узлам и отказоустойчивость при сбоях.

  • Производительность

    Memory Calculator

    Расчёт VRAM, необходимой для размещения и работы модели.

  • Производительность

    TP / PP

    Параллелизация и запуск сверхкрупных моделей на нескольких GPU и нодах.

  • Производительность

    Benchmarking

    Расчёт производительности и прогноз стоимости инференса по сценариям.

Внедрение

От пилота к платформе холдинга

Архитектура не меняется — расширяется только объём ресурсов. Согласуем приоритеты дорожной карты и разберём любой уровень платформы.

  1. 01

    Пилот

    Сегмент имеющегося парка GPU

  2. 02

    Подразделение

    Промышленная эксплуатация

  3. 03

    Тиражирование

    Дочерние общества и филиалы

  4. 04

    Платформа холдинга

    Единая AI-инфраструктура

  • Data / Control Plane
  • Административный портал
  • Масштабирование
  • Наблюдаемость
  • Безопасность
  • GPU-уровень