Размещение ИИ — это вопрос, где выполняется запрос к модели и кто отвечает за железо, сеть и доступ. Путают его с «выбором ChatGPT». Можно взять сильную модель и нарушить политику данных. Можно поставить GPU в стойку и не знать, чем её загрузить.
На платформе AI Cloud заложены управляемый контур, Private AI Cloud на выделенных GPU, гибрид и размещение в периметре заказчика. Ниже — как выбирать между ними, не подгоняя ответ под логотип.
Управляемый сервис (общий контур)
Запрос идёт через шлюз к моделям каталога. Вы не администрируете GPU. Имеет смысл, когда нагрузка скачет, модели меняются, а ИБ закрывается политиками, DLP и договором, а не «чтобы железо стояло у нас в глазах».
Это базовый режим AIaaS. Он же чаще всего стартовый: дешевле проверить сценарий, чем закупать стойку.
Выделенное частное облако
Private AI Cloud — изолированный контур на выделенных GPU: меньше соседей, понятнее периметр, можно разместить свои веса. Вы всё ещё не обязаны сами менять драйверы каждый месяц, но платите за мощность, даже если ночью запросы не идут.
Имеет смысл при устойчивой нагрузке, требованиях заказчика «не общий тенант» и при дообучении. Не имеет смысла как способ «выглядеть серьёзно» при десяти запросах в день.
Периметр компании (on-premise)
Модель крутится в вашем ЦОД или в арендованной стойке под вашим файрволом. Контроль максимальный. Цена — люди, которые умеют это эксплуатировать, и простой, если вы недозаложили карты.
On-premise не отменяет шлюз. Наоборот: без единой точки политик у вас появятся прямые вызовы к локальному endpoint из каждого сервиса, и через год никто не отзовёт ключ уволенного подрядчика.
Гибрид как правило, не как компромисс
Типичная схема: черновики и публичные задачи — в управляемый каталог; персональные данные и внутренние расследования — в изолированный контур. Сотрудник не должен сам угадывать, «куда можно». Это решает маршрутизация на шлюзе.
Ошибка гибрида — два независимых мира без общего журнала. Тогда ИБ снова не может ответить, что уходило наружу.
Дообучение не равно «разместили у себя»
Дообучение на своих данных требует корпуса, разметки, процедуры обновления и оценки, что новая версия не деградировала. Размещение open-source модели as-is — другой проект: вы запускаете чужие веса у себя.
Путать их опасно: закупка пишет «on-prem и fine-tune», команда привозит Llama из интернета и считает задачу закрытой. Для поиска по документам чаще хватает RAG без обучения весов — см. корпоративную базу знаний.
Как принять решение на одном совещании
Три вопроса. Какие классы данных нельзя выносить? Какой профиль нагрузки — пики или ровная лента? Есть ли эксплуатация GPU в штате? Если на третий вопрос «нет», а на первый «почти всё можно при DLP» — начните с управляемого контура.
Если первый вопрос «ничего нельзя» — обсуждайте периметр или выделенное облако, а не список моделей из новостей. Тарифные рамки — на pricing; заявка с ограничениями ИБ — контакт.
Частые вопросы
Когда данные или требования ИБ не позволяют пользоваться общим контуром, нужна выделенная мощность или свои дообученные веса. Если достаточно политик на шлюзе и журнала, выделенное облако рано: вы купите простой GPU и недозагрузите его.
Это запуск модели в инфраструктуре заказчика: свои или арендованные серверы в его периметре. Компания получает контроль над железом и сетью и принимает на себя патчи, очереди, мониторинг и запас по мощности.
Да, это обычный гибрид: публичные модели — через шлюз для нечувствительных задач, изолированный контур — для данных, которые нельзя выносить. Маршрутизация должна быть правилом, а не выбором сотрудника в каждом чате.
Чаще нет. Сначала RAG и промпт на ваших документах. Дообучение имеет смысл, когда стиль и терминология стабильны, данных достаточно и вы готовы держать конвейер обучения. Иначе вы получите дорогую модель, которая устареет вместе с прошлым кварталом регламентов.