Open-source LLM в компании — это запуск открытых (или условно открытых) весов в контуре, который вы контролируете, а не только вызов закрытого API. Это решение об инфраструктуре и лицензии, не лозунг «свобода от вендоров».
Сравнение конкретных линеек — в Kimi, Qwen, DeepSeek. Про контуры — в размещении. Здесь — когда свои веса вообще стоит трогать.
Что вы покупаете на самом деле
Не «бесплатный GPT». Вы покупаете железо или выделенные GPU, время людей на обновление рантайма, процедуру оценки новой версии, запас по мощности. Веса сами по себе не отвечают на инциденты и не пишут журнал для ИБ.
Лицензию читает юрист до пилота: часть моделей нельзя встраивать в коммерческий сервис как вам хочется. «Скачали с хаба» — не акт ввода в эксплуатацию.
Где открытые веса выигрывают
Данные не должны покидать периметр. Нужна стабильная нагрузка 24/7. Планируется дообучение. Закупки проще закрыть железом и услугой размещения, чем иностранным API.
В каталоге открытые и закрытые модели могут жить рядом за одним контролем. Имеет смысл пользоваться этим, а не объявлять религию «только open-source».
Где проигрывают
Редкая нагрузка: карты греют воздух. Нет эксплуатации GPU. Нужен быстрый переход на новую закрытую модель без пересборки стека. Нет eval: вы не узнаете, что обновление весов развалило классификацию заявок.
Шлюз всё равно нужен
Локальный endpoint без политик — тот же теневой ИИ, только в вашей стойке. Ключи, DLP, квоты, маршрутизация на API-модель для нечувствительных задач — это шлюз, не «просто vLLM».
Гибрид нормален: внутренние документы — локальная модель, черновики на публичных данных — API. Сотрудник это не выбирает вручную.
Частые вопросы
Это языковая модель, веса которой можно запустить в своём или выделенном контуре, а не только вызвать через API поставщика. «Открытость» лицензий разная: не каждый файл с Hugging Face можно встроить в продукт без проверки юристами. Эксплуатация — ваша или провайдера Private AI Cloud.
Она может не уходить к зарубежному API, если вы действительно гоняете её у себя. Это не делает её безопасной сама по себе: промпт с ПДн в логах приложения, дырявый доступ к GPU, отсутствие журнала — те же дыры. Безопасность даёт контур и [шлюз](/platform#gateway), не формат весов.
Когда данные нельзя отдавать во внешний API, нужна предсказуемая стоимость на ровной нагрузке, или вы дообучаете свои веса. Когда нагрузка редкая и модели меняются каждый месяц, API-каталог обычно дешевле простоя карт.
Та — про выбор конкретных линеек под задачу. Эта — про сам факт запуска открытых весов в корпоративном контуре: лицензия, железо, обновления, роль шлюза. Их имеет смысл читать вместе.