Бизнесу редко нужен «просто чат». Нужен разбор письма, расшифровка звонка, поиск по PDF, иногда картинка для регламента или черновик функции в репозитории. Это разные типы моделей. Сваливать их в одну подписку «на нейросеть» удобно в закупке и неудобно в эксплуатации.
В каталоге типы уже разведены. Ниже — зачем каждый класс, без обзора всех брендов подряд.
Текстовые модели (LLM)
Классификация, суммаризация, черновики, извлечение полей, агентные цепочки, если вы понимаете, как останавливать цикл. Это то, что обычно имеют в виду под «подключить GPT». Выбор конкретной линейки — в как выбрать LLM.
Текстовая модель плохо заменяет каталог и учёт. Она хорошо готовит вход для них.
Графические модели
Генерация изображений по API нужна, когда картинки — часть процесса: витрина, обучающие схемы, черновики макетов. Для «поиграем в обед» корпоративный контур избыточен. Для бренда и персональных данных на фото — наоборот, без политик нельзя.
Kandinsky и зарубежные генераторы решают похожую задачу с разным стилем и разным договором. Сравнивать имеет смысл на ваших промптах и на правилах, можно ли отправлять референс с лицами клиентов.
Речь
Распознавание — вход для контакт-центра и совещаний. Синтез — голосовые уведомления и IVR, если голос согласован. Отдельные речевые модели обычно дешевле и стабильнее, чем гнать аудио в универсальный мультимодальный чат.
Дальше текст живёт уже как LLM-задача: саммари звонка, заполнение CRM. См. контакт-центр и совещания.
Видео
Имеет смысл, если у вас уже есть поток роликов: обучение, инспекции, маркетинг. Подключать видеомодель «чтобы было в каталоге» — способ сжечь бюджет на экспериментах без процесса. Сначала владелец сценария, потом API.
Embeddings и поиск
Без векторов корпоративный «спросить регламент» превращается в угадайку. Чат отвечает гладко и мимо. Индекс строится из ваших PDF и вики, потом LLM собирает ответ по найденным кускам.
Это не замена текстовой модели, а другой слой. Разбор — RAG.
Код
Модели для кода ускоряют черновик и тесты. В проде без ревью это источник уязвимостей и лицензионного мусора. Корпоративный доступ здесь тот же: ключ, журнал, запрет вставлять секреты из репозитория в промпт.
Как собрать набор без зоопарка подписок
Один договор и шлюз, разные маршруты. Сотруднику не нужно пять личных кабинетов. Приложению не нужно пять способов авторизации. Интерфейсы моделей при этом остаются разными: единого API на текст, картинку и речь нет — есть единый контроль.
Практическая сборка: начните с текста + embeddings, если цель — знания и документы. Добавьте речь, если есть звонки. Картинки и видео — когда появится процесс, а не любопытство. Заявка на расширение каталога — контакт.
Частые вопросы
Часто — речь (расшифровка звонков и синтез), документы и изображения (OCR, генерация макетов), embeddings для поиска по базе знаний, модели для кода у разработки. Видео — если есть процесс, который его порождает, а не «на всякий случай».
Иногда одна модель принимает и текст, и картинку. Это не значит, что ею выгодно расшифровывать тысячу часов звонков или строить индекс поиска. Для потока обычно дешевле и стабильнее профильные модели плюс маршрутизация.
Embeddings переводят текст в вектор для поиска похожего. Чат генерирует следующий текст. Для корпоративной базы знаний нужны оба шага: сначала найти фрагменты, потом собрать ответ. Подробнее — в статье про [RAG](/resources/corporate-knowledge-rag).
В каталоге AI Cloud — более 300 моделей: российские, зарубежные и open-source, текст, графика, речь, видео, embeddings, код. Список расширяется по запросу компании. Примеры — на странице [моделей](/models).