Ваша модель. Ваш эндпоинт. Ваша экономика.
Слой агентов и слой модели здесь разделены. Направьте agent4.io на любой OpenAI-совместимый эндпоинт — на фронтир-API, на небольшую открытую модель на своём железе или сразу на несколько — не переделывая ни одного агента.
Модель — это настройка, а не архитектура
Большинство агентских платформ построены под одно семейство моделей и наследуют его допущения: его контекстное окно, его формат вызова инструментов, его цену. Сменить модель после этого — значит переписать платформу.
Здесь модель стоит за шлюзом. Бэкенд — это строка в таблице: базовый URL, ключ, имя модели, вид, вес. Добавить ещё один — изменение конфигурации, а не деплой. Ваши агенты, промпты, базы знаний и навыки не знают и не должны знать, какая модель ответила.
Именно эта развязка и делает возможным всё остальное на этой странице — контроль расходов, модель внутри вашей сети, разные уровни моделей под разные задачи. Одно архитектурное решение работает сразу на четырёх направлениях.
Небольшие открытые модели ломаются вполне определённым образом
«Поддерживаем открытые модели» — фраза, которую легко сказать и которая обычно означает «HTTP-запрос проходит». Отказы вылезают позже, на проде, на вызовах инструментов. Четыре из них встречаются достаточно часто, чтобы делать под них отдельную работу:
Вызовы инструментов приходят текстом. Немало открытых моделей игнорируют структурное поле
tool_calls и вписывают вызов прямо в тело ответа — в виде XML или JSON. Если ничего не делать,
пользователь видит простыню разметки, и при этом не выполняется ничего. agent4.io разбирает обе формы,
выполняет инструмент и вырезает разметку, чтобы она не дошла до конечного пользователя.
Потоковые вызовы приходят по кускам. OpenAI-совместимые серверы расходятся в том, как нарезать вызов инструмента по чанкам потока. Фрагменты собираются по индексу, и только после этого что-либо выполняется.
Контекстное окно в разы меньше. Модель с окном в 32K нельзя гонять так же, как модель с миллионом. Полезный бюджет входа выводится из окна, которое действительно опрошено при старте, за вычетом резерва под вывод и запаса прочности, — а не из числа, зашитого при сборке.
Рассуждения съедают ответ. У моделей, которые думают перед ответом, наивно посчитанный бюджет вывода уходит на рассуждения, и настоящий ответ обрезается. Бюджет поднимается с учётом этого.
Как это устроено в деталях — инженерная часть, для того человека в вашей команде, которого спросят, правда ли всё это.
Распределяйте по задачам, а не по вендорам
Не каждому шагу нужна одна и та же модель. Классификация, извлечение данных и рутинные ответы прекрасно даются небольшой модели; сложные рассуждения — уже не факт. Поскольку у бэкендов есть вид и вес, их можно держать рядом и отправлять каждую задачу туда, где ей место.
На практике делят не по сложности, а по цене ошибки: то, что только читает и мало чем рискует, — на модель подешевле, всё, что записывает и подтверждает, — на модель посильнее.
Что это меняет в расходах
Цена за токены — то самое возражение, на котором заканчивается большинство агентских проектов: пилот дешёвый, а раскатка нет. Разделение модели и платформы даёт три рычага вместо ни одного: увести объёмный и малорисковый трафик на модель подешевле, запустить открытые веса на железе, которое у вас и так есть, и оставить сильную модель для той работы, которая её окупает.
Речь не о том, что открытые модели — всегда правильный ответ. Речь о том, что решение остаётся за вами и остаётся обратимым.
Частые вопросы
- Можно использовать в agent4.io свою модель вместо той, что идёт по умолчанию?
- Да. agent4.io работает с любым OpenAI-совместимым эндпоинтом, и бэкенд модели здесь — конфигурация, а не код. Его можно направить на облачный фронтир-API, на открытую модель, которую вы сами запускаете в vLLM или Ollama, или сразу на несколько бэкендов. Ваши агенты, базы знаний и навыки при смене модели остаются прежними.
- Работает ли agent4.io с открытыми моделями вроде Qwen?
- Да, и совместимость здесь не сводится к тому, чтобы принять эндпоинт. Небольшие открытые модели регулярно выдают вызовы инструментов обычным текстом вместо структурных полей, присылают их в потоке по частям и имеют контекстное окно в разы меньше, чем у фронтир-моделей. agent4.io обрабатывает все три случая, а не исходит из того, что модель ведёт себя как фронтир-модель.
- Что будет, если модель не поддерживает нативный вызов функций?
- agent4.io разбирает и те вызовы инструментов, которые приходят текстом в теле ответа, — в обеих формах, XML и JSON, которые обычно выдают открытые модели, — и вырезает эту разметку, чтобы она никогда не дошла до конечного пользователя. Модель без нативной поддержки function calling всё равно может работать с инструментами.
- Может ли agent4.io работать с моделью внутри нашей собственной сети?
- Да. Модель вызывается по обычному OpenAI-совместимому HTTP-эндпоинту, поэтому этим эндпоинтом может быть сервер внутри вашей сети, у которого вообще нет маршрута в публичный интернет. Так обычно и поступают там, где регулирование или внутренняя политика не позволяют данным клиентов уходить стороннему провайдеру моделей.
- Если я подключаю свою модель, agent4.io всё равно считает мне токены?
- Нет. Квоты на токены относятся к инференсу, который предоставляет agent4.io. Когда вы подключаете собственный эндпоинт, стоимость инференса — это то, во что он обходится вам у вашего провайдера или на вашем железе, а agent4.io лицензируется отдельно. Напишите нам, и мы подберём подходящую схему.
- Можно использовать разные модели для разных задач?
- Да. Бэкенды регистрируются для каждого арендатора с указанием вида и веса, поэтому чат и векторизация могут работать на разных моделях, а трафик — распределяться между несколькими бэкендами одного вида. Если бэкенд отказал или недоступен, agent4.io повторит запрос к остальным, прежде чем сдаться.
Узкая экспертиза
Вам не нужен очередной всезнающий чат-бот. Вам нужен агент, который знает ваш бизнес назубок и не выходит за границу, которую вы провели.
Запуск без разработчика
Никакого промпт-инжиниринга, никаких конфигурационных файлов и никакой заявки в ИТ-отдел. Два-три шага, вашими же словами, — и вы видите, что именно будет создано, ещё до того, как что-либо создано.
Память по каждому клиенту
Не один агент на всех, а отдельный агент на клиента, который держит в памяти всю историю отношений. Персонализация, недостижимая для карточки в CRM, по цене, которая выдерживает весь ваш портфель.
Высвобожденное время
Пока не потратишь час на выяснение, не понять, какие обращения стоят вашего времени. Этот час тратит агент — вопросы, соответствие требованиям, документы, — и в ваш календарь попадает дело, которое уже кто-то подготовил.
Агенты, которые действуют
Окно чата, которое умеет только разговаривать, оставляет всю работу вам. Этот оформляет заказ, записывает на приём, заводит заявку — через MCP и ваши API он подключён к вашим системам.
Непрерывность отношений
Там, где бизнес держится на отношениях, главный актив — это то, что команда знает о каждом клиенте. Обычно это знание живёт в голове одного человека. Здесь оно накапливается в компании.
Диалог, знающий страницу
Обычный чат начинается с пустоты и заставляет посетителя пересказывать то, что он только что читал. Этот отталкивается от самой страницы и сразу начинает с вопроса, который эта страница действительно вызывает.