Все причины
Своя модель

Ваша модель. Ваш эндпоинт. Ваша экономика.

Слой агентов и слой модели здесь разделены. Направьте agent4.io на любой OpenAI-совместимый эндпоинт — на фронтир-API, на небольшую открытую модель на своём железе или сразу на несколько — не переделывая ни одного агента.

Любой OpenAI-совместимый эндпоинт — облачная фронтир-модель или открытые веса у вас
Несколько бэкендов сразу, с весами и переключением при отказе
Возможности опрашиваются при старте, а не зашиты в код — маленькое контекстное окно будет учтено
Учтены именно те способы, которыми небольшие открытые модели ломаются на вызовах инструментов

Модель — это настройка, а не архитектура

Большинство агентских платформ построены под одно семейство моделей и наследуют его допущения: его контекстное окно, его формат вызова инструментов, его цену. Сменить модель после этого — значит переписать платформу.

Здесь модель стоит за шлюзом. Бэкенд — это строка в таблице: базовый URL, ключ, имя модели, вид, вес. Добавить ещё один — изменение конфигурации, а не деплой. Ваши агенты, промпты, базы знаний и навыки не знают и не должны знать, какая модель ответила.

Именно эта развязка и делает возможным всё остальное на этой странице — контроль расходов, модель внутри вашей сети, разные уровни моделей под разные задачи. Одно архитектурное решение работает сразу на четырёх направлениях.

Небольшие открытые модели ломаются вполне определённым образом

«Поддерживаем открытые модели» — фраза, которую легко сказать и которая обычно означает «HTTP-запрос проходит». Отказы вылезают позже, на проде, на вызовах инструментов. Четыре из них встречаются достаточно часто, чтобы делать под них отдельную работу:

Вызовы инструментов приходят текстом. Немало открытых моделей игнорируют структурное поле tool_calls и вписывают вызов прямо в тело ответа — в виде XML или JSON. Если ничего не делать, пользователь видит простыню разметки, и при этом не выполняется ничего. agent4.io разбирает обе формы, выполняет инструмент и вырезает разметку, чтобы она не дошла до конечного пользователя.

Потоковые вызовы приходят по кускам. OpenAI-совместимые серверы расходятся в том, как нарезать вызов инструмента по чанкам потока. Фрагменты собираются по индексу, и только после этого что-либо выполняется.

Контекстное окно в разы меньше. Модель с окном в 32K нельзя гонять так же, как модель с миллионом. Полезный бюджет входа выводится из окна, которое действительно опрошено при старте, за вычетом резерва под вывод и запаса прочности, — а не из числа, зашитого при сборке.

Рассуждения съедают ответ. У моделей, которые думают перед ответом, наивно посчитанный бюджет вывода уходит на рассуждения, и настоящий ответ обрезается. Бюджет поднимается с учётом этого.

Как это устроено в деталях — инженерная часть, для того человека в вашей команде, которого спросят, правда ли всё это.

Распределяйте по задачам, а не по вендорам

Не каждому шагу нужна одна и та же модель. Классификация, извлечение данных и рутинные ответы прекрасно даются небольшой модели; сложные рассуждения — уже не факт. Поскольку у бэкендов есть вид и вес, их можно держать рядом и отправлять каждую задачу туда, где ей место.

На практике делят не по сложности, а по цене ошибки: то, что только читает и мало чем рискует, — на модель подешевле, всё, что записывает и подтверждает, — на модель посильнее.

Что это меняет в расходах

Цена за токены — то самое возражение, на котором заканчивается большинство агентских проектов: пилот дешёвый, а раскатка нет. Разделение модели и платформы даёт три рычага вместо ни одного: увести объёмный и малорисковый трафик на модель подешевле, запустить открытые веса на железе, которое у вас и так есть, и оставить сильную модель для той работы, которая её окупает.

Речь не о том, что открытые модели — всегда правильный ответ. Речь о том, что решение остаётся за вами и остаётся обратимым.

Частые вопросы

Можно использовать в agent4.io свою модель вместо той, что идёт по умолчанию?
Да. agent4.io работает с любым OpenAI-совместимым эндпоинтом, и бэкенд модели здесь — конфигурация, а не код. Его можно направить на облачный фронтир-API, на открытую модель, которую вы сами запускаете в vLLM или Ollama, или сразу на несколько бэкендов. Ваши агенты, базы знаний и навыки при смене модели остаются прежними.
Работает ли agent4.io с открытыми моделями вроде Qwen?
Да, и совместимость здесь не сводится к тому, чтобы принять эндпоинт. Небольшие открытые модели регулярно выдают вызовы инструментов обычным текстом вместо структурных полей, присылают их в потоке по частям и имеют контекстное окно в разы меньше, чем у фронтир-моделей. agent4.io обрабатывает все три случая, а не исходит из того, что модель ведёт себя как фронтир-модель.
Что будет, если модель не поддерживает нативный вызов функций?
agent4.io разбирает и те вызовы инструментов, которые приходят текстом в теле ответа, — в обеих формах, XML и JSON, которые обычно выдают открытые модели, — и вырезает эту разметку, чтобы она никогда не дошла до конечного пользователя. Модель без нативной поддержки function calling всё равно может работать с инструментами.
Может ли agent4.io работать с моделью внутри нашей собственной сети?
Да. Модель вызывается по обычному OpenAI-совместимому HTTP-эндпоинту, поэтому этим эндпоинтом может быть сервер внутри вашей сети, у которого вообще нет маршрута в публичный интернет. Так обычно и поступают там, где регулирование или внутренняя политика не позволяют данным клиентов уходить стороннему провайдеру моделей.
Если я подключаю свою модель, agent4.io всё равно считает мне токены?
Нет. Квоты на токены относятся к инференсу, который предоставляет agent4.io. Когда вы подключаете собственный эндпоинт, стоимость инференса — это то, во что он обходится вам у вашего провайдера или на вашем железе, а agent4.io лицензируется отдельно. Напишите нам, и мы подберём подходящую схему.
Можно использовать разные модели для разных задач?
Да. Бэкенды регистрируются для каждого арендатора с указанием вида и веса, поэтому чат и векторизация могут работать на разных моделях, а трафик — распределяться между несколькими бэкендами одного вида. Если бэкенд отказал или недоступен, agent4.io повторит запрос к остальным, прежде чем сдаться.
Посмотрите, как это работает на вашей базе знаний.Начать бесплатноСвязаться с нами
Ещё причины

Узкая экспертиза

Вам не нужен очередной всезнающий чат-бот. Вам нужен агент, который знает ваш бизнес назубок и не выходит за границу, которую вы провели.

Запуск без разработчика

Никакого промпт-инжиниринга, никаких конфигурационных файлов и никакой заявки в ИТ-отдел. Два-три шага, вашими же словами, — и вы видите, что именно будет создано, ещё до того, как что-либо создано.

Память по каждому клиенту

Не один агент на всех, а отдельный агент на клиента, который держит в памяти всю историю отношений. Персонализация, недостижимая для карточки в CRM, по цене, которая выдерживает весь ваш портфель.

Высвобожденное время

Пока не потратишь час на выяснение, не понять, какие обращения стоят вашего времени. Этот час тратит агент — вопросы, соответствие требованиям, документы, — и в ваш календарь попадает дело, которое уже кто-то подготовил.

Агенты, которые действуют

Окно чата, которое умеет только разговаривать, оставляет всю работу вам. Этот оформляет заказ, записывает на приём, заводит заявку — через MCP и ваши API он подключён к вашим системам.

Непрерывность отношений

Там, где бизнес держится на отношениях, главный актив — это то, что команда знает о каждом клиенте. Обычно это знание живёт в голове одного человека. Здесь оно накапливается в компании.

Диалог, знающий страницу

Обычный чат начинается с пустоты и заставляет посетителя пересказывать то, что он только что читал. Этот отталкивается от самой страницы и сразу начинает с вопроса, который эта страница действительно вызывает.