Todas las razones
Traiga su propio modelo

Su modelo. Su endpoint. Su curva de costos.

Aquí la capa de agentes y la capa de modelo van por separado. Apunte agent4.io a cualquier endpoint compatible con OpenAI —una API de frontera, un modelo abierto pequeño en hardware que usted controla, o varios a la vez— sin rehacer un solo agente.

Cualquier endpoint compatible con OpenAI, sea una API alojada o pesos abiertos en su propia máquina
Varios backends a la vez, ponderados y con conmutación por fallo entre ellos
Las capacidades se consultan al arranque, nunca vienen fijadas en el código
Preparado para las formas concretas en que los modelos abiertos pequeños fallan al invocar herramientas

El modelo es un ajuste, no una arquitectura

La mayoría de las plataformas de agentes están construidas contra una única familia de modelos y heredan sus supuestos: su ventana de contexto, su formato de llamadas a herramientas, su precio. Cambiar de modelo significa entonces rehacer la plataforma.

Aquí el modelo está detrás de una pasarela. Los backends son filas de una tabla: una URL base, una clave, un nombre de modelo, un tipo y un peso. Añadir uno es un cambio de configuración, no un despliegue. Sus agentes, sus prompts, sus bases de conocimiento y sus habilidades ni saben ni necesitan saber qué modelo respondió.

Esa indirección es lo que hace posible todo lo demás de esta página: el control del costo, un modelo dentro de su propia red y la mezcla de gamas de modelo según el trabajo. Es una sola decisión arquitectónica haciendo cuatro cosas.

Los modelos abiertos pequeños fallan de maneras muy concretas

«Soporta modelos abiertos» se dice fácil y casi siempre quiere decir «la llamada HTTP no da error». Los fallos aparecen más tarde, en producción y en el camino de las llamadas a herramientas. Cuatro de ellos son lo bastante frecuentes como para que los tengamos previstos:

Las llamadas a herramientas llegan como texto. Muchos modelos abiertos ignoran el campo estructurado tool_calls y escriben la llamada dentro del cuerpo de la respuesta, en XML o en JSON. Si nadie hace nada, el usuario ve un muro de marcado y no se ejecuta nada. agent4.io interpreta ambas formas, ejecuta la herramienta y limpia el marcado para que nunca llegue al usuario final.

Las llamadas en streaming llegan troceadas. Los servidores compatibles con OpenAI no se ponen de acuerdo sobre cómo repartir una llamada a herramienta entre los fragmentos del streaming. Los fragmentos se reensamblan por índice antes de ejecutar nada.

Las ventanas de contexto son mucho más pequeñas. Un modelo con una ventana de 32K no se puede manejar como uno de un millón. El presupuesto de entrada utilizable se deriva de la ventana que realmente se consultó al arranque, menos la reserva de salida y un margen de seguridad; no de una cifra fijada en el código al compilar.

El razonamiento se come la respuesta. En los modelos que piensan antes de responder, un presupuesto de salida ingenuo se lo lleva el razonamiento y la respuesta de verdad sale cortada. El presupuesto se amplía para tenerlo en cuenta.

Cómo funciona esto en detalle: la ingeniería, para la persona de su equipo a la que van a preguntarle si esto es real.

Enrute por trabajo, no por proveedor

No todos los pasos necesitan el mismo modelo. La clasificación, la extracción y las respuestas de rutina se comportan bien en un modelo pequeño; los pasos de razonamiento difícil quizá no. Como cada backend lleva un tipo y un peso, puede tenerlos funcionando en paralelo y poner cada trabajo donde le corresponde.

El reparto práctico suele ser por consecuencia y no por dificultad: lo de solo lectura y bajo riesgo en el modelo más barato, y todo lo que escribe o compromete algo en el más potente.

Qué cambia esto en el costo

El precio por token es la objeción que termina con la mayoría de los proyectos de agentes: el piloto sale barato y el despliegue no. Separar el modelo de la plataforma le da tres palancas donde antes no había ninguna: mover el tráfico de mucho volumen y poco riesgo a un modelo más barato, ejecutar pesos abiertos en hardware que ya tiene, y reservar el modelo potente para el trabajo que lo justifica.

La idea no es que los modelos abiertos sean siempre la respuesta correcta, sino que la decisión sigue siendo suya y sigue siendo reversible.

Preguntas frecuentes

¿Puedo usar mi propio modelo en agent4.io en lugar del que viene por defecto?
Sí. agent4.io habla con cualquier endpoint compatible con OpenAI, y el backend de modelo es configuración y no código. Puede apuntarlo a una API de frontera alojada, a un modelo abierto que usted mismo ejecute sobre vLLM u Ollama, o a varios backends a la vez. Sus agentes, sus bases de conocimiento y sus habilidades no cambian cuando cambia de modelo.
¿agent4.io funciona con modelos de código abierto como Qwen?
Sí, y el trabajo de compatibilidad va más allá de aceptar el endpoint. Los modelos abiertos pequeños emiten con frecuencia las llamadas a herramientas como texto plano en lugar de en campos estructurados, envían esas llamadas troceadas en fragmentos cuando responden en streaming y traen ventanas de contexto mucho más pequeñas que los modelos de frontera. agent4.io gestiona las tres cosas en vez de dar por supuesto el comportamiento de un modelo de frontera.
¿Qué pasa si un modelo no admite llamadas a funciones nativas?
agent4.io también interpreta las llamadas a herramientas que llegan como texto dentro del cuerpo de la respuesta, tanto en la forma XML como en la forma JSON que suelen producir los modelos abiertos, y elimina ese marcado para que nunca llegue al usuario final. Un modelo sin soporte nativo de llamadas a funciones puede seguir manejando herramientas.
¿Puede agent4.io funcionar contra un modelo que esté dentro de mi propia red?
Sí. Como el modelo se alcanza por un endpoint HTTP normal compatible con OpenAI, ese endpoint puede ser un servidor dentro de su propia red sin salida a internet. Es el montaje habitual cuando la regulación o la política interna impiden que los datos de sus clientes lleguen a un proveedor de modelos externo.
Si traigo mi propio modelo, ¿agent4.io me sigue cobrando por token?
No. Las cuotas de token se aplican a la inferencia que proporciona agent4.io. Cuando usted aporta su propio endpoint, el costo de la inferencia es el que le cobre su proveedor o el de su propio hardware, y agent4.io se licencia aparte. Hable con nosotros para encontrar el esquema que le encaje.
¿Puedo usar modelos distintos para trabajos distintos?
Sí. Los backends se registran por inquilino con un tipo y un peso, así que el chat y la vectorización pueden correr sobre modelos distintos y el tráfico puede repartirse entre varios backends del mismo tipo. Si un backend falla o no responde, agent4.io reintenta contra los demás antes de darse por vencido.
Míralo funcionando con tu propia base de conocimiento.Empezar gratisHablar con nosotros
Más razones

Experiencia enfocada

No necesita otro chatbot que opine de todo. Necesita un agente que domine su negocio a fondo y se mantenga dentro del límite que usted traza.

Configúrelo sin un desarrollador

Sin ingeniería de prompts, sin archivos de configuración y sin abrir un ticket a su informático. Dos o tres pasos, con sus propias palabras, y ve exactamente qué se va a crear antes de que se cree nada.

Memoria por cliente

No un agente para todos, sino un agente por cliente que conserva toda la relación. La personalización que una ficha de CRM no puede producir, a un costo que funciona en toda su cartera.

Recupere su tiempo

No hay forma de saber qué consultas merecen sus horas sin dedicar antes una hora a averiguarlo. Esa hora la dedica el agente —las preguntas, los requisitos, la documentación— y lo que llega a su agenda es un caso que alguien ya ha preparado.

Agentes que ejecutan

Un chat que solo conversa le deja a usted todo el trabajo pendiente. Este cierra el pedido, reserva el turno y abre el ticket, conectado a sus sistemas mediante MCP y sus propias APIs.

Continuidad de la relación

En un negocio de relaciones, lo que su equipo sabe de cada cliente es el activo — y suele vivir en la cabeza de una sola persona. Aquí se acumula en la empresa.

Conversaciones que saben desde dónde empiezan

Casi todas las burbujas de chat arrancan en blanco y obligan al visitante a contar otra vez lo que acababa de leer. Esta parte de la propia página y abre con la pregunta que esa página plantea de verdad.