Uso de tokens — qué cuenta
Qué significan realmente las barras de "preprocesamiento" y "generación" en tu gráfico de uso, qué consume tokens y qué no, y cómo leer el uso a lo largo del tiempo y por agente.
Tu panel muestra el uso de tokens en dos colores — preprocesamiento y generación. A continuación se explica qué es cada uno y qué te cuesta tokens y qué no.
Los dos tipos de tokens
Un modelo de lenguaje grande cobra por el texto que lee y el texto que escribe, medido en tokens (aproximadamente ¾ de palabra cada uno). agent4.io divide tu uso de la misma manera:
- Preprocesamiento (entrada). Todo lo que se entrega al modelo para que pueda responder:
- el mensaje de la persona,
- el historial reciente de la conversación,
- los fragmentos relevantes recuperados de las bases de conocimiento del agente,
- y las propias instrucciones del agente — su alma (system prompt), tarea y cualquier skill cargada.
- Generación (salida). Todo lo que el modelo produce:
- la respuesta que lee tu cliente,
- y, cuando el agente usa una herramienta o skill, la llamada estructurada que escribe para activarla.
Para un agente fundamentado (grounded), la barra de preprocesamiento suele ser la mayor de las dos, porque el conocimiento recuperado se añade a cada pregunta.
Qué no cuesta tokens
- Recuperar y almacenar documentos. Construir y buscar en una base de conocimiento no consume tu cuota — solo el texto que el modelo realmente lee la consume.
- Entregar mensajes. Enviar y recibir a través del widget web, Telegram o WhatsApp no tiene coste en tokens.
Cómo leer tu uso
En la vista general del panel:
- Uso de tokens a lo largo del tiempo — una barra por día (u hora), dividida en preprocesamiento y generación, con un selector de rango de 24h / 7d / 30d. Úsalo para detectar un pico.
- Uso de tokens por agente — la misma división, una fila por agente, ordenadas de mayor a menor. Úsalo para ver qué agente está haciendo más trabajo.
Todo esto cuenta contra tu cuota mensual; cuando esté por agotarse, consulta Cuotas y uso.
Cómo mantener bajo el uso
- Un agente enfocado responde en menos turnos y más breves que uno que hace de todo.
- Recuperar menos fragmentos por pregunta reduce los tokens de entrada; el valor predeterminado ya está ajustado, así que auméntalo solo si a las respuestas les falta detalle.