Guía del inquilino

Uso de tokens — qué cuenta

Qué significan realmente las barras de "preprocesamiento" y "generación" en tu gráfico de uso, qué consume tokens y qué no, y cómo leer el uso a lo largo del tiempo y por agente.

Tu panel muestra el uso de tokens en dos colores — preprocesamiento y generación. A continuación se explica qué es cada uno y qué te cuesta tokens y qué no.

Los dos tipos de tokens

Un modelo de lenguaje grande cobra por el texto que lee y el texto que escribe, medido en tokens (aproximadamente ¾ de palabra cada uno). agent4.io divide tu uso de la misma manera:

  • Preprocesamiento (entrada). Todo lo que se entrega al modelo para que pueda responder:
    • el mensaje de la persona,
    • el historial reciente de la conversación,
    • los fragmentos relevantes recuperados de las bases de conocimiento del agente,
    • y las propias instrucciones del agente — su alma (system prompt), tarea y cualquier skill cargada.
  • Generación (salida). Todo lo que el modelo produce:
    • la respuesta que lee tu cliente,
    • y, cuando el agente usa una herramienta o skill, la llamada estructurada que escribe para activarla.

Para un agente fundamentado (grounded), la barra de preprocesamiento suele ser la mayor de las dos, porque el conocimiento recuperado se añade a cada pregunta.

Qué no cuesta tokens

  • Recuperar y almacenar documentos. Construir y buscar en una base de conocimiento no consume tu cuota — solo el texto que el modelo realmente lee la consume.
  • Entregar mensajes. Enviar y recibir a través del widget web, Telegram o WhatsApp no tiene coste en tokens.

Cómo leer tu uso

En la vista general del panel:

  • Uso de tokens a lo largo del tiempo — una barra por día (u hora), dividida en preprocesamiento y generación, con un selector de rango de 24h / 7d / 30d. Úsalo para detectar un pico.
  • Uso de tokens por agente — la misma división, una fila por agente, ordenadas de mayor a menor. Úsalo para ver qué agente está haciendo más trabajo.

Todo esto cuenta contra tu cuota mensual; cuando esté por agotarse, consulta Cuotas y uso.

Cómo mantener bajo el uso

  • Un agente enfocado responde en menos turnos y más breves que uno que hace de todo.
  • Recuperar menos fragmentos por pregunta reduce los tokens de entrada; el valor predeterminado ya está ajustado, así que auméntalo solo si a las respuestas les falta detalle.