Habilidades y cómo se eligen
Cómo un paquete de capacidades llega al modelo: la biblioteca de plataforma compartida, la recuperación por intención, las herramientas que llegan solo con el procedimiento y la solicitud de aclaración cuando la petición es ambigua.
Una habilidad es una forma de trabajar, empaquetada: una breve línea que indica cuándo se aplica, un procedimiento completo y las herramientas que dicho procedimiento necesita. La línea está en el prompt en cada turno; el procedimiento se obtiene solo una vez que se elige la habilidad. Esa separación es lo que permite a un agente disponer de muchas capacidades sin pagar por ellas en cada mensaje.
Esta página trata sobre la parte difícil: de todo lo disponible, cuál se utiliza — y qué ocurre cuando nada encaja claramente.
Dos bibliotecas, un espacio
Cada agente tiene habilidades de dos fuentes, y no es necesario que se le informe sobre la primera:
- Habilidades de la plataforma — métodos de trabajo generales (investigar a un competidor, leer una regulación, evaluar un prospecto). Disponibles para todo agente por defecto.
- Tus habilidades — las que escribes para tu propio negocio, asociadas por agente.
Se buscan juntas. Compartir el espacio no perjudica a las propias: medido en 18 habilidades genuinamente específicas de la industria mezcladas con 193 generales, las habilidades de la industria fueron reconocidas con mayor fiabilidad (86% frente a 79%). El vocabulario de la industria — códigos HS, reembolsos a la exportación, cumplimiento de la tienda — se sitúa lejos del vocabulario de los métodos generales, por lo que es más fácil seleccionarlo, no más difícil.
Recuperación, porque una lista completa deja de funcionar
Lo que el visitante acaba de decir, tal como lo dijo.
Cada habilidad se indexa por su descripción y por ejemplos de frases — las formas en lenguaje natural que alguien podría usar para solicitarla. Comparar una frase con otra frase funciona mejor que compararla con una definición.
Se muestran las quince más cercanas al modelo, cada una con algunas de esas frases de ejemplo. No toda la biblioteca: con 207 habilidades listadas en su totalidad el modelo acertó 30% de las veces; limitado a quince, 51%.
El modelo elige una — o no elige ninguna, lo cual es un resultado válido y a menudo el correcto.
Solo ahora se obtiene el procedimiento completo, y solo ahora las herramientas propias de la habilidad se vuelven disponibles.
Por debajo de aproximadamente ocho habilidades no se recupera nada — la lista completa se muestra simplemente.
Por debajo de unas ocho habilidades, nada de esto se ejecuta — la lista completa se muestra como antes. A ese tamaño la lista ya es precisa, y la recuperación solo podría añadir una nueva forma de fallar: la habilidad correcta ausente de la lista corta, el modelo respondiendo entonces desde su propio conocimiento, y nada en el registro que lo indique.
El procedimiento viene antes que las herramientas
Las herramientas propias de una habilidad no están disponibles al inicio del turno. Cargar la habilidad es lo que las pone allí.
Este orden se aplica en el código más que solicitarse en el prompt, y la razón es una medición. Se le pidió a un modelo que investigara los competidores de una empresa, con el procedimiento y las herramientas entregados juntos; el modelo llamó a la búsqueda web tres veces y nunca abrió el procedimiento. Produjo nombres de competidores desde la memoria, buscó esos nombres inventados, no encontró nada — no existían — y los escribió como respuesta. El primer paso del procedimiento, que nunca leyó, decía "primero establece qué vende realmente esta empresa".
Un procedimiento que es opcional no se lee. Las herramientas que el propio agente lleva no se ven afectadas: si web_search está en el agente, sigue disponible todo el turno. Solo las herramientas que llegan debido a una habilidad esperan a esa habilidad.
Algunas habilidades reciben su material antes de empezar
Una habilidad de investigación que empieza con el escritorio vacío tiene un solo sitio de donde sacar hechos: la memoria del propio modelo. Por eso, en las habilidades que lo declaran, la plataforma hace la primera ronda de búsqueda antes de que la habilidad se ejecute: convierte la frase del visitante en consultas, las lanza y entrega los resultados como una tabla numerada de hechos que la respuesta debe citar.
La amplitud se fija por habilidad, porque no sale gratis. Una pregunta con varias partes a la vez —cuánto cuesta, qué límites tiene, cómo saco mis datos— no se responde con dos búsquedas. Medido sobre esa misma pregunta, un barrido estrecho produjo 2.957 palabras con cinco citas, y cada precio que aparecía en ellas era una cifra concreta que no figuraba en ninguna fuente. Al ampliar el barrido para las habilidades de investigación, la misma pregunta volvió con 17 citas, y una comparativa tecnológica pasó de 5,7 a 11,7. Las habilidades que redactan, reescriben o calculan no declaran nada y no buscan nada.
Las instrucciones de esa misma habilidad ya decían, en un castellano llano, nunca indiques un precio que no esté en el material. Lo indicó igualmente. Una regla en un prompt es una petición; lo que cambió la respuesta fue darle material suficiente.
Hubo que cambiar algo más con ello. Ya existía una salvaguarda para la peor combinación: haber buscado y no haber abierto ni una página, de modo que la respuesta solo puede venir de los fragmentos. Preguntaba si había buscado el modelo. En los turnos donde la plataforma buscaba en nombre de la habilidad, el modelo no había llamado a nada, así que la salvaguarda se apartaba justo en los turnos para los que se escribió. Ahora pregunta si este turno tiene resultados de búsqueda, los haya lanzado quien los haya lanzado.
Cuando nada encaja claramente, pregunta
Algunas solicitudes genuinamente no apuntan a una habilidad. La plataforma puede detectar cuándo se encuentra en esa situación — no preguntando al modelo si se siente seguro, sino observando cuán agrupados están los puntajes de recuperación. Cuando los quince candidatos principales están separados por apenas nada, la búsqueda no tiene opinión, y responder de todos modos es una moneda al aire: en ese rango la habilidad correcta se clasifica primera solo 26% de las veces, frente a 85% cuando los puntajes se dispersan.
Así que en ese rango, y solo allí, el agente hace una pregunta primero — ofreciendo dos o tres opciones en lenguaje claro ("¿querías los precios actuales del mercado, o una valoración de esta propiedad específica?") en lugar de solicitar parámetros. En el cuarto más difícil de las solicitudes esto llevó la precisión de 36.7% a 63.3%, con un promedio de 1.5 preguntas.
Dejar que el modelo decida por sí mismo cuándo preguntar no funciona: se le pidió que usara su juicio, y preguntó en 81.5% de los turnos — incluyendo todos los que habría acertado. Condicionado en la dispersión de puntajes, pregunta en 11%, con el mismo beneficio.
Este es el mismo principio que rige el producto: una máquina puede medir qué tan ambigua es una solicitud; un modelo al que se le pregunta "¿estás seguro?" dirá que sí. Ver Decidir qué quiere un mensaje.
Lo que esto significa en la práctica
- Los agentes conocen los métodos de trabajo comunes sin ser configurados para ellos, y conocer más de ellos no cuesta nada por mensaje.
- Tus propias habilidades ganan en tu propio negocio — para eso sirve el vocabulario de la industria.
- Una habilidad sigue su procedimiento o no se ejecuta en absoluto. No puede seguirlo a medias agarrando las herramientas e improvisando.
- Las habilidades de investigación empiezan con fuentes sobre la mesa, no con una memoria. Lo que escriben debe citar ese material, y lo que el material no cubre se informa como no encontrado.
- Una solicitud ambigua recibe una pregunta, no una suposición — y la pregunta llega en la pequeña fracción de turnos donde el sistema genuinamente no puede distinguir.