技能及其选择机制
能力包如何到达模型——共享平台库、按意图检索、仅随流程到达的工具,以及在请求模糊时进行反问。
技能是一种工作方式,经过封装:一行简短的文字说明其适用时机、完整的操作流程,以及该流程所需的工具。这一行文字在每一轮对话中都会出现在提示词里;而操作流程仅在选定技能后才会被获取。这种分离机制使得智能体能够承载多种能力,而无需在每条消息中为此付费。
本页关注的是难点部分:在一切可用选项中,究竟哪一个会被使用——以及当没有明显合适的选项时会发生什么。
两个库,一个空间
每个智能体都拥有来自两个来源的技能,且无需被告知第一个来源:
- 平台技能——通用的工作方法(研究竞争对手、阅读法规、评估潜在客户)。默认对所有智能体可用。
- 您的技能——您为自身业务编写的技能,按智能体附加。
它们被一起搜索。共享空间并不会使您自己的技能处于劣势:在将 18 个真正具有行业特定性的技能混合到 193 个通用技能中的测量中,行业技能被更可靠地识别(86% 对比 79%)。行业词汇——HS 编码、出口退税、商店合规性——与通用方法词汇相距甚远,因此更容易被挑选出来,而不是更难。
检索,因为完整列表无法运作
访客刚刚所说的内容,即他们所说的原话。
每个技能都通过其描述和示例短语进行索引——即人们可能用来请求它的自然语言方式。将一句话与另一句话进行匹配,比将其与定义进行匹配效果更好。
最接近的十五个技能会显示给模型,每个技能附带几个示例短语。不是整个库:当完整列出 207 个技能时,模型正确选择的概率仅为 30%;短名单缩减至十五个时,概率为 51%。
模型选择一个——或者选择不选,这是一个有效的结果,且通常是正确的结果。
现在才获取完整流程,现在技能自身的工具才变得可用。
大约八个技能以下不执行检索——整个列表直接显示。
大约八个技能以下,这些操作均不执行——完整列表如前所示。在这个规模下,列表已经准确,而检索只会增加一种新的失败方式:正确技能未包含在短名单中,模型随后基于其自身知识作答,且日志中没有任何说明。
流程优先于工具
技能自身的工具在轮次开始时不可用。加载技能才会将它们置于可用状态。
这种顺序在代码中强制执行,而非在提示词中请求,其原因是一项测量结果。当要求研究一家公司的竞争对手,并将流程和工具一起提供时,模型调用了网络搜索三次,但从未打开流程。它从记忆中生成竞争对手名称,搜索这些虚构的名称,未找到任何结果——它们不存在——并将它们作为答案写出。流程的第一步它从未阅读,其中写道*"首先确定该公司实际销售什么"*。
可选的流程不会被阅读。 智能体自身携带的工具不受影响:如果 web_search 在智能体上,它在整个轮次中保持可用。仅因技能而到达的工具才等待该技能。
有些技能在开工前就拿到了材料
一个从空桌子开始的调研技能,只有一个地方可以取事实:模型自己的记忆。所以对于声明了这一点的技能,平台会在技能运行之前先做第一轮查找——把访客那句话变成检索式、跑一遍,再把结果作为一张编号的事实表交给它,答案要照着这张表标出处。
宽度按技能定,因为它不是免费的。一个同时问了好几件事的问题——怎么收费、有什么限制、我的数据怎么导出——两条检索式答不了。就用这个问题实测:窄的那一版写了 2957 字、只挂 5 条出处,里面每一个价格都是一个在任何来源里都找不到的具体数字。把调研型技能的检索宽度调开之后,同一个问题带回 17 条出处,一次技术对比从 5.7 条升到 11.7 条。起草、改写、算账的技能什么都不声明,也就什么都不搜。
同一个技能的指南里,本来就用大白话写着绝不写出材料里没有的价格。它照写不误。提示词里的规则只是请求;真正改变了答案的,是给足材料。
还有一件事得跟着改。平台早有一道守卫盯着最坏的那种组合——搜了,却一页正文都没打开,于是答案只能来自摘要。它问的是模型有没有搜过。而在平台替技能去搜的那些轮次里,模型一个工具都没调,这道守卫恰恰在它最该开的那一轮站到了一边。现在它问的是这一轮到底有没有搜索结果,不管是谁去搜的。
当没有明显合适的选项时,它会提问
某些请求确实不指向单一技能。平台可以判断其是否处于这种情况——不是通过询问模型是否确定,而是通过查看检索分数的聚集程度。当顶部十五个候选项之间的差距微乎其微时,搜索没有意见,强行回答无异于掷硬币:在该区间内,正确技能排名第一的概率仅为 26%,而当分数分散时,这一概率为 85%。
因此,在该区间内,且仅在该区间内,智能体先提出一个问题——提供两三个自然选项(“您想要当前市场价格,还是对这项特定财产进行估值?”),而不是请求参数。在最困难的 25% 的请求中,这使得准确率从 36.7% 提高到 63.3%,平均需要 1.5 个问题。
让模型自行决定何时提问不起作用:当要求其运用判断力时,它在 81.5% 的轮次中提问——包括那些它本可以答对的轮次。基于分数分散程度进行限制,它仅在 11% 的轮次中提问,却获得了相同的好处。
这与贯穿产品的原则相同:机器可以衡量请求的模糊程度;被问“你确定吗?”的模型会说确定。参见 决定消息的意图。
实践中的意义
- 智能体无需配置即可了解常见工作方法,且了解更多方法不会在每条消息中产生额外成本。
- 您的技能在您的业务上胜出——这正是行业词汇的用途。
- 技能要么遵循其流程,要么完全不运行。 它不能通过获取工具并即兴发挥来半遵循流程。
- 调研型技能开工时桌上就有来源,而不是只有记忆。 它写的东西要照着那些材料标出处,材料没覆盖到的,就如实说没查到。
- 模糊的请求会得到一个问题,而不是猜测——且该问题仅出现在系统确实无法判断的少数轮次中。