研究其没有的答案
深度研究——一个问题转化为多个有序搜索,每个声明都附带其来源,任何搜索未证实的内容均拒绝填充,而非从记忆中补充。
有些问题无法从你的资料中回答,因为答案尚未出现在任何人的资料中——谁还销售我们销售的产品,监管机构本季度发布了什么,某供应商的报价与我们的相比如何。这需要有人去查找。
深度研究正是为此而生。它不仅仅是一次搜索:它是在一个回合内运行的小型有序调查,答案中的每一项声明都附带其来源——而任何搜索未能证实的内容都会被拒绝,而非凭记忆编写。
一个回合的样子
问题被分解为有序步骤,每个步骤查找一项内容。步骤可能依赖于前面的步骤——第二步可以说*“第一步找到的类别”*。
每个步骤都变成一次真实的网络搜索,并获取最有希望的结果。页面是从实际结果中选择的,而不是靠回忆:一个记错的 URL,哪怕只差一个字符,也毫无意义。
回答该步骤的句子从获取的页面中提取,每个句子都与其来源页面相关联。这是引用,而非推理——结论来自收集的事实,稍后得出。
当一个步骤完成时,智能体会说出该步骤的发现,用一两句话描述,而调查仍在进行中。
在继续之前,根据实际发现的内容重新考虑剩余步骤。原始计划是在智能体对主题一无所知时编写的。
现在才根据收集的事实(且仅凭这些事实)编写答案,每个声明都带有编号标记,指向其来源页面。
重新规划是防止错误的首次猜测导致整个调查成本高昂的步骤。
为什么是分几步而不是单次搜索
像*“我的竞争对手是谁”*这样的问题不能直接搜索,原因不在于搜索引擎能力不足。在你了解这家公司实际销售什么以及它属于哪个类别之前,无法判断谁算作竞争对手——你能做的最好的事情就是把公司名称输入搜索框并碰运气。
因此,第一步确立主题,第二步使用第一步找到的内容。第二步是必须存在的:一项只查找主题而从不查找其所属类别的调查,只完成了一半的表格,而所要求的结论无法从这半张表格中获得。
步骤也被编写为询问页面明确陈述的内容,而非你想要的结论。*“X 和 Y 各自支持哪些功能”可以从功能表中回答;“X 和 Y 哪个更好”*是一种判断,没有页面包含它。判断是在最后根据事实做出的——这不是要搜索的东西。
为什么它在运行时报告
一项运行六个回合然后产生一个长答案的调查,对于等待的人来说是一分钟的空白屏幕,尽管结论一直在积累。因此,每个步骤在完成后报告其发现,这些阶段性笔记在事后保留在对话中——它们是答案的一部分,而不是消失的进度装饰。
访问不愿被阅读的页面
如果页面无法获取,搜索结果就毫无用处,而大量有用的网络内容背后都有某种障碍——机器人检查、重定向链、仅在浏览器中组装的页面。因此,获取过程会升级:首先是直接请求,然后是代理请求,最后是真实浏览器。所有这些都失败的页面会被丢弃,并记录为找到但未读取,这与实际读取的页面是不同的证据等级——在查看来源时,这两者会以不同的方式呈现。
没有任何内容凭记忆回答,包括那些无人询问的部分
这是值得读两遍的部分,因为这是研究助理通常无声失败的地方。
要求比较你的公司与一家不存在公司的情况,明显的失败不是拒绝——而是回答。调查找到了关于真实公司的很多信息,关于另一家公司没有找到任何信息,然后在同一段落中以相同的自信语气编写了两半内容。来自来源的部分和来自模型记忆的部分对于阅读者来说是无法区分的。
因此在编写答案之前,平台按顺序执行两件事:
- 模型列出问题所命名的内容——在回答问题之前必须确立的具体公司、产品、法规或市场。仅问题实际命名的内容:询问*“我的竞争对手是谁”*,主题是你的公司,而竞争对手是结果,而非前提。
- 软件将每一项与实际上收集的事实进行核对。 不是模型——是软件。要求模型确认它进行了研究是问了一个它有充分理由回答是的问题。
然后:
- 全部确立 → 普通答案。
- 部分确立 → 编写答案,并明确指出未确立的部分。缺少一边的比较被报告为无法进行的比较,而非对已找到的一边的描述。
- 全部未确立 → 根本不编写答案。 你会被告知搜索了什么但什么都没找到,并询问名称是否拼写不同或你能否指向一个网站。
同一原则贯穿整个产品:机器可以执行的检查不留给提示。要求模型小心是一种愿望;检查其输出是一种保证。
编造的链接无法通过回合
刚刚阅读了六个页面的模型有时会写出第七个 URL,这是它从未见过的 URL——它刚刚了解到的公司的合理地址。因此,完成答案中的每个链接都会与回合实际获取的页面进行核对,其他任何内容都会在发送答案之前被捕获。
接下来发生的事不是用附加了训斥的相同模型重新运行。被告知它编造了某样东西改变很少;该回合已花费,等待的人已为此付费。相反,该回合升级到更强的模型,每个层级一次,直到答案返回干净。这是一个每个智能体的设置,因为最需要它的智能体是在小型自托管模型上运行的智能体,其中首次尝试成本较低。
在实际中的意义
- 每个声明都可追溯。 句子上的编号标记指向其来源页面,你可以打开它。
- 它无法回答的问题返回为它无法回答的问题,命名缺失的内容——而不是作为没有任何依据的自信段落。
- 访客可以停止它。 这是一分钟的工作,可见且可中断。
- 深度研究是智能体菜单上的一个功能。如果未启用,要求它的访客会得到普通答案——参见决定消息的意图。