運作原理

研究其沒有答案的問題

深度研究——一個問題會轉化為多個有順序的搜尋,每個聲明都附有其來源,而搜尋未能確立的事實則拒絕填補,而非憑記憶補齊。

有些問題無法從您的資料中獲得答案,因為答案尚未存在於任何人的資料中——還有誰銷售我們銷售的產品該監管機構本季度發布了什麼該供應商的報價與我們的相比如何。這需要有人去查找。

深度研究正是如此。它不是一次搜尋:它是一項小型的有序調查,在一個回合(turn)內執行,其中答案中的每一個聲明都帶有其來源——而搜尋未能確立的事項,會被拒絕回答,而非憑記憶編寫。

一個回合的外觀

1. Plan

問題被分解為有序步驟,每個步驟查找一項內容。步驟可能依賴於之前的步驟——第二步可以說*「第一步找到的類別」*。

2. Search

每個步驟變成一次真正的網頁搜尋,並獲取最有希望的結果。頁面是從實際結果中挑選的,而非回憶起來的:一個記錯一個字符的 URL 毫無意義。

3. Extract

回答該步驟的句子從獲取的頁面中提取,每個句子都與其來源頁面綁定。這是引用,而非推理——結論稍後從收集的事實中得出。

4. Report a stage

當一個步驟完成時,代理程式會說明該步驟發現了什麼,用一兩句話,在調查仍在進行時

5. Re-plan

在繼續之前,根據實際發現的內容重新考慮剩餘的步驟。原始計劃是在代理程式對該主題一無所知時制定的。

6. Answer

現在才撰寫答案,僅基於收集的事實,並在每個聲明上加上編號標記,指向其來源頁面。

重新規劃是防止錯誤的初步猜測代價高昂的步驟。

為什麼是幾個步驟而不是一次搜尋

像*「誰是我的競爭對手」*這樣的問題無法直接搜尋,原因不在於搜尋引擎能力不足。在您了解該公司實際上銷售什麼以及其交易的類別之前,無法判斷誰算作競爭對手——您能做的只是將公司名稱輸入搜尋框並碰運氣。

因此,第一步確立主體,第二步使用第一步發現的內容。第二步是必須存在的:一項僅查找主體而從未查找其所屬類別的調查,只完成了一半的表格,而要求的結論無法從這半張表格中獲得。

步驟也旨在詢問頁面明確陳述的內容,而非您想要的結論。*「X 和 Y 各自支持哪些功能」可以從功能表中回答;「X 和 Y 哪個更好」*是一種判斷,沒有頁面包含它。判斷是在最後根據事實做出的——這不是要搜尋的東西。

為什麼它在運行時報告

一項運行六輪然後產生一個長答案的調查,對於等待的人來說是一分鐘的空白螢幕,儘管結論一直在累積。因此,每個步驟在完成時報告其發現,這些階段性筆記會保留在對話中——它們是答案的一部分,而非會消失的進度裝飾。

到達不願被閱讀的頁面

如果頁面無法獲取,搜尋結果就無用武之地,而大量有用的網頁背後都有某種障礙——機器人檢查、重定向鏈、僅在瀏覽器中組裝的頁面。因此,獲取會升級:先直接請求,然後是代理請求,最後是真實瀏覽器。所有這些嘗試都失敗的頁面會被丟棄,並記錄為找到但未閱讀,這與實際閱讀過的頁面是不同的證據等級——當查看來源時,這兩者會以不同方式呈現。

沒有任何內容憑記憶回答,包括沒有人詢問的部分

這部分是值得讀兩遍的,因為這是研究助理通常安靜失敗的地方。

要求比較您的公司與一家不存在的公司,明顯的失敗不是拒絕——而是回答。調查發現了關於真實公司的許多內容,對另一家公司一無所知,然後在同一個段落中以同樣自信的語氣寫出兩半。來自來源的部分和來自模型記憶的部分對閱讀者來說無法區分。

因此在撰寫答案之前,平台按順序執行兩件事:

  1. 模型列出問題所指出的內容——必須在回答問題之前確立的具体公司、產品、監管機構或市場。僅限問題實際指出的內容:詢問*「誰是我的競爭對手」*,主體是您的公司,而競爭對手是結果,而非前提。
  2. 軟體將每一項與實際收集的事實進行檢查。 不是模型——是軟體。要求模型確認它進行了研究,是問了一個它有充分理由回答的問題。

然後:

  • 全部確立 → 普通答案。
  • 部分確立 → 撰寫答案,並在其中命名確立的部分為未確立。缺少一側的比較被報告為無法進行的比較,而非對已找到的一側的描述。
  • 均未確立 → 完全不撰寫答案。 您會被告知搜尋了什麼但一無所獲,並詢問名稱是否拼寫不同或能否指向一個網站。

同一原則貫穿整個產品:機器可以執行的檢查不交給提示詞。要求模型小心是一種願望;檢查其輸出則是一種保證。

虛構的鏈接無法通過回合檢查

剛閱讀了六頁的模型有時會寫出一個第七個 URL,那是它從未見過的 URL——它剛了解到的公司的合理地址。因此,完成答案中的每個鏈接都會與該回合實際獲取的頁面進行檢查,其他任何內容都會在發送答案之前被攔截。

隨後發生的事情不是用附加了訓斥的相同模型重新運行。告訴它虛構了某樣東西改變甚微;該回合已耗費,等待的人已為此付費。相反,該回合會升級到更強的模型,每個層級一次,直到答案返回乾淨。這是一個每代理程式的設置,因為最需要它的代理程式是在小型自託管模型上運行的代理程式,其首次嘗試成本較低。

這在實踐中的意義

  • 每個聲明都可歸因。 句子上的編號標記指向其來源頁面,您可以打開它。
  • 無法回答的問題會返回為無法回答的問題,命名缺失的內容——而非作為一個自信的段落,背後卻空無一物。
  • 訪客可以停止它。 這是可見的一分鐘工作,可中斷。
  • 深度研究是代理程式菜單上的一項功能。如果未啟用,要求它的訪客會得到普通答案——請參閱決定訊息的意圖