仕組み

回答がないものを調査する

ディープリサーチ — 1つの質問が複数の順序立てられた検索に分解され、すべての主張にはその出典が明記され、検索で確立されていないことは記憶から補完せず、拒否されます。

いくつかの質問は、誰の資料にも答えが含まれていないため、回答することができません。具体的には、我々と同様の製品を販売している他社この規制当局は今四半期に何を公表したかこのサプライヤーのオファーは ours と比較してどうか といったものです。これらには、実際に調査して見つけ出す人が必要です。

ディープリサーチ(Deep research)とはそれです。それは単なる1回の検索ではなく、ターン内で実行される小さな順序立てられた調査であり、回答内のすべての主張はそれが出典となったソースを伴い、検索によって確立できなかったことは、記憶から書き出すのではなく、拒否されます。

1つのターン(turn)の構成

1. Plan

質問は順序立てられたステップに分解され、各ステップで1つのことを調べます。ステップは前のステップに依存することがあります — 2つ目のステップは「1つ目のステップで見つかったカテゴリ」と言うことが許可されています。

2. Search

各ステップは実際のウェブ検索になり、最も有望な結果がフェッチされます。ページは記憶ではなく実際の結果から選択されます。1文字間違っただけの記憶されたURLは、何の意味も持ちません。

3. Extract

ステップに答える文は、フェッチされたページから抽出され、それぞれが出典となったページに紐付けられます。これは推論ではなく引用であり、結論は後から、収集された事実に基づいて導かれます。

4. Report a stage

ステップが完了すると、エージェントは調査がまだ進行中である間に、そのステップで何が見つかったかを1〜2文で報告します。

5. Re-plan

続ける前に、実際に何が見つかったかに対して、残りのステップが再検討されます。元の計画は、エージェントがその主題について何も知らなかったときに書かれたものです。

6. Answer

ここで初めて、収集された事実とそれ以外から答えが書かれ、各主張にはそれが出典となったページを示す番号付きマーカーが付きます。

再計画は、最初の誤った推測が全体の調査のコストになるのを防ぐステップです。

なぜ1回の検索ではなく複数のステップなのか

「誰が私の競合他社か」といった質問は直接検索できず、その理由は検索エンジンが弱いからではありません。この会社が実際に何を販売し、どのカテゴリで取引しているかを知るまで、誰が競合他社と見なされるかを判断する方法はありません。最善の策は、会社名を検索ボックスに入れて運を待つことです。

したがって、最初のステップで主題を確立し、2つ目のステップで1つ目のステップで見つかったものを使用します。この2つ目のステップが存在する必要があります:主題だけを調べ、それが属するカテゴリを全く調べない調査は、表の半分しか埋めておらず、求められた結論はその半分からは得られません。

ステップは、あなたが求める結論ではなく、ページが明確に述べていることを尋ねるように書かれています。「XとYはそれぞれどのような機能をサポートしているか」は機能表から回答可能ですが、「XとYのどちらが優れているか」は判断であり、どのページにもその答えは含まれていません。判断は、事実から最後に下されます — それは検索すべきものではありません。

なぜ動作中に報告するのか

6ラウンド実行してから1つの長い答えを生成する調査は、結論がずっと蓄積されていたとしても、待っている人にとって1分間の真っ白な画面になります。そのため、各ステップは完了した時点で何が見つかったかを報告し、それらの段階的なノートは会話の後に残ります — これらは答えの一部であり、消えていく進行状況の装飾ではありません。

読みたくないページに到達する

ページがフェッチできない場合、検索結果は無用です。有用なウェブの大部分は何らかの障壁の向こうにあります — ボットチェック、リダイレクトチェーン、ブラウザ内でのみ自身を組み立てるページなど。したがって、フェッチはエスカレーションします:まず直接リクエスト、次にプロキシ経由、そして実際のブラウザ。これらすべてで失敗したページはドロップされ、「見つかったが読まれていない」として記録されます。これは実際に読まれたページとは異なる証拠の等級であり、ソースを見るとこれらは異なる方法で描画されます。

記憶から何も回答しない、聞かれていない部分も含めて

これは二度読む価値がある部分です。なぜなら、ここで研究アシスタントは通常、静かに失敗するからです。

存在しない会社との比較を依頼すると、明らかな失敗は拒否ではなく、答えです。調査は実際の会社については多くの情報を見つけ、もう一方については何も見つかりません。そして、両方の半分を同じ段落で、同じ自信に満ちた口調で書き出します。ソースから来た半分とモデルの記憶から来た半分は、読む人にとって区別がつきません。

したがって、答えが書かれる前に、プラットフォームは以下の2つのことを順次行います。

  1. モデルが質問が名指ししているものをリストする — 質問に答えるために確立しなければならない、特定の会社、製品、規制、または市場。質問が実際に名指ししたもののみ:「誰が私の競合他社か」と尋ねられた場合、主題はあなたの会社であり、競合他社は結果であり、前提ではありません。
  2. ソフトウェアがそれぞれを実際に収集された事実と照合する。モデルではなく、ソフトウェアです。モデルに調査を行ったことを確認するよう求めることは、モデルに「はい」と答える理由が十分にある質問を投げかけることです。

その後:

  • すべてが確立された場合 → 通常の答え。
  • 一部が確立された場合 → 答えが書かれ、確立されなかった部分は、確立されなかったものとして明記されます。片側が欠けている比較は、見つかった側の説明ではなく、行えない比較として報告されます。
  • 何も確立されなかった場合 → 答えは書かれません。 何を検索して何も見つかったかを伝え、名前が異なる綴りであるか、またはサイトを指し示せるか尋ねられます。

同じ原則が製品全体に通じています:機械が実行できるチェックはプロンプトに任されません。モデルに注意深くするように求めるのは願いですが、その出力をチェックすることは保証です。

捏造されたリンクはターン中に生き残らない

6つのページを直前に読んだモデルは、時には7つ目のURLを書くことがあります — それは、直前に学んだ会社の妥当なアドレスです。完成した答え内のすべてのリンクは、そのターンで実際にフェッチされたページと照合され、それ以外は答えが送信される前に捕捉されます。

その後起こるのは、叱責を添えた同じモデルの再実行ではありません。何かを捏造したと告げられても、ほとんど変化しません;そのターンは消費され、待っている人はそれに対して支払っています。代わりに、そのターンはより強力なモデルにエスカレーションされ、回答がクリーンになるまで、各ティアで1回ずつ実行されます。これはエージェントごとの設定です。なぜなら、最もそれを必要とするのは、最初の試行が安価な小さな自己ホスト型モデル上で実行されているエージェントだからです。

実務においてこれが何を意味するか

  • すべての主張は帰属可能である。 文の番号付きマーカーは、それが出典となったページを指し示しており、開くことができます。
  • 答えられない質問は、答えられない質問として返ってくる — 背後のない自信に満ちた段落ではなく、何が欠けていたかを明記して。
  • 訪問者がそれを停止できる。 1分間の作業であり、進行中に表示され、中断可能です。
  • ディープリサーチはエージェントのメニューにある機能です。有効化されていない場合、それを求める訪問者は通常の答えを受け取ります — メッセージが何を求めているかの判断 を参照。