작동 원리

해당 정보가 없는 답변을 조사함

심층 조사 — 하나의 질문이 여러 개의 순서화된 검색으로 변환되며, 모든 주장은 그 출처를 함께 제시하고, 검색으로 입증되지 않은 내용은 기억으로 채우지 않고 거부합니다.

일부 질문은 정답이 그 누구의 자료에도 포함되어 있지 않기 때문에 답변할 수 없습니다. 우리가 판매하는 것과 동일한 제품을 판매하는 타사는 누구인가, 이 규제 기관은 이번 분기에 무엇을 발표했는가, 이 공급업체의 제안은 우리 것과 어떻게 비교되는가와 같은 질문들입니다. 이러한 질문에는 누군가가 직접 찾아 나서야 합니다.

딥 리서치(Deep research)가 바로 그 역할을 합니다. 이는 단순한 검색 한 번이 아니라, 턴(turn) 내에서 실행되는 작은 순차적 조사입니다. 답변의 모든 주장은 그 출처를 명시하며, 검색으로 입증되지 않은 내용은 기억으로 작성하는 대신 거부됩니다.

턴의 구조

1. Plan

질문은 순차적인 단계로 분해되며, 각 단계는 하나의 항목을 조회합니다. 단계는 이전 단계에 의존할 수 있습니다. 두 번째 단계는 *"첫 번째 단계에서 발견된 카테고리"*라고 명시하는 것이 허용됩니다.

2. Search

각 단계는 실제 웹 검색으로 변환되며, 가장 유망한 결과가 가져옵니다. 페이지는 기억된 URL이 아닌 실제 결과에서 선택됩니다. 기억된 URL이 한 글자라도 틀리면 아무런 의미가 없습니다.

3. Extract

단계에 대한 답변이 되는 문장은 가져온 페이지에서 추출되며, 각 문장은 그 출처가 된 페이지와 연결됩니다. 이는 추론이 아닌 인용이며, 결론은 나중에 수집된 사실로부터 도출됩니다.

4. Report a stage

단계가 완료되면, 에이전트는 조사가 아직 진행 중일 때 그 단계에서 발견한 내용을 한두 문장으로 보고합니다.

5. Re-plan

계속하기 전에, 실제로 발견된 내용을 바탕으로 나머지 단계를 재검토합니다. 원래의 계획은 에이전트가 주제에 대해 아무것도 알지 못했을 때 작성되었습니다.

6. Answer

이제야 수집된 사실과 그 외의 아무것도 없이 답변이 작성되며, 각 주장에는 그 출처가 된 페이지를 가리키는 번호 표시가 붙습니다.

재계획은 잘못된 첫 추측이 전체 조사 비용을 낭비하는 것을 방지하는 단계입니다.

왜 하나의 검색이 아닌 여러 단계인가

*"내 경쟁사는 누구인가"*와 같은 질문은 직접 검색할 수 없으며, 그 이유는 검색 엔진이 약해서가 아닙니다. 이 회사가 실제로 무엇을 판매하는지, 그리고 어떤 카테고리로 거래하는지 알기 전까지는 누가 경쟁자로 간주되는지 판단할 방법이 없습니다. 최선의 방법은 회사 이름을 검색창에 넣고 운을 맡기는 것뿐입니다.

따라서 첫 번째 단계는 주제를 확립하고, 두 번째 단계는 첫 번째 단계에서 발견한 내용을 사용합니다. 두 번째 단계는 반드시 존재해야 합니다. 주제만 조회하고 그것이 속한 카테고리는 조회하지 않는 조사는 테이블의 절반만 작성한 것과 같으며, 요청된 결론은 그 절반에서 얻을 수 없습니다.

단계는 원하는 결론이 아닌, 페이지가 명시적으로 밝히는 내용을 묻도록 작성됩니다. *"X와 Y는 각각 어떤 기능을 지원하는가"*는 기능 표에서 답변할 수 있지만, *"X와 Y 중 어느 것이 더 나은가"*는 판단이며, 어떤 페이지에도 그것이 포함되어 있지 않습니다. 판단은 사실들을 바탕으로 최종적으로 내리며, 검색 대상이 아닙니다.

작업 중 보고하는 이유

6번의 라운드를 거친 후 하나의 긴 답변을 생성하는 조사는 결론이 계속 쌓이고 있음에도 불구하고 기다리는 사람에게 빈 화면의 1분간을 강요합니다. 따라서 각 단계는 완료되는 대로 발견한 내용을 보고하며, 이러한 단계별 메모는 이후 대화에도 남아 있습니다.它们是 답변의 일부이며, 사라지는 진행 상태 표시(chrome)가 아닙니다.

읽히기를 원하지 않는 페이지에 도달하기

페이지를 가져올 수 없으면 검색 결과는 무용지물이며, 유용한 웹의 상당 부분은 무엇인가 뒤에 숨겨져 있습니다. 봇 검사, 리디렉션 체인, 브라우저에서만 자체적으로 조립되는 페이지 등이 그 예입니다. 따라서 가져오기 과정은 단계별로 격상됩니다. 직접 요청을 먼저 시도한 후, 프록시 요청을 시도하고, 마지막으로 실제 브라우저를 사용합니다. 모든 방법을 시도해도 실패한 페이지는 *찾았으나 읽지 못함(found but not read)*으로 기록되어 삭제되며, 이는 실제로 읽힌 페이지와는 다른 등급의 증거입니다. 두 경우의 출처는 시각적으로 다르게 표시됩니다.

기억에서 답변하지 않습니다. 묻지 않은 부분도 포함하여

이 부분은 두 번 읽을 가치가 있습니다. 이는 연구 보조원들이 조용히 실패하는 지점이기 때문입니다.

존재하지 않는 회사와貴社를 비교해 달라고 요청하면, 명백한 실패는 거부가 아닙니다. 그것은 답변입니다. 조사는 실제 회사에 대해서는 많은 것을 발견하지만, 다른 회사에 대해서는 아무것도 발견하지 못합니다. 그런 다음 모델의 기억에서 비롯된 절반과 소스에서 비롯된 절반을 동일한 문단에서 동일한 자신감 있는 어조로 작성합니다. 읽는 사람에게는 소스에서 비롯된 부분과 모델의 기억에서 비롯된 부분이 구별되지 않습니다.

따라서 답변이 작성되기 전에 플랫폼은 순차적으로 두 가지 작업을 수행합니다.

  1. 모델이 질문이 지칭하는 항목을 나열합니다. — 질문에 답변하기 전에 확립해야 하는 특정 회사, 제품, 규제 또는 시장들입니다. 질문이 실제로 지칭하는 것만 해당됩니다. *"내 경쟁사는 누구인가"*라고 물었을 때, 주제는 귀사이며 경쟁사는 결과지 전제가 아닙니다.
  2. 소프트웨어가 각 항목을 실제로 수집된 사실과 대조합니다. 모델이 아닙니다. 모델에게 연구 수행 여부를 확인하라고 묻는 것은, 모델이 라고 답할 이유가 충분한 질문을 하는 것과 같습니다.

그 후:

  • 모두 확립됨 → 일반적인 답변.
  • 일부만 확립됨 → 답변이 작성되며, 확립되지 않은 부분은 확립되지 않았다고 명시됩니다. 한쪽이 누락된 비교는 발견된 쪽의 설명이 아니라, 수행할 수 없는 비교로 보고됩니다.
  • 하나도 확립되지 않음 → 아무런 답변도 작성되지 않습니다. 무엇을 검색했고 아무것도 찾지 못했는지 알려주며, 철자가 다른지 아니면 사이트를 가리킬 수 있는지 묻습니다.

동일한 원칙이 제품 전반에 적용됩니다. 기계가 수행할 수 있는 검사는 프롬프트에 맡기지 않습니다. 모델에게 신중하라고 요청하는 것은 소망일 뿐이지만, 출력을 확인하는 것은 보장입니다.

턴 동안 발명된 링크는 생존하지 못합니다

방금 여섯 페이지를 읽은 모델은 방금 알게 된 회사의 합리적인 주소인 일곱 번째 URL을 작성할 때가 있습니다. 따라서 완성된 답변의 모든 링크는 턴이 실제로 가져온 페이지와 대조되어 확인되며, 그 외의 것은 답변이 전송되기 전에 잡힙니다.

그 후의 처리는 동일한 모델을 꾸짖는 메시지와 함께 다시 실행하는 것이 아닙니다. 무언가를 발명했다고 알려주는 것은 거의 변화가 없습니다. 해당 턴은 소모되었으며, 기다리던 사람은 그 비용을 지불했습니다. 대신 턴은 더 강력한 모델로 격상되며, 답변이 깨끗하게 돌아올 때까지 계층당 한 번씩 시도합니다. 이는 에이전트별 설정입니다. 가장 필요한 에이전트는 첫 시도가 저렴한 작은 자체 호스팅 모델에서 실행되는 에이전트이기 때문입니다.

이것이 실무에서 의미하는 바

  • 모든 주장은 출처가 명시됩니다. 문장 번호 표시는 그 출처가 된 페이지를 가리키며, 해당 페이지를 열 수 있습니다.
  • 답변할 수 없는 질문은 답변할 수 없는 질문으로 돌아옵니다. 뒷받침이 없는 자신감 있는 문단 대신, 누락된 항목을 명시합니다.
  • 방문자가 중단할 수 있습니다. 작업 중 보이는 1분간의 작업이며, 중단 가능합니다.
  • 딥 리서치는 에이전트 메뉴의 기능입니다. 활성화되어 있지 않으면, 이를 요청하는 방문자에게는 일반적인 답변이 제공됩니다. — 메시지가 원하는 것 결정하기 참조.