핵심 개념

AI 에이전트를 위한 지식 베이스 구축 방법

에이전트가 알아야 할 것의 대부분은 이미 어딘가에 적혀 있습니다 — 당신의 웹사이트에, 그리고 당신 팀이 이미 고객에게 보내는 PDF에. URL에서 가져오기는 공개된 절반을 다루고, 업로드가 나머지를 다룹니다.

이렇게도 부릅니다웹사이트 가져오기웹사이트 크롤링사이트 임포트문서 업로드일괄 업로드zip 업로드지식 베이스 시딩

파일럿이 멈추는 가장 흔한 이유는 모델이 아닙니다. 누군가 앉아 "지식 베이스를 준비"해야 하는데 — 그 일에는 결코 주인이 없어서 결코 시작되지 않는다는 것입니다.

build knowledge
yoursite.comimport URLpolicy.pdfuploadKnowledge base
Import your site from a URL and upload your PDFs — both become searchable knowledge.

그리고 그것은 불필요하기도 합니다. 자료는 거의 항상 이미 존재합니다. 당신의 웹사이트에 있고, 당신 팀이 매주 고객에게 이메일로 보내는 몇 개의 PDF에 있습니다. 일은 그것을 쓰는 것이 아닙니다. 일은 그것을 안으로 들이는 것입니다.

두 가지 자료를 위한 두 가지 경로

당신의 웹사이트 — URL에서 가져오기. 플랫폼을 당신의 사이트로 향하게 하면 공개 페이지를 읽어 각각을 문서로 만듭니다. 이것은 당신이 고객을 위해 이미 써 둔 자료를 다룹니다: 서비스 설명, 가격 페이지, FAQ, 정책 설명, 사람들이 실제로 묻는 질문에 답하는 블로그 글.

그 밖의 모든 것 — 파일 업로드. 요율표, 제품 매뉴얼, 팀이 무엇을 약속할 수 있고 없는지를 설명하는 내부 한 장짜리 문서. 로그인 뒤에 있는 무엇이든, PDF로만 존재하는 무엇이든, 어떤 페이지도 소리 내어 말하지 않는 무엇이든.

이것들을 하나씩 업로드할 필요는 없습니다. 폴더를 압축해 그것을 업로드하세요: 임포터가 하위 디렉터리를 훑어 발견한 모든 .md, .txt, .pdf, .html, .docx를 들여오고, 이미지, .DS_Store, 압축 도구가 더하는 다른 잡동사니는 건너뜁니다. 각 파일은 아카이브 내부 경로로 이름 붙은 자기만의 문서가 됩니다 — 그래서 policies/2026/rates.pdfpolicies/2025/rates.pdf가 둘 다 "rates.pdf"로 나타나는 대신 구별된 채로 남습니다.

파싱에 실패하는 파일 — 암호화된 PDF, 손상된 문서 — 은 건너뛰어지고 보고됩니다. 그것이 나머지 서른아홉 개를 가라앉히지 않습니다.

이 구분은 임의적이지 않습니다. 웹사이트 가져오기는 빠르고 넓지만 얕습니다 — 방문자가 보는 것만 볼 수 있습니다. 업로드는 당신의 에이전트를 당신 사이트를 가리키는 검색 엔진과 다르게 만드는 자료가 사는 곳입니다.

가져오기가 할 수 없는 것

그것을 중심으로 계획하기 전에 알아 둘 가치가 있습니다.

JavaScript로 내용을 구성하는 페이지는 비어서 돌아옵니다 — 임포터는 HTML을 가져올 뿐, 브라우저를 실행하지 않습니다. 로그인 뒤에 있는 무엇이든 손이 닿지 않습니다. 사이트에서 링크된 PDF는 건너뛰어집니다; 그것들은 업로드 경로로 갑니다(개별로, 또는 일괄로 압축해서). 그것은 robots.txt를 존중합니다. 그리고 그것은 일회성 가져오기이지 구독이 아닙니다: 당신의 사이트가 바뀔 때 지식 베이스는 그것과 함께 바뀌지 않습니다. 새로 고치려면 가져오기를 다시 실행하세요.

페이지를 읽는 데는 비용이 들지 않습니다. 무엇이든 추가되기 전에 페이지와 문자의 정확한 수, 그리고 추정 토큰 비용을 봅니다 — 그리고 당신이 그렇게 말하기 전까지는 아무것도 추가되지 않습니다.

당신의 사이트가 일반적인 서버 렌더링 사이트라면 — WordPress, Webflow, Squarespace, 대부분의 CMS로 만든 마케팅 사이트 — 가져오기가 그것을 읽습니다. 모든 것을 클라이언트 측에서 렌더링하는 단일 페이지 앱이 실패하는 경우이며, 그것은 빈 페이지를 조용히 가져오는 대신 요란하게 실패합니다.

실제 예시

이중 언어 사이트와 요율표로 가득 찬 공유 드라이브를 가진 주택담보대출 중개업소.

사이트를 가져오기, 영어만. 그들은 임포터를 홈페이지로 향하게 하고 경로 접두사를 /en/으로 설정합니다. 그것 없이는, 페이지 예산이 세 언어로 된 같은 여덟 개 글에 쓰입니다 — 같은 콘텐츠, 세 배의 비용, 그리고 검색 시점의 거의 중복된 히트. 가져오기는 사이트맵을 통해 여덟 페이지를 찾습니다: 긴 가이드 네 개, 리소스 색인, 팀 및 소개 페이지, 그리고 연락처. 약 45,000자. 그들이 확인하면, 1분 뒤 지식 베이스에 여덟 개 문서가 생깁니다.

이 시점에서 에이전트는 이미 "의사 대출을 취급하나요?"와 "가상 클로징은 어떻게 작동하나요?"에 답할 수 있습니다 — 그 글들이 몇 년 전에 쓰여 블로그에 앉아 있었기 때문입니다.

사이트가 결코 말하지 않는 네 가지 업로드. 현재 요율표. 자영업 신청자를 위한 서류 체크리스트. 대출 담당자가 채팅으로 약속해서는 안 되는 것에 관한 한 장짜리 문서. 주 공시의 스캔본. 이것들 중 어느 것도 웹사이트에 없습니다; 그중 둘은 있어서도 안 됩니다. 이미 하나의 공유 폴더에 앉아 있었으므로, 네 번의 업로드가 아니라 단일 zip으로 올라갔습니다.

사실이 아니라 경계를 쓰세요. 지식 베이스 지침에: 이것이 우리의 현재 정책이며 일반 업계 관행에 우선한다; 요율은 항상 유효 일자와 함께 제시되어야 한다; 특정 신청에 관한 무엇이든 사람에게 넘겨야 한다. 사실은 문서에 삽니다. 지침은 그것을 어떻게 다룰지 말합니다.

총 소요 시간: 한 오후, 그중 대부분은 어떤 내부 문서가 포함하기에 안전한지를 결정하는 데 쓰였습니다 — 그것이 실제로 사람의 판단이 필요한 부분입니다.

일이 정말로 있는 곳

예시가 포함하지 않은 것을 주목하세요: 새 콘텐츠 쓰기, 무언가 서식 맞추기, 태깅, 분류 체계 구축. 검색 층은 그것들을 필요로 하지 않습니다.

그것이 포함한 것은 어떤 도구도 대신할 수 없는 두 가지 결정이었습니다. 어떤 내부 자료가 고객이 에이전트를 통해 닿기에 안전한가. 그리고 에이전트가 무엇을 약속하도록 허용되지 않는가. 가져오기가 아니라 그 두 가지에 당신의 시간을 예산으로 잡으세요.

첫 지식 베이스 설정하기 →

동작 원리가 궁금하신가요?검색이 무엇을 근거로 답할지 결정하는 방식
실제로 가동하기
구조화된 인덱스

구조화된 인덱스는 에이전트가 문서에 이미 포함된 필드(제목, 가격, 레벨, 링크, 이미지)와 의미 기반 검색을 위해 사용하는 벡터 검색을 함께 활용하여 구축한 작은 테이블입니다. 벡터 검색은 질문과 유사하게 읽히는 구문을 찾아내지만, 카운팅하거나 숫자로 필터링하거나 그룹화할 수는 없습니다. 구조화된 인덱스는 이러한 작업을 처리하며, 에이전트가 단편에서 재구성하는 대신 링크나 식별자를 정확하게 인용할 수 있게 합니다.

스토리라인(Storyline)

스토리라인은 에이전트가 각 최종 사용자와 함께 따라가는 방향 그래프입니다 — 모든 노드는 하나의 단계(고유한 태스크, 지식, 도구)이고, 출구는 조건을 지니며, 각 사람의 진행 상황·프로필·메모는 세션과 채널을 넘어 저장되고 재개됩니다. 이것은 에이전트를 점(point) 작업을 하는 어시스턴트에서, 다단계 서비스를 스스로 수행하는 존재로 바꿉니다.

Dynamic Planner

다이내믹 플래너는 대화를 지켜보다가, 사용자가 에이전트의 영역 안에서 진짜로 여러 단계가 필요한 일을 하려 하고 어떻게 진행해야 할지 눈에 띄게 막막해할 때, 그 일을 임시 스토리라인 — 체크리스트로 움직이는 단계별 계획 — 으로 펼칠지 제안합니다. 에이전트는 그 계획을 한 번에 한 단계씩, 사용자가 볼 수 있는 진행 상황과 함께 실행합니다. 계획 수립은 검증을 거쳐 한 번만 일어나고, 실행은 결정적입니다.

장문 작성

장문 작성은 에이전트가 먼저 개요를 계획하고, 시작하기 전에 필요한 모든 것을 요청하며, 각 섹션을 귀하의 자료와 공개 출처에 대해 조사한 후 섹션별로 작성하여 재시작 시에도 유지되는 작업을 통해 완성된 다중 섹션 문서(예: 제출 서류, 시장 진출 보고서, 실사 메모)를 생성합니다. 채팅 옆의 캔버스에서 문서를 편집하고, 선택한 구절을 통해 어떤 구절이든 다시 작성할 수 있으며, 모든 버전이 보관됩니다.