基础概念

一个下午,把知识灌进去

智能体需要知道的东西,绝大部分早就写下来了——在你的官网上,在你团队天天发给客户的那几份 PDF 里。从 URL 导入解决公开的那一半,上传解决剩下的一半。

也叫导入网站抓取网站站点导入上传文档初始化知识库import websitecrawl website

试点项目卡住,最常见的原因不是模型,而是「得有人坐下来把知识库准备一下」——而这件事从来没有归属人,所以它从来没开始过。

这件事本来也不必要。材料几乎总是已经存在了:在你的官网上,在你团队每周都要邮件发给客户的那几份 PDF 里。要做的不是写,而是把它们弄进去。

两条入口,对应两类材料

你的官网——从 URL 导入。 把平台指向你的站点,它会读取公开页面,把每一页变成一份文档。这一条覆盖的是你早就为客户写好的材料:服务说明、价格页、FAQ、政策解读,以及那些恰好回答了大家真正会问的问题的博客文章。

其余的——把文件传上来。 费率表、产品手册、那份写明团队能承诺什么、不能承诺什么的内部单页。任何登录之后才能看的、任何只以 PDF 形式存在的、任何页面上从来不会明说的东西。

这个分法不是随意的。网站导入快而广,但浅——它只能看到访客能看到的东西。而让你的智能体区别于「一个搜索你网站的引擎」的那些材料,都在上传这条路上。

导入做不到什么

在你围绕它做计划之前,值得先知道。

用 JavaScript 渲染内容的页面抓回来是空的——导入器取的是 HTML,它不跑浏览器。任何登录之后的内容都够不着。站内链接的 PDF 会被跳过,它们走上传那条路。它遵守 robots.txt。还有,它是一次性导入,不是订阅:你的网站变了,知识库不会跟着变。要刷新,就再跑一次导入。

读取页面本身不花钱。在任何东西被加进来之前,你会看到确切的页面数、字符数和预估的 Token 成本——而且你不点头,什么都不会被加进去。

如果你的站点是普通的服务端渲染站点——WordPress、Webflow、Squarespace,以及大多数用 CMS 搭的营销站——导入是能读到的。会失败的是那种全部由客户端渲染的单页应用,而且它是明确报错,不会闷声导入一堆空白页。

一个完整的例子

一家按揭经纪公司,双语站点,共享盘里堆满费率表。

导入站点,只要英文。 他们把导入器指向首页,并把路径前缀设为 /en/。不这么做的话,页面预算全花在同样八篇文章的三个语言版本上——同一份内容,三倍成本,检索时还会命中一堆近似重复。导入通过站点地图找到八个页面:四篇长文、资源索引页、团队页和关于页,还有联系我们。大约 45,000 字符。他们确认,一分钟后知识库里有了八份文档。

到这一步,智能体已经能回答「你们做医师贷吗?」和「线上过户是怎么走的?」了——因为那些文章几年前就写好了,一直躺在博客上。

把网站从不明说的那四样传上来。 当前费率表。自雇申请人的材料清单。那份写明信贷员在聊天中不得承诺什么的内部单页。州披露文件的扫描件。这些都不在网站上,其中两份也不该在。

写边界,不写事实。 在知识库指令里:*这是我们的现行政策,优先于行业通行做法;报利率必须同时注明生效日期;任何涉及具体申请的问题一律转人工。*事实住在文档里,指令说的是怎么对待这些文档。

总耗时:一个下午,其中大部分花在判断哪些内部文档放进去是安全的——而那恰恰是真正需要人来拿主意的部分。

真正的工作量在哪儿

注意这个例子里没有出现什么:写新内容、排版、打标签、建分类体系。检索层不需要这些。

它确实需要的,是两个没有工具能替你做的决定。哪些内部材料可以安全地让客户通过智能体够到。以及,智能体不被允许承诺什么。把时间预算留给这两件事,而不是导入。

开始搭建你的第一个知识库 →

想看它怎么实现?检索是怎么决定据以作答的内容的