文档工作原理

工作原理

一轮对话内部到底发生了什么——检索、记忆、工具、上下文、渠道,以及哪些数据始终不外流。

基于事实的回答

文档如何转化为可供智能体回答的内容——分块、上下文头、查询重写和相关性阈值。

按客户划分的记忆

对话如何成为关于客户的持久事实——推导、去重、重要性以及哪些内容会被召回。

工具与 MCP

智能体如何从回答转向行动——工具循环、上下文预算,以及通过 MCP 连接你自己的系统。

访客手打「帮我查查」时发生了什么

手打一句请求,应该和从菜单里点同一项得到同样的结果。用词表做这件事,七种语言里必然漏;每条消息都问一次模型,又慢又贵。我们量到了什么、为什么路由分成两步,以及为什么同一句话在文档打开时会走到另一条路上。

为什么上下文一长,智能体就变笨

把「上下文腐化」讲具体。每一轮都是一次自包含的请求;请求一长、或者塞满工具往返,答案的准确率就实测下降。这一页讲清请求里装着什么、装不下时先丢什么,以及我们为什么在作答前把它重新渲染一遍,而不是让模型去总结工具结果。

一段对话在两轮之间存在哪里

既然每一轮都是一次自包含的请求,对话其余的部分在哪?每一轮存下什么、什么永远不存,逐字窗口是什么,更早的轮次如何被恰好折进滚动摘要一次,单轮仍然装不下时会发生什么,以及哪些事实活得比会话久。

一个智能体,通吃所有渠道

网页挂件、Telegram 和 WhatsApp 如何接到同一个智能体、共用同一份记忆——身份解析、共享的控制流,以及哪些部分保持渠道特有。

定时跟进

智能体如何把工作排到之后再做,并把结果送回它来的那个渠道——持久化任务、原子领取与故障恢复。

隐私是设计出来的

由数据库强制的隔离、按用户密钥的字段级加密,以及关于端到端加密到底给了你什么、没给你什么的实话。

跑在开源模型上

模型层如何与智能体层保持分离——能力探测、多后端路由,以及小型开源模型在工具调用上翻车的四种方式,网关都替你挡了。

一份长文档到底是怎么写出来的

四十页的报告不是一次很长的回复。它是一条带状态机的后台作业——提纲、提问、调研、逐节写——每一步都能在崩溃之后重跑而不会重复劳动、也不会白烧预算;改写的偏移由代码算而不是模型挑;每一版都留着。

回答中的图表

当回答包含一组可比较的数字时,智能体会主动绘制图表——无需提示,在对话过程中完成。九种图表类型,每种均附有示例,以及拒绝绘制数字不在您材料中的图表的过滤机制,并解释为何衍生数据通过代码而非模型计算得出。

Watching a source over months

Continuous monitoring — the agent researches which pages to watch, you confirm, and it reports only what actually changed and actually matters to you.

研究其没有的答案

深度研究——一个问题转化为多个有序搜索,每个声明都附带其来源,任何搜索未证实的内容均拒绝填充,而非从记忆中补充。

技能及其选择机制

能力包如何到达模型——共享平台库、按意图检索、仅随流程到达的工具,以及在请求模糊时进行反问。

对回答本身的检查

回答发出之前要过的那几道检查——每一道拦的是什么、多久响一次,以及为什么"经常响"的检查是 bug 而不是尽责。