租户指南
Token 用量——统计的是什么
用量图表上的“预处理”和“生成”两个色块到底代表什么、哪些操作会消耗 token、哪些不会,以及如何按时间和按 Agent 查看用量。
仪表盘用两种颜色展示 token 用量——预处理和生成。下面说明这两者各自是什么,以及哪些操作会计入 token 消耗、哪些不会。
两种 token
大语言模型按它读取的文本和写出的文本计费,单位是 token(大致每个 token 相当于四分之三个英文单词)。 agent4.io 按同样的方式拆分你的用量:
- 预处理(输入)。 所有提供给模型以便其作答的内容:
- 用户发来的消息,
- 最近的对话历史,
- 从 Agent 的知识库中检索到的相关片段,
- 以及 Agent 自身的指令——它的 soul(系统提示词)、任务,以及已加载的任何技能。
- 生成(输出)。 模型产出的所有内容:
- 用户看到的回复,
- 以及当 Agent 使用工具或技能时,为触发调用而写出的结构化调用内容。
对于依赖知识库作答的 Agent 来说,预处理色块通常比生成色块更大,因为每次提问都会附带检索到的知识内容。
哪些操作不会消耗 token
- 检索和存储文档。 构建和搜索知识库本身不消耗你的配额——只有模型实际读取的文本才会计入。
- 传递消息。 通过网页挂件、Telegram 或 WhatsApp 收发消息不产生 token 消耗。
查看你的用量
在仪表盘概览中:
- 随时间变化的 token 用量——每天(或每小时)一个柱状条,拆分为预处理和生成两部分,可切换 24 小时 / 7 天 / 30 天的时间范围。用它来发现用量突增。
- 按 Agent 划分的 token 用量——同样的拆分方式,每个 Agent 一行,用量最高的排在最前。用它来查看哪个 Agent 消耗最多。
以上所有用量都会计入你的月度配额;当配额告急时,请参阅 配额与用量。
如何降低用量
- 专注单一场景的 Agent 比“万能型”Agent 用更少、更短的对话轮次完成回答。
- 每次提问检索更少的知识片段可以降低输入 token;默认值已经过调优,只有在回答缺少细节时才需要调高。