全部理由
自带模型

你的模型。你的端点。 你的成本曲线。

在这里,智能体层和模型层是分开的。把 agent4.io 指向任意一个 OpenAI 兼容端点——前沿大模型的 API、跑在你自己硬件上的小型开源模型,或者几个同时用——一个智能体都不用重做。

任意 OpenAI 兼容端点——托管的前沿模型,或你自建的开源权重
多个后端同时在线,按权重分流,彼此之间可故障转移
能力在启动时探测得来,绝不写死——小的上下文窗口会被如实对待
针对小型开源模型在工具调用上翻车的那几种具体方式而构建

模型是一个设置项,不是一种架构

多数智能体平台是围着某一个模型家族长出来的,连同它的种种假设一并继承——它的上下文窗口、它的工具调用格式、它的价格。等到要换模型的那天,等于把平台重做一遍。

在这里,模型待在一个网关后面。后端不过是表里的一行:一个 base URL、一个密钥、一个模型名、一个类型、一个权重。加一个后端是改配置,不是发一次版。你的智能体、提示词、知识库和技能,不知道也不需要知道刚才是哪个模型作答的。

正是这一层间接,才让本页其余的事情成立——成本控制、把模型放进自己的内网、按活儿混用不同档位的模型。一个架构决定,干了四件事。

小型开源模型是按特定方式坏掉的

「支持开源模型」这句话很好说,通常也只意味着「HTTP 调用没报错」。真正的故障要晚得多才露头:在生产环境里,在工具调用这条链路上。其中有四种常见到我们直接为它们构建:

工具调用以文本形式出现。 不少开源模型无视结构化的 tool_calls 字段,改把调用写进回复正文,写成 XML 或者 JSON。不管它的话,用户看到的是一堵标记墙,而什么都没被执行。agent4.io 两种写法都解析,把工具跑起来,再把标记剥掉,绝不让它抵达终端用户。

流式返回的工具调用是碎片。 各家 OpenAI 兼容服务端,对于怎么把工具调用切进流式分片各有各的做法。碎片会先按索引重新拼成完整的调用,然后才轮到执行。

上下文窗口小得多。 一个 32K 窗口的模型,不能按百万窗口的模型那样使唤。可用的输入预算,是拿启动时实际探测到的窗口,减去输出预留和一段安全余量算出来的——不是构建时写死的一个数。

思考会把答案吃掉。 在先思考再作答的模型上,一个天真的输出预算会被推理过程消耗光,真正的答案被截断。所以这个预算会相应调高。

展开看它是怎么做到的——工程细节,写给你团队里那位会被问到「这事儿是真的吗」的人。

按活儿分派,而不是按厂商站队

不是每一步都需要同一个模型。分类、抽取和例行回复,小模型跑得很好;难啃的推理步骤未必。因为后端本身带着类型和权重,你可以让它们并排跑起来,把每种活儿放到它该去的地方。

现实中的分法通常看后果,而不是看难度:只读、低风险的活儿交给便宜的模型,凡是要写入或者要落定的,交给强的那个。

这对成本意味着什么

token 价格是终结掉大多数智能体项目的那个异议——试点很便宜,铺开就不是了。把模型和平台分开,给你的是三根杠杆,而不是一根都没有:把高频、低风险的流量挪到更便宜的模型上,把开源权重跑在你早就买下的硬件上,把强模型留给配得上它的那部分工作。

重点不是开源模型永远是对的答案。重点是这个决定始终归你,而且始终可以反悔。

常见问题

我能不能在 agent4.io 上用自己的模型,而不用默认那个?
可以。agent4.io 对接任意 OpenAI 兼容端点,模型后端属于配置项而不是代码。你可以把它指向一个托管的前沿模型 API、指向你自己用 vLLM 或 Ollama 跑起来的开源模型,也可以同时指向多个后端。切换的时候,你的智能体、知识库和技能都不需要改动。
agent4.io 支持 Qwen 这类开源模型吗?
支持,而且兼容性工作远不止于「能接上这个端点」。小型开源模型经常把工具调用当成纯文本吐出来而不是放进结构化字段,流式返回时又把一次调用拆成碎片,上下文窗口也比前沿模型小得多。agent4.io 这三种情况都做了处理,而不是默认对方会表现得像一个前沿模型。
如果模型不支持原生的函数调用会怎么样?
agent4.io 也会解析以文本形式出现在响应正文里的工具调用,开源模型常见的 XML 和 JSON 两种写法都认,并把这些标记剥干净,绝不让它们抵达终端用户。一个没有原生函数调用能力的模型,照样可以驱动工具。
agent4.io 能对着我们内网里的模型跑吗?
可以。因为模型是通过一个普通的 OpenAI 兼容 HTTP 端点访问的,这个端点完全可以是你自己内网里一台没有公网出口的服务器。当法规或政策不允许客户数据流向第三方模型服务商时,通常就是这么部署的。
如果我自带模型,agent4.io 还按 token 向我计费吗?
不会。token 配额针对的是 agent4.io 自己提供的推理。当你提供自己的端点时,推理成本取决于你的服务商或你自己的硬件,agent4.io 则单独授权。具体怎么安排,欢迎来谈。
不同的活儿可以用不同的模型吗?
可以。后端按租户注册,每个都带一个类型和一个权重,所以对话和向量化可以跑在不同的模型上,同类型的多个后端之间也可以分流。某个后端出故障或连不上时,agent4.io 会先在其他后端上重试,然后才放弃。
用你自己的知识库看看效果。免费开始联系我们