全部理由
用你自己的模型

你的模型。你的端點。 你的成本曲線。

在這裡,代理層和模型層是分開的兩件事。把 agent4.io 指向任何 OpenAI 相容端點——前沿模型的 API、跑在你自己硬體上的小型開源模型,或同時好幾個——而且一個代理都不必重做。

任何 OpenAI 相容端點——託管的前沿模型,或自架的開源權重
同時掛多個後端,可分配權重,彼此之間會互相接手
能力在啟動時實地探測,不寫死——脈絡視窗小就當它小
針對小型開源模型在工具呼叫上那幾種特有的壞法而做

模型是一個設定,不是一種架構

多數代理平台是繞著單一模型家族長出來的,連同那個家族的假設一起繼承——它的脈絡視窗、它的工具呼叫格式、它的價格。到了要換模型的那一天,等於把整個平台重做一次。

在這裡,模型坐在一道閘道後面。後端就是資料表裡的一列:一個 base URL、一把金鑰、一個模型名稱、一個種類、一個權重。多加一個後端是改設定,不是一次部署。你的代理、提示詞、知識庫與技能,不知道也不需要知道剛才是哪個模型回答的。

這一層間接,正是這一頁其他每一件事成立的前提——成本要拿捏得住、模型可以擺進自己的網路、不同工作混用不同等級的模型。一個架構決定,同時做完四件事。

小型開源模型有它特有的壞法

「支援開源模型」講起來很輕鬆,實際上通常只表示「那個 HTTP 呼叫成功了」。真正的失敗都出現在後面,在生產環境,在工具呼叫這條路徑上。其中四種常見到我們直接為它們而做:

工具呼叫是以文字送過來的。 不少開源模型無視結構化的 tool_calls 欄位,改把呼叫寫進回覆內文裡,格式不是 XML 就是 JSON。放著不管,使用者看到的是一整面標記,而且什麼都沒被執行。agent4.io 兩種寫法都解析、把工具跑起來,並把標記清乾淨,不讓它出現在終端使用者眼前。

串流的工具呼叫是碎片。 OpenAI 相容的伺服器,對於一次工具呼叫該怎麼切進串流區塊,各有各的做法。這些碎片會先依索引重新拼成完整的呼叫,之後才會有任何東西被執行。

脈絡視窗小得多。 32K 視窗的模型,不能當成百萬視窗的模型來驅動。可用的輸入預算,是從啟動時實地探測到的視窗推算出來的——扣掉輸出保留量,再扣一段安全餘裕——而不是建置時寫死的一個數字。

推理會把答案吃掉。 在會先思考、再回答的模型上,一個天真的輸出預算會被推理過程用光,真正的答案則被截斷。所以預算會往上調,把這一段算進去。

這件事的實作細節——工程面的說明,寫給你團隊裡那位會被問「這是真的嗎」的人。

依工作分流,不是依供應商分流

不是每一個步驟都需要同一個模型。分類、抽取和例行回覆,小模型跑得很好;比較硬的推理步驟則未必。因為後端帶著種類與權重,你可以讓它們並存,把每一種工作放到它該去的地方。

實務上的切法通常是看後果,不是看難度:唯讀、低風險的工作交給便宜的模型,任何會寫入或會定案的動作交給強的那一個。

這對成本的意義

Token 價格是絕大多數代理專案的終點——試點很便宜,全面鋪開就不是了。把模型和平台拆開,你手上從沒有籌碼變成有三個:把高流量、低風險的請求搬到便宜的模型、在你本來就有的硬體上跑開源權重,把強模型留給值得它的工作。

重點不是開源模型永遠是對的答案。重點是這個決定始終在你手上,而且隨時可以反悔。

常見問題

我可以不用預設的模型,改用自己的嗎?
可以。agent4.io 對接的是任何 OpenAI 相容端點,模型後端屬於設定,不屬於程式碼。你可以把它指向託管的前沿 API、指向你自己用 vLLM 或 Ollama 跑的開源模型,也可以同時指向好幾個後端。換模型時,你的代理、知識庫與技能完全不必動。
agent4.io 支援 Qwen 這類開源模型嗎?
支援,而且相容性做得比「收得下這個端點」更深一層。小型開源模型經常把工具呼叫寫成純文字而不是結構化欄位、在串流時把一次呼叫拆成碎片送出,脈絡視窗也遠小於前沿模型。這三件事 agent4.io 都實際處理掉了,而不是假設模型一定會表現得像前沿模型。
如果模型不支援原生的 function calling 呢?
agent4.io 也會解析以文字形式出現在回應內文裡的工具呼叫,開源模型常見的 XML 與 JSON 兩種寫法都認得,並且會把那段標記清乾淨,不讓它出現在終端使用者眼前。所以沒有原生 function calling 的模型,一樣驅動得了工具。
agent4.io 可以接我內部網路裡的模型嗎?
可以。因為模型是透過一個單純的 OpenAI 相容 HTTP 端點連上的,那個端點完全可以是一台架在你自己網路裡、對外沒有任何路由的伺服器。在法規或內部政策不允許客戶資料流向第三方模型供應商時,這是常見的作法。
如果我自備模型,agent4.io 還是按 token 計費嗎?
不會。token 額度計算的是 agent4.io 提供的推論。當你自備端點時,推論成本就是你的供應商或你自己硬體的成本,而 agent4.io 另行授權。哪一種方式適合你,歡迎跟我們談。
不同的工作可以用不同的模型嗎?
可以。後端以租戶為單位登錄,各自帶著種類與權重,所以對話和向量化可以跑在不同模型上,同一種類的流量也可以拆給好幾個後端。萬一某個後端故障或連不上,agent4.io 會先改試其他後端,才會放棄。
用你自己的知識庫看看效果。免費開始聯絡我們
更多理由