租戶指南

Token 用量——哪些會計入

用量圖表上「前處理」與「生成」兩個色塊究竟代表什麼、哪些操作會消耗 token、哪些不會,以及如何依時間與依智能體檢視用量。

主控台會以兩種顏色顯示您的 token 用量——前處理(pre-processing)生成(generation)。以下說明這兩者分別是什麼,以及哪些操作會、哪些不會產生 token 費用。

兩種 token

大型語言模型會針對它讀取的文字與它寫出的文字計費,單位是 token(大約每個 token 為¾個英文單字)。 agent4.io 的用量統計也依此分類:

  • 前處理(輸入)。 所有提供給模型以便其作答的內容:
    • 使用者的訊息,
    • 近期的對話歷史,
    • 從智能體的知識庫中檢索出的相關內容片段,
    • 以及智能體本身的指示——它的靈魂(系統提示詞)、任務,以及任何已載入的技能。
  • 生成(輸出)。 模型產出的所有內容:
    • 您的客戶讀到的回覆內容,
    • 以及當智能體使用工具或技能時,用來觸發該工具的結構化呼叫內容。

對於有知識庫支撐的智能體來說,前處理色塊通常會比生成色塊大,因為每個問題都會附帶檢索到的知識內容。

哪些不會產生 token 費用

  • 檢索與儲存文件。 建立與搜尋知識庫本身不會消耗您的額度——只有模型實際讀取的文字內容才會計費。
  • 傳遞訊息。 透過網頁小工具、Telegram 或 WhatsApp 收發訊息不會產生 token 費用。

檢視您的用量

主控台總覽中:

  • 依時間統計的 token 用量——每天(或每小時)一個長條,區分為前處理與生成兩段,並可切換 24 小時 / 7 天 / 30 天的區間。可用來找出用量突增的時間點。
  • 依智能體統計的 token 用量——同樣區分前處理與生成,每個智能體一列,用量最高者排在最上方。可用來查看哪個智能體消耗的資源最多。

以上這些都會計入您的每月額度;當額度所剩不多時,請參閱 額度與用量

降低用量的方法

  • 聚焦明確的智能體比什麼都做的智能體能以更少、更短的對話回合完成回答。
  • 每個問題檢索較少的內容片段可降低輸入 token 用量;預設值已經過調校,僅在回答內容缺乏細節時才需要調高。