Руководство арендатора

Использование токенов — что учитывается

Что на самом деле означают полосы «предобработка» и «генерация» на графике использования, что расходует токены, а что нет, и как читать статистику по времени и по агентам.

На вашей панели управления использование токенов показано двумя цветами — предобработка и генерация. Вот что означает каждый из них и что расходует, а что не расходует токены.

Два вида токенов

Большая языковая модель тарифицируется по тексту, который она читает, и по тексту, который она пишет, измеряемому в токенах (примерно ¾ слова каждый). agent4.io делит ваше использование таким же образом:

  • Предобработка (вход). Всё, что передаётся модели для формирования ответа:
    • сообщение пользователя,
    • недавняя история переписки,
    • соответствующие фрагменты, извлечённые из баз знаний агента,
    • и собственные инструкции агента — его soul (системный промпт), задача и любой загруженный навык.
  • Генерация (выход). Всё, что модель производит:
    • ответ, который читает ваш клиент,
    • а также, когда агент использует инструмент или навык, структурированный вызов, который он записывает, чтобы его запустить.

Для агента с опорой на знания (grounded) полоса предобработки обычно больше двух, потому что извлечённые знания добавляются к каждому вопросу.

Что не расходует токены

  • Извлечение и хранение документов. Создание и поиск по базе знаний не расходует вашу квоту — расходуется только тот текст, который модель действительно читает.
  • Доставка сообщений. Отправка и получение сообщений через веб-виджет, Telegram или WhatsApp не тарифицируется в токенах.

Чтение статистики использования

На обзорной панели управления:

  • Использование токенов по времени — по одной полосе на день (или час), разделённой на предобработку и генерацию, с переключателем диапазона 24ч / 7д / 30д. Используйте её, чтобы заметить всплеск.
  • Использование токенов по агентам — то же деление, по одной строке на агента, самые крупные — сверху. Используйте её, чтобы увидеть, какой агент выполняет больше всего работы.

Всё это учитывается в вашей месячной квоте; когда она подходит к концу, см. Квоты и использование.

Как снизить расход

  • Сфокусированный агент отвечает за меньшее число более коротких обменов репликами, чем агент «на все случаи жизни».
  • Извлечение меньшего числа фрагментов на вопрос снижает расход входных токенов; значение по умолчанию уже настроено оптимально, повышайте его только если в ответах не хватает деталей.