Использование токенов — что учитывается
Что на самом деле означают полосы «предобработка» и «генерация» на графике использования, что расходует токены, а что нет, и как читать статистику по времени и по агентам.
На вашей панели управления использование токенов показано двумя цветами — предобработка и генерация. Вот что означает каждый из них и что расходует, а что не расходует токены.
Два вида токенов
Большая языковая модель тарифицируется по тексту, который она читает, и по тексту, который она пишет, измеряемому в токенах (примерно ¾ слова каждый). agent4.io делит ваше использование таким же образом:
- Предобработка (вход). Всё, что передаётся модели для формирования ответа:
- сообщение пользователя,
- недавняя история переписки,
- соответствующие фрагменты, извлечённые из баз знаний агента,
- и собственные инструкции агента — его soul (системный промпт), задача и любой загруженный навык.
- Генерация (выход). Всё, что модель производит:
- ответ, который читает ваш клиент,
- а также, когда агент использует инструмент или навык, структурированный вызов, который он записывает, чтобы его запустить.
Для агента с опорой на знания (grounded) полоса предобработки обычно больше двух, потому что извлечённые знания добавляются к каждому вопросу.
Что не расходует токены
- Извлечение и хранение документов. Создание и поиск по базе знаний не расходует вашу квоту — расходуется только тот текст, который модель действительно читает.
- Доставка сообщений. Отправка и получение сообщений через веб-виджет, Telegram или WhatsApp не тарифицируется в токенах.
Чтение статистики использования
На обзорной панели управления:
- Использование токенов по времени — по одной полосе на день (или час), разделённой на предобработку и генерацию, с переключателем диапазона 24ч / 7д / 30д. Используйте её, чтобы заметить всплеск.
- Использование токенов по агентам — то же деление, по одной строке на агента, самые крупные — сверху. Используйте её, чтобы увидеть, какой агент выполняет больше всего работы.
Всё это учитывается в вашей месячной квоте; когда она подходит к концу, см. Квоты и использование.
Как снизить расход
- Сфокусированный агент отвечает за меньшее число более коротких обменов репликами, чем агент «на все случаи жизни».
- Извлечение меньшего числа фрагментов на вопрос снижает расход входных токенов; значение по умолчанию уже настроено оптимально, повышайте его только если в ответах не хватает деталей.