테넌트 가이드
토큰 사용량 — 무엇이 계산되나요
사용량 차트의 "전처리"와 "생성" 막대가 실제로 의미하는 것, 무엇이 토큰을 소비하고 무엇이 소비하지 않는지, 그리고 시간별·에이전트별 사용량을 읽는 방법.
대시보드에는 토큰 사용량이 두 가지 색상으로 표시됩니다 — **전처리(pre-processing)**와 생성(generation). 각각이 무엇이고, 무엇이 토큰 비용을 발생시키고 무엇이 발생시키지 않는지 알아보겠습니다.
두 가지 종류의 토큰
대형 언어 모델은 읽는 텍스트와 쓰는 텍스트에 대해 요금을 부과하며, 이는 토큰(대략 단어 하나당 ¾개) 단위로 측정됩니다. agent4.io도 같은 방식으로 사용량을 나눕니다.
- 전처리(입력). 모델이 답변하기 위해 전달받는 모든 것:
- 사용자의 메시지,
- 최근 대화 이력,
- 에이전트의 지식 베이스에서 검색된 관련 청크,
- 그리고 에이전트 자체의 지침 — 소울(시스템 프롬프트), 태스크, 로드된 스킬.
- 생성(출력). 모델이 만들어내는 모든 것:
- 고객이 읽는 답변,
- 그리고 에이전트가 도구나 스킬을 사용할 때 이를 호출하기 위해 작성하는 구조화된 호출.
근거 기반(grounded) 에이전트의 경우, 검색된 지식이 모든 질문에 추가되기 때문에 전처리 막대가 보통 더 큽니다.
토큰 비용이 들지 않는 것
- 문서 검색 및 저장. 지식 베이스를 구축하고 검색하는 것 자체는 쿼터를 소비하지 않습니다 — 모델이 실제로 읽는 텍스트만 소비됩니다.
- 메시지 전달. 웹 위젯, 텔레그램, 왓츠앱을 통한 메시지 송수신에는 토큰 비용이 들지 않습니다.
사용량 확인하기
대시보드 개요에서:
- 시간별 토큰 사용량 — 하루(또는 시간) 단위 막대 하나에 전처리와 생성이 나뉘어 표시되며, 24시간 / 7일 / 30일 범위 토글이 있습니다. 급증 지점을 파악하는 데 사용하세요.
- 에이전트별 토큰 사용량 — 동일한 구분을 에이전트별로 한 줄씩, 가장 많이 사용한 순으로 보여줍니다. 어떤 에이전트가 가장 많은 작업을 하고 있는지 확인하는 데 사용하세요.
이 모든 사용량은 월간 쿼터에서 차감됩니다. 쿼터가 부족해지면 쿼터 및 사용량을 참고하세요.
사용량 줄이기
- 집중된 에이전트는 무엇이든 다 하는 에이전트보다 더 적고 더 짧은 턴으로 답변합니다.
- 질문당 검색하는 청크 수를 줄이면 입력 토큰이 낮아집니다. 기본값은 이미 최적화되어 있으므로, 답변에서 세부 정보가 누락될 때만 값을 높이세요.