전체 보기
자체 모델 사용

당신의 모델. 당신의 엔드포인트. 당신의 비용 곡선.

여기서는 에이전트 계층과 모델 계층이 분리되어 있습니다. OpenAI 호환 엔드포인트라면 어디로든 agent4.io를 연결하십시오. 프런티어 모델 API든, 직접 관리하는 하드웨어 위의 작은 오픈 모델이든, 여러 개를 동시에 쓰든, 에이전트는 하나도 다시 만들지 않습니다.

OpenAI 호환 엔드포인트라면 무엇이든, 호스팅 프런티어 모델이든 직접 띄운 오픈 웨이트든
여러 백엔드를 동시에, 가중치로 분산하고 장애 시 서로 페일오버
능력은 시작 시 탐지하며 하드코딩하지 않음, 작은 컨텍스트 윈도우도 있는 그대로 존중
작은 오픈 모델이 도구 호출에서 깨지는 구체적인 방식들을 겨냥해 설계
업종에 맞게 파인튜닝한 모델도 에이전트를 건드리지 않고 그대로 투입

모델은 설정 항목이지, 아키텍처가 아닙니다

대부분의 에이전트 플랫폼은 하나의 모델 계열 위에 세워지고, 그 모델의 전제를 함께 물려받습니다. 컨텍스트 윈도우, 도구 호출 형식, 가격까지 전부요. 그러면 모델을 갈아 끼우는 일은 플랫폼을 다시 만드는 일이 됩니다.

여기서 모델은 게이트웨이 뒤에 있습니다. 백엔드는 테이블의 한 행일 뿐입니다. base URL 하나, 키 하나, 모델 이름 하나, 종류 하나, 가중치 하나. 백엔드를 늘리는 것은 설정 변경이지 배포가 아닙니다. 당신의 에이전트와 프롬프트, 지식베이스와 Skill은 방금 어떤 모델이 답했는지 알지도 못하고 알 필요도 없습니다.

이 한 겹의 간접 계층이 이 페이지의 나머지 이야기를 가능하게 합니다. 비용 통제, 사내망 안의 모델, 업무별로 모델 등급을 섞어 쓰는 것까지. 아키텍처 결정 하나가 네 가지 일을 하고 있는 셈입니다.

작은 오픈 모델은 정해진 방식으로 깨집니다

"오픈 모델을 지원합니다"라는 말은 하기 쉽고, 대개는 "HTTP 호출이 성공한다"는 뜻에 그칩니다. 진짜 문제는 한참 뒤에, 운영 환경의 도구 호출 경로에서 드러납니다. 그중 네 가지는 충분히 흔해서 저희가 직접 대비해 두었습니다.

도구 호출이 텍스트로 옵니다. 적지 않은 오픈 모델이 구조화된 tool_calls 필드를 무시하고, 호출을 XML이나 JSON으로 응답 본문에 써 넣습니다. 그대로 두면 사용자에게는 마크업 덩어리만 보이고 실행되는 것은 없습니다. agent4.io는 두 형식을 모두 파싱해 도구를 실행하고, 마크업을 걷어 내 최종 사용자에게 닿지 않게 합니다.

스트리밍된 도구 호출이 조각으로 옵니다. OpenAI 호환 서버들은 도구 호출을 스트리밍 청크로 어떻게 자를지에 대해 서로 다르게 동작합니다. 조각은 무엇이 실행되기 전에 인덱스 기준으로 다시 조립됩니다.

컨텍스트 윈도우가 훨씬 작습니다. 32K 윈도우 모델을 100만 토큰 모델처럼 부릴 수는 없습니다. 사용 가능한 입력 예산은 빌드 시점에 하드코딩한 숫자가 아니라, 시작 시 실제로 탐지한 윈도우에서 출력 예약분과 안전 여유를 뺀 값에서 산출됩니다.

추론이 답을 잡아먹습니다. 답하기 전에 생각하는 모델에서는, 순진하게 잡은 출력 예산이 추론 과정에 모두 소진되고 정작 진짜 답이 잘려 나갑니다. 그래서 예산을 그만큼 올려 잡습니다.

어떻게 작동하는지 자세히 보기. 이게 정말 되는 이야기냐는 질문을 받게 될 팀 내 그 사람을 위한 엔지니어링 설명입니다.

벤더가 아니라 업무 기준으로 배분하십시오

모든 단계에 같은 모델이 필요하지는 않습니다. 분류와 추출, 정형적인 응답은 작은 모델에서도 잘 돌아가고, 까다로운 추론 단계는 그렇지 않을 수 있습니다. 백엔드가 종류와 가중치를 달고 있으므로, 여러 모델을 나란히 돌리면서 각 업무를 있어야 할 자리에 놓을 수 있습니다.

현실적인 기준은 난이도가 아니라 결과의 무게입니다. 읽기만 하고 위험이 낮은 작업은 저렴한 모델에, 무언가를 쓰거나 확정하는 작업은 강한 모델에 맡깁니다.

당신의 업계 말을 하는 모델

범용 모델은 맞는 말을 하면서도 어딘가 어색하게 들릴 수 있습니다. 행정사, 보험 언더라이터, 영상의학과 전문의에게는 각자의 어휘와 말투, 질문을 던지는 순서가 있고, 그것은 외부인이 흉내 낼 수 없으며 동료는 한 번에 알아봅니다. 검색은 사실을 바로잡습니다. 그러나 억양까지 바로잡지는 못합니다.

모델이 설정 항목이기 때문에, 업계에 맞게 파인튜닝한 모델은 다른 것을 하나도 건드리지 않고 그대로 들어옵니다. 같은 에이전트, 같은 지식베이스, 같은 경계, 그 뒤에 더 나은 감각이 붙는 것입니다.

파인튜닝이 무엇인지 짧게 말하면. 그 분야의 좋은 실무자가 내놓았을 답변 예시로 베이스 모델을 이어서 학습시키는 것입니다. 모델의 기본값이 옮겨 갑니다. 먼저 고르는 단어, 답변의 모양, 답하기 전에 되묻는 내용이 달라집니다. 실무에서 이것은 대체로 어댑터(LoRA)입니다. 얼어붙은 베이스 모델 위에 올린 수십 메가바이트짜리 파일이지, 완전히 새로운 모델이 아닙니다. 따라서 하나의 베이스 모델이 여러 어댑터를 받칠 수 있습니다. 같은 장비가 법무법인의 것과 병원의 것을 함께 돌리며, 테넌트마다 작은 파일 하나를 바꿔 끼웁니다.

파인튜닝은 데이터베이스가 아닙니다. 무언가를 저장했다가 꺼내 오는 것이 아닙니다. 아래 표는 결국 이 구분에 관한 이야기이고, 이것을 잘못 이해하는 것이 이런 프로젝트가 실패하는 방식입니다.

파인튜닝이 다루는 것과 다루지 않는 것:

있어야 할 곳
가격, 약관, 절차, 재고지식베이스. 이것들은 바뀌지만 파인튜닝된 모델은 함께 바뀌지 않습니다
업계에서 쓰는 어휘파인튜닝
전문가가 질문을 던지는 순서파인튜닝
업계가 기대하는 말투파인튜닝

이 둘을 혼동하는 것이 이런 프로젝트가 실패하는 가장 흔한 이유입니다. 당신의 문서로 학습한 모델이 그렇다고 해서 지난주에 바꾼 가격을 아는 것은 아닙니다. 그것은 검색의 몫입니다. 저희는 이 선을 결과물을 넘길 때가 아니라 일을 시작하기 전에 긋습니다.

제대로 하려면 세 가지가 필요합니다. 그 분야를 아는 사람이 검수한 수백 건의 실제 예시, 별도로 떼어 둔 평가 세트(없으면 튜닝이 도움이 됐는지 아무도 말할 수 없습니다), 그리고 베이스 모델이 바뀌었을 때 다시 할 계획입니다. 파인튜닝이 무엇인지 전부 보기. 더 나은 프롬프트로 충분했을 경우까지 함께 다룹니다.

파인튜닝은 요금제에 포함된 기능이 아니라 유상 프로젝트입니다. 범위는 보유한 자료의 양, 업종, 그리고 어디서 돌려야 하는지에 따라 달라집니다. 무엇이 필요할지 문의해 주십시오.

이것이 비용에 대해 바꾸는 것

토큰 가격은 대부분의 에이전트 프로젝트를 끝장내는 반론입니다. 파일럿은 싸고, 전사 확대는 그렇지 않습니다. 모델을 플랫폼에서 떼어 내면 레버가 하나도 없던 자리에 세 개가 생깁니다. 물량이 많고 위험이 낮은 트래픽은 더 싼 모델로 옮기고, 오픈 웨이트는 이미 보유한 하드웨어에서 돌리고, 강한 모델은 그럴 값어치를 하는 일에 남겨 두는 것입니다.

핵심은 오픈 모델이 언제나 정답이라는 이야기가 아닙니다. 그 결정이 계속 당신의 것이고, 언제든 되돌릴 수 있다는 이야기입니다.

자주 묻는 질문

기본 모델 대신 제 모델을 agent4.io에서 쓸 수 있나요?
가능합니다. agent4.io는 OpenAI 호환 엔드포인트라면 무엇과도 통신하며, 모델 백엔드는 코드가 아니라 설정입니다. 호스팅되는 프런티어 API를 가리켜도 되고, vLLM이나 Ollama로 직접 돌리는 오픈 모델을 가리켜도 되며, 여러 백엔드를 동시에 쓸 수도 있습니다. 모델을 바꿔도 에이전트와 지식베이스, Skill은 그대로입니다.
agent4.io는 Qwen 같은 오픈소스 모델에서도 동작하나요?
동작하며, 호환성 작업은 엔드포인트를 받아들이는 수준을 훨씬 넘어섭니다. 작은 오픈 모델은 도구 호출을 구조화된 필드 대신 일반 텍스트로 내보내는 일이 잦고, 스트리밍에서는 도구 호출을 조각으로 쪼개 보내며, 컨텍스트 윈도우도 프런티어 모델보다 훨씬 작습니다. agent4.io는 상대가 프런티어 모델처럼 행동하리라 가정하지 않고 세 가지 모두를 처리합니다.
모델이 네이티브 함수 호출을 지원하지 않으면 어떻게 되나요?
agent4.io는 응답 본문에 텍스트로 실려 오는 도구 호출도 파싱합니다. 오픈 모델이 흔히 만들어 내는 XML 형식과 JSON 형식을 모두 인식하고, 그 마크업을 걷어 내 최종 사용자에게 절대 노출하지 않습니다. 네이티브 함수 호출 기능이 없는 모델도 도구를 구동할 수 있습니다.
우리 내부망 안에 있는 모델로 agent4.io를 돌릴 수 있나요?
가능합니다. 모델은 평범한 OpenAI 호환 HTTP 엔드포인트로 접근하므로, 그 엔드포인트가 공개 인터넷으로 나가는 경로가 전혀 없는 사내 서버여도 됩니다. 규제나 내부 정책 때문에 고객 데이터가 외부 모델 제공자에게 흘러가면 안 되는 경우 보통 이렇게 구성합니다.
제 모델을 가져와 쓰면 agent4.io는 여전히 토큰 단위로 과금하나요?
아닙니다. 토큰 쿼터는 agent4.io가 제공하는 추론에 적용됩니다. 직접 엔드포인트를 제공하면 추론 비용은 해당 제공자나 자체 하드웨어의 비용이 되고, agent4.io는 별도로 라이선스됩니다. 어떤 형태가 맞을지는 상담해 주십시오.
우리 업종에 맞게 파인튜닝한 모델을 agent4.io에서 돌릴 수 있나요?
가능합니다. agent4.io에서는 모델 계층이 에이전트 계층과 분리되어 있으므로, 파인튜닝된 모델을 가리키게 하는 것은 설정 변경입니다. 에이전트와 지식베이스, 업무 흐름과 경계는 그대로 유지됩니다. agent4.io는 파인튜닝 자체도 유상 프로젝트로 제공하며, 범위와 비용은 고객사별로 산정합니다.
파인튜닝을 하면 에이전트가 우리 가격과 정책을 외우게 되나요?
아닙니다. 그리고 agent4.io는 이 선을 일이 끝난 뒤가 아니라 시작하기 전에 긋습니다. 사실 정보는 지식베이스에 있어야 합니다. 사실은 바뀌는데 파인튜닝된 모델은 함께 바뀌지 않기 때문입니다. 파인튜닝이 다루는 것은 매주 바뀌지 않는 것들입니다. 업계에서 쓰는 어휘, 전문가가 질문을 던지는 순서, 그리고 그 업계가 기대하는 말투입니다.
업무마다 다른 모델을 쓸 수 있나요?
가능합니다. 백엔드는 테넌트별로 종류와 가중치를 달아 등록하므로, 대화와 임베딩을 서로 다른 모델에서 돌릴 수 있고 같은 종류의 여러 백엔드로 트래픽을 나눌 수도 있습니다. 어떤 백엔드가 장애를 일으키거나 닿지 않으면, agent4.io는 포기하기 전에 다른 백엔드로 재시도합니다.
여러분의 지식 베이스로 직접 확인해 보세요.무료로 시작문의하기
다른 이유 더 보기

좁고 깊은 전문성

무엇이든 다 아는 챗봇이 하나 더 필요한 것은 아닙니다. 필요한 것은 당신의 사업을 속속들이 알고, 당신이 그은 선 안에 머무는 에이전트입니다.

개발자 없이 시작

프롬프트 엔지니어링도, 설정 파일도, IT 담당자에게 넣을 요청도 없습니다. 두세 단계면 되고, 전부 당신의 말로 씁니다. 그리고 무엇이 만들어질지, 만들어지기 전에 그대로 확인합니다.

고객별 기억

모두를 상대하는 에이전트 하나가 아니라, 고객 한 명당 하나의 에이전트가 관계 전체를 쥐고 있습니다. CRM 레코드로는 만들어 낼 수 없는 개인화를, 전체 고객에게 깔 수 있는 비용으로 제공합니다.

시간을 돌려받다

어떤 문의가 당신의 시간을 쓸 값어치가 있는지는, 이미 한 시간을 써서 알아본 뒤에야 알 수 있습니다. 그 알아보는 일을 에이전트가 합니다. 물어볼 것, 자격 요건, 서류까지 챙겨서, 당신의 일정에 도착하는 것은 이미 정리가 끝난 건입니다.

실행하는 에이전트

말만 하는 채팅창은 정작 일은 그대로 남겨 둡니다. 이 에이전트는 주문을 넣고, 예약을 잡고, 티켓을 발행합니다. MCP와 기존 API로 실제 시스템에 연결되어 있기 때문입니다.

관계의 연속성

관계로 먹고사는 사업에서 진짜 자산은 팀이 고객 한 명 한 명에 대해 알고 있는 것입니다. 그런데 그것은 대개 어느 한 사람의 머릿속에 있습니다. 여기서는 회사에 쌓입니다.

페이지를 아는 대화

대부분의 채팅 버블은 백지에서 시작해, 방금 읽던 내용을 방문자에게 다시 설명하게 만듭니다. 이 에이전트는 페이지 자체에서 출발해, 그 페이지가 실제로 불러일으키는 질문으로 대화를 엽니다.