Понятия

Дообучение или RAG: когда дообучение действительно нужно

Продолжение обучения модели на примерах желаемого поведения, чтобы это поведение стало её поведением по умолчанию, а не тем, что приходится запрашивать в каждом запросе. Оно меняет то, как модель работает, а не то, что она знает.

Также называютLoRAадаптердоменная адаптацияcustom modelобучение моделиmodel training

Есть всего три способа изменить то, что модель делает для вас, и они не взаимозаменяемы. Неверный выбор обходится дорого — но это проявляется лишь спустя месяцы.

fine-tuning
example behavioursModeltrained on theexamplesthat’s the default now
Fine-tuning bakes a behaviour into the model itself, instead of asking for it every request.
РычагЧто он меняетКогда он вам стоит
ПромптингЧто модель делает в этот разКаждый запрос, в токенах — и чем длиннее инструкции, тем менее надёжно они соблюдаются по мере роста беседы
Извлечение (retrieval)Что модель знает прямо сейчасВ каждом запросе, в работе по извлечению. Факты остаются актуальными, потому что живут вне модели
ДообучениеЧто модель делает по умолчаниюОдин раз, заранее. Бесплатно во время запроса — поведение уже встроено

Что такое дообучение на самом деле

Вы берёте базовую модель и продолжаете обучать её на примерах желаемого поведения: пары «вход» и «ответ, который дал бы хороший специалист в вашей области». Поведение модели по умолчанию смещается — какие слова она выбирает, какую форму принимает ответ, что она спрашивает прежде, чем ответить.

Это не база данных. Ничего не сохраняется и не извлекается. Примеры смещают склонности модели; они не становятся фактами, которые она может процитировать.

На практике это адаптер, а не новая модель

Переобучать каждый вес дорого и редко необходимо. Обычный подход — LoRA, или низкоранговая адаптация (low-rank adaptation), — обучает небольшой набор дополнительных параметров, которые надстраиваются поверх замороженной базовой модели. Результат — файл в десятки мегабайт, а не в десятки гигабайт.

У этого есть важное следствие: одна базовая модель может обслуживать множество адаптеров. Одна машина может использовать одни и те же базовые веса для юридической фирмы, клиники и логистического оператора, подменяя небольшой адаптер под каждого арендатора. Дообучение под отрасль не означает целую модель на каждую отрасль.

Когда оно действительно нужно

Важен регистр речи, а промпт его не удерживает. Японские деловые формы вежливости, клиническая формулировка, то, как андеррайтер осторожничает. Регистр можно описать в промпте; в длинной беседе модель дрейфует обратно к своим значениям по умолчанию. Дообучение смещает это умолчание.

Соблюдение формата при большом объёме. Если каждый вывод должен иметь определённую структуру и «обычно правильно» — недостаточно, примеры научат этому надёжнее, чем инструкции.

Инструкции переросли сам ответ. Когда системный промпт длиннее того, что он производит, вы платите за эти токены в каждом отдельном запросе. Дообучение — это то, как эта стоимость выносится из пути каждого запроса.

Небольшая модель в узкой области. Хорошо дообученная небольшая модель часто превосходит гораздо более крупную универсальную внутри одного ремесла — а это в той же мере решение о стоимости, что и о качестве. См. подключение собственной модели.

Базовая модель слаба в вашем языке или области. Некоторые языки и специализации бедно представлены в публичных обучающих данных. Примеры — это то, как вы это исправляете.

Когда оно вам не нужно

Факты не место в дообучении. Цены, политики, доступность, статус дела — всё, что может измениться во вторник, принадлежит базе знаний, где изменение — это загрузка файла. Дообученная модель не обновляется, когда обновляется ваш прайс-лист, и будет продолжать уверенно отвечать тем, чему научилась.

  • Вы ещё не попробовали лучший промпт. Большинство проблем «нам нужна своя модель» — это проблемы промпта. Дообучение — дорогой ответ; заслужите его сначала.
  • У вас горстка примеров. Несколько десятков не сдвинут модель. Сотни хороших — могут; качество побеждает количество, а плохие примеры добросовестно обучают плохим привычкам.
  • То, что вам нужно, часто меняется. Всё, что вам хотелось бы редактировать еженедельно, не должно быть встроено.

Что нужно, чтобы сделать это правильно

Примеры. От сотен до нескольких тысяч, взятые из реальной работы и проверенные тем, кто знает область. Именно эту часть клиенты недооценивают — сбор данных обычно дольше, чем обучение.

Отложенный набор для оценки. Примеры, которых модель никогда не видела, оцениваемые до и после. Без этого вы не сможете сказать, помогло дообучение, навредило или не изменило ничего — а «стало лучше по ощущениям» — это не измерение. Этот шаг чаще всего пропускают, и именно он решает, стоил ли проект того.

План на смену базовой модели. Адаптеры привязаны к базе, на которой их обучали. Когда вы переходите на более новую базовую модель, настройку переделывают. Заложите это в бюджет как обслуживание, а не как разовое дело.

Отказ, против которого нужно проектировать

Модель, дообученная слишком сильно под один узкий стиль, становится хуже во всём остальном — она отвечает вашим фирменным голосом даже там, где вопрос требовал другого регистра, и становится уверенно красноречивой в том, чему её никогда не учили. Именно поэтому важен набор для оценки, и именно поэтому разумная цель обычно — скромное смещение умолчаний, а не модель, умеющая делать лишь одно.

Нужны технические детали?Почему модель — заменяемая деталь
Из чего он состоит
Душа

Постоянное описание того, кто такой агент — его характер, тон и незыблемые правила, — хранимое отдельно от задачи, которую он сейчас выполняет.

База знаний

Документы, по которым агенту разрешено отвечать. agent4.io держит две разновидности — выверенные материалы вашей компании и личные файлы каждого клиента, — извлекая их вместе, но никогда не путая одно с другим.

Skill

Именованный пакет умения — короткое описание того, когда он нужен, развёрнутая инструкция и инструменты, которые он открывает, — подгружаемый агентом только тогда, когда становится уместен.

MCP

Model Context Protocol — открытый стандарт подключения агента к внешним инструментам и данным, при котором система описывает свои возможности один раз, а не заново под каждый ИИ-продукт.

Знания, инструменты и Skills

Три разные работы, которые постоянно принимают за одну: база знаний хранит факты, MCP-инструмент выполняет расчёт, который нельзя доверить импровизации модели, а Skill — процедура, решающая, за чем из этого потянуться.