Как это устроено

Навыки и механизмы их выбора

Как пакет возможностей попадает в модель — общая библиотека платформы, поиск по намерению, инструменты, доступные только в рамках процедуры, и уточнение при неоднозначном запросе.

Навык — это способ работы, упакованный в пакет: короткая фраза, указывающая, когда он применяется, полная процедура и инструменты, необходимые для этой процедуры. Эта фраза присутствует в промпте при каждом обращении; процедура загружается только после того, как навык выбран. Такое разделение позволяет агенту обладать множеством возможностей, не оплачивая их за каждое сообщение.

Эта страница посвящена сложной части: из всего доступного, какой именно навык будет использован — и что происходит, когда ничего явно не подходит.

Две библиотеки, одно пространство

У каждого агента есть навыки из двух источников, и о первом ему не нужно сообщать отдельно:

  • Платформенные навыки — общие методы работы (исследование конкурентов, чтение нормативных актов, оценка лида). Доступны каждому агенту по умолчанию.
  • Ваши навыки — те, которые вы пишете для своего бизнеса, прикрепляя их к конкретному агенту.

Они ищутся совместно. Совместное использование пространства не ставит ваши навыки в невыгодное положение: при тестировании 18 действительно отраслевых навыков, смешанных с 193 общими, отраслевые навыки распознавались более надёжно (86% против 79%). Отраслевая лексика — коды ТН ВЭД, экспортные льготы, требования к соблюдению нормативов в магазинах — находится далеко от общей методологической лексики, поэтому её легче выделить, а не сложнее.

Извлечение, потому что полный список перестаёт работать

1. Сообщение этого обращения

То, что сказал посетитель, в точности как он это сказал.

2. Извлечение

Каждый навык индексируется по своему описанию и по примерам формулировок — вариантам на простом языке, которыми кто-то может попросить о нём. Сравнение одного предложения с другим работает лучше, чем сравнение с определением.

3. Короткий список

Пятнадцать наиболее близких показываются модели, каждый с несколькими примерами формулировок. Не вся библиотека: при полном списке из 207 навыков модель правильно выбирала 30% раз; при сокращении до пятнадцати — 51%.

4. Выбор

Модель выбирает один — или не выбирает ничего, что является допустимым исходом и часто правильным решением.

5. Загрузка процедуры

Только теперь загружается полная процедура, и только теперь становятся доступны инструменты самого навыка.

Ниже примерно восьми навыков извлечение не запускается — полный список просто показывается.

Ниже примерно восьми навыков ничего из этого не запускается — полный список показывается, как раньше. При таком размере список уже точен, и извлечение могло бы только добавить новый способ ошибки: правильный навык отсутствует в коротком списке, модель затем отвечает, опираясь на свои знания, и в журнале нет никаких указаний на это.

Процедура идёт перед инструментами

Инструменты самого навыка не доступны в начале обращения. Загрузка навыка — это то, что их туда помещает.

Этот порядок enforced в коде, а не запрашивается в промпте, и причина этому — измерения. Когда просили исследовать конкурентов компании, передав процедуре и инструментам вместе, модель трижды вызвала веб-поиск и никогда не открыла процедуру. Она выдала имена конкурентов из памяти, поискала эти вымышленные имена, ничего не нашла — их не существовало — и описала их как ответ. Первый шаг процедуры, который она никогда не читала, гласил: "сначала установите, что именно продаёт эта компания".

Процедура, которая является необязательной, не читается. Инструменты, которые сам агент уже имеет, не затрагиваются: если web_search есть у агента, он остаётся доступным всё обращение. Только инструменты, которые появляются благодаря навыку, ждут этого навыка.

Некоторые навыки получают материал ещё до начала работы

Исследовательский навык, начинающий с пустого стола, может брать факты только из одного места — из памяти самой модели. Поэтому для навыков, которые это объявляют, платформа проводит первый круг поиска до запуска навыка: превращает фразу посетителя в поисковые запросы, выполняет их и передаёт результаты нумерованной таблицей фактов, на которые ответ обязан ссылаться.

Ширина задаётся отдельно для каждого навыка, потому что она не бесплатна. Вопрос сразу из нескольких частей — сколько стоит, какие ограничения, как забрать свои данные — двумя поисками не закрывается. Измерено ровно на этом вопросе: узкий обход дал 2957 слов с пятью ссылками, и каждая цена в них была конкретным числом, которого не было ни в одном источнике. После расширения обхода для исследовательских навыков тот же вопрос вернулся с 17 ссылками, а сравнение технологий выросло с 5,7 до 11,7. Навыки, которые составляют, переписывают или считают, не объявляют ничего и ничего не ищут.

В инструкциях того же навыка прямым текстом было написано: никогда не называй цену, которой нет в материале. Он всё равно её назвал. Правило в промпте — это просьба; ответ изменил достаточный материал, а не эта фраза.

Вместе с этим пришлось поменять ещё одно. Защита от худшего сочетания уже была: искал, но не открыл ни одной страницы — значит ответ может идти только из сниппетов. Она спрашивала, искала ли модель. А в тех ходах, где платформа искала за навык, модель не вызывала ничего, и защита отходила в сторону ровно там, ради чего её и писали. Теперь она спрашивает, есть ли в этом ходе результаты поиска вообще — кем бы они ни были получены.

Когда ничего явно не подходит, он спрашивает

Некоторые запросы действительно не указывают на один конкретный навык. Платформа может определить, что находится в такой ситуации — не спрашивая модель, уверена ли она, а глядя на то, насколько плотно кластеризуются оценки извлечения. Когда пятнадцать лучших кандидатов разделены почти ничем, поиск не имеет мнения, и ответ всё равно — это подбрасывание монеты: в этом диапазоне правильный навык ранжируется первым только 26% раз, против 85%, когда оценки распределяются шире.

Поэтому в этом диапазоне, и только там, агент сначала задаёт один вопрос — предлагая два или три простых варианта («вы хотели текущие рыночные цены или оценку этого конкретного объекта?»), а не запрашивая параметры. На самой сложной четверти запросов это повысило точность с 36,7% до 63,3%, в среднем за 1,5 вопроса.

Предоставление модели решать самой, когда задавать вопрос, не работает: когда её просили использовать суждение, она задавала вопросы в 81,5% обращений — включая все те, с которыми она справилась бы правильно. При ограничении по разбросу оценок она задаёт вопросы в 11%, с тем же преимуществом.

Это тот же принцип, который лежит в основе продукта: машина может измерить, насколько неоднозначен запрос; модель, спросив «вы уверены?», скажет «да». См. Принятие решений о намерении сообщения.

Что это значит на практике

  • Агенты знают общие методы работы без необходимости их конфигурации, и знание большего их числа не стоит ничего за сообщение.
  • Ваши собственные навыки побеждают в вашем собственном бизнесе — для этого и нужна отраслевая лексика.
  • Навык либо следует своей процедуре, либо не запускается вовсе. Он не может следовать ей частично, просто захватив инструменты и импровизируя.
  • Исследовательские навыки начинают с источниками на столе, а не с памятью. Написанное должно ссылаться на этот материал, а то, что материал не покрывает, сообщается как ненайденное.
  • Неоднозначный запрос получает вопрос, а не догадку — и вопрос появляется в небольшой доле обращений, где система действительно не может определить намерение.