Поиск ответа, которого нет
Глубокий поиск — один вопрос превращается в несколько упорядоченных поисковых запросов, каждое утверждение сопровождается источником, а всё, что не было подтверждено поиском, отвергается, а не заполняется из памяти.
Некоторые вопросы не могут быть answered из вашего материала, потому что ответ ещё не содержится ни в чьих материалах — кто ещё продаёт то, что продаём мы, что опубликовал этот регулятор в этом квартале, как предложение этого поставщика сравнивается с нашим. Для этого нужно, чтобы кто-то пошёл и выяснил.
Глубокое исследование — это и есть то, что нужно. Это не один поиск: это небольшое упорядоченное расследование, выполняемое внутри одного хода, где каждое утверждение в ответе содержит источник, из которого оно взято — а всё, что поиску не удалось установить, отвергается, а не пишется из памяти.
Как выглядит ход
Вопрос разбивается на упорядоченные шаги, каждый из которых ищет одну вещь. Шаги могут зависеть от предыдущих — второй шаг может ссылаться на "категорию, найденную первым шагом".
Каждый шаг превращается в реальный веб-поиск, и наиболее перспективные результаты загружаются. Страницы выбираются из реальных результатов, а не вспоминаются: запомнившийся URL, в котором ошиблась одна буква, — это ничего.
Предложения, отвечающие на вопрос шага, извлекаются из загруженной страницы, каждое из них привязано к странице, из которой оно взято. Это цитирование, а не рассуждение — выводы делаются позже, на основе собранных фактов.
Когда шаг завершается, агент сообщает, что тот нашёл, в одном или двух предложениях, пока расследование ещё продолжается.
Прежде чем продолжить, оставшиеся шаги пересматриваются с учётом того, что было фактически найдено. Первоначальный план был написан, когда агент ничего не знал о предмете.
Только теперь пишется ответ, основанный исключительно на собранных фактах, с нумерованными маркерами на каждом утверждении, указывающими на страницу, из которой оно взято.
Re-planning is the step that keeps a wrong first guess from costing the whole investigation.
Почему это несколько шагов, а не один поиск
Вопрос вроде "кто мои конкуренты" нельзя искать напрямую, и причина не в том, что поисковая система слаба. Пока вы не знаете, что именно продаёт эта компания и в какой категории она торгует, нет способа определить, кто считается конкурентом — лучшее, что можно сделать, — это ввести название компании в поле поиска и надеяться.
Таким образом, первый шаг устанавливает предмет, а второй использует то, что нашёл первый. Второй шаг должен существовать: расследование, которое ищет только предмет и никогда не ищет категорию, к которой он относится, завершает половину таблицы, и вывод, который от него требовали, недоступен из этой половины.
Шаги также пишутся так, чтобы запрашивать то, что страница утверждает прямо, а не вывод, который вы хотите. "Какие функции поддерживают X и Y по отдельности" — это ответ из таблицы функций; "какой из X и Y лучше" — это суждение, и ни одна страница его не содержит. Суждение делается в конце, на основе фактов — это не то, что нужно искать.
Почему отчёт ведётся во время работы
Расследование, которое проходит шесть раундов, а затем выдаёт один длинный ответ, — это минута пустого экрана для человека, который ждёт, хотя выводы накапливались всё это время. Поэтому каждый шаг отчитывается о том, что он нашёл по мере завершения, и эти промежуточные заметки остаются в разговоре после — они являются частью ответа, а не прогресс-баром, который исчезает.
Достижение страниц, которые не хотят, чтобы их читали
Результат поиска бесполезен, если страницу нельзя загрузить, и значительная часть полезного веба скрыта за чем-то — проверкой на ботов, цепочкой перенаправлений, страницей, которая собирается только в браузере. Поэтому загрузка эскалируется: сначала прямой запрос, затем проксируемый, затем реальный браузер. Страница, которая не проходит ни один из этих этапов, отбрасывается и записывается как найдена, но не прочитана, что является другим уровнем достоверности по сравнению со страницей, которая была фактически прочитана — и эти два случая отображаются по-разному при просмотре источников.
Ничего не отвечает из памяти, включая те части, о которых никто не спрашивал
Это та часть, которую стоит прочитать дважды, потому что именно здесь ассистенты по исследованиям обычно тихо терпят неудачу.
Попросите сравнить вашу компанию с компанией, которой не существует, и очевидная ошибка — это не отказ, а ответ. Расследование находит много информации о реальной компании, не находит ничего об другой, а затем пишет обе половины в одном абзаце уверенным тоном. Половина, которая взята из источников, и половина, взятая из памяти модели, неразличимы для читающего.
Поэтому перед написанием ответа платформа делает две вещи последовательно:
- Модель перечисляет то, что называет вопрос — конкретные компании, продукты, регуляции или рынки, которые должны быть установлены, прежде чем вопрос можно будет ответить. Только то, что фактически называет вопрос: спросив "кто мои конкуренты", предметом является ваша компания, а конкуренты — это результат, а не предпосылка.
- Программное обеспечение проверяет каждое из них против фактов, которые были фактически собраны. Не модель — программное обеспечение. Просить модель подтвердить, что она провела исследование, — это задавать ей вопрос, на который у неё есть все причины ответить да.
Затем:
- Всё установлено → обычный ответ.
- Часть из них установлена → ответ пишется, и части, которые не были установлены, называются в нём как не установленные. Сравнение, в котором отсутствует одна сторона, сообщается как сравнение, которое не могло быть проведено, а не как описание найденной стороны.
- Ничего из них не установлено → ответ не пишется вообще. Вам сообщают, что было запрошено и ничего не найдено, и спрашивают, правильно ли написано имя или вы можете указать сайт.
Тот же принцип проходит через продукт: проверка, которую может выполнить машина, не оставляется на промпт. Просить модель быть осторожной — это желание; проверка её вывода — это гарантия.
Выдуманные ссылки не переживают ход
Модель, которая только что прочитала шесть страниц, иногда пишет седьмой URL, который она никогда не видела — правдоподобный адрес компании, о которой она только что узнала. Каждая ссылка в готовом ответе поэтому проверяется против страниц, которые ход фактически загрузил, и всё остальное ловится до того, как ответ будет отправлен.
Что происходит затем — это не повторный запуск той же модели с выговором. Сообщение о том, что она выдумала что-то, меняет очень мало; этот ход потрачен, и человек, который ждал, заплатил за него. Вместо этого ход эскалируется более сильной модели, один раз на уровень, пока ответ не вернётся чистым. Это настройка на агента, потому что агенты, которым это больше всего нужно, — это те, которые работают на маленькой самостоятельной модели, где первая попытка дешёвая.
Что это значит на практике
- Каждое утверждение атрибутируемо. Нумерованный маркер на предложении указывает на страницу, из которой оно взято, и вы можете открыть её.
- Вопрос, на который он не мог ответить, возвращается как вопрос, на который он не мог ответить, называя то, чего не хватало — вместо уверенного абзаца без под собой.
- Посетитель может остановить его. Это минута работы, видимая во время её выполнения, прерываемая.
- Глубокое исследование — это возможность в меню агента. Если она не включена, посетитель, запрашивающий её, получает обычный ответ — см. Решение того, чего хочет сообщение.