Понятия

Загрузить свои знания — за один вечер

Почти всё, что агенту нужно знать, уже где-то записано — на вашем сайте и в тех PDF, которые ваша команда и так рассылает клиентам. Импорт по URL закрывает публичную половину, загрузка файлов — остальное.

Также называютимпорт сайтазагрузка документовобход сайтанаполнить базу знанийimport websitecrawl websiteseed knowledge base

Чаще всего пилот встаёт не из-за модели. Он встаёт потому, что кто-то должен сесть и «подготовить базу знаний» — а у этой работы никогда нет владельца, поэтому она никогда не начинается.

И она же не нужна. Материал почти всегда уже существует. Он на вашем сайте и в тех нескольких PDF, которые ваша команда каждую неделю отправляет клиентам почтой. Работа не в том, чтобы это написать. Работа в том, чтобы это загрузить.

Два пути внутрь, для двух видов материала

Ваш сайт — импорт по URL. Укажите платформе на свой сайт, и она прочитает публичные страницы, превратив каждую в документ. Так закрывается всё, что вы уже написали для клиентов: описания услуг, страницы с ценами, FAQ, разъяснения политик, статьи в блоге, отвечающие на реальные вопросы.

Всё остальное — загрузите файлами. Тарифные листы, руководства по продуктам, внутренняя памятка о том, что ваша команда может и чего не может обещать. Всё, что за логином, всё, что существует только в виде PDF, всё, о чём страница вслух не говорит.

Разделение не произвольное. Импорт сайта быстрый и широкий, но поверхностный: он видит ровно то, что видит посетитель. А в загруженных файлах живёт материал, который и отличает вашего агента от поисковика, натравленного на ваш сайт.

Чего импорт не умеет

Стоит знать заранее, чтобы не строить на этом планы.

Страницы, собирающие содержимое через JavaScript, приходят пустыми: импортёр забирает HTML, а не запускает браузер. Всё, что за логином, недоступно. PDF, на которые ссылается сайт, пропускаются — они идут через загрузку файлов. robots.txt соблюдается. И это разовый импорт, а не подписка: когда сайт изменится, база знаний вместе с ним не изменится. Чтобы обновить, запустите импорт заново.

Чтение страниц ничего не стоит. Вы видите точное количество страниц и символов и оценку в токенах до того, как что-либо будет добавлено, — и ничего не добавляется, пока вы не скажете.

Если у вас обычный сайт с рендерингом на сервере — WordPress, Webflow, Squarespace, большинство маркетинговых сайтов на CMS, — импорт его прочитает. Ломается случай одностраничных приложений, которые рисуют всё на клиенте, — и ломается он громко, а не молча загружая пустые страницы.

Разобранный пример

Ипотечное агентство с двуязычным сайтом и общим диском, забитым тарифными листами.

Импортируем сайт, только английскую версию. Они указывают импортёру на главную и задают префикс пути /en/. Без этого бюджет страниц уходит на одни и те же восемь статей в трёх языках: тот же контент, тройная цена и почти одинаковые попадания при поиске. Импорт находит через sitemap восемь страниц: четыре длинных руководства, индекс материалов, страницы о команде и о компании и контакты. Порядка 45 000 символов. Они подтверждают, и через минуту в базе знаний восемь документов.

Уже на этом этапе агент отвечает на «вы делаете кредиты для врачей?» и «как проходит удалённая сделка?» — потому что эти статьи написали несколько лет назад и они всё это время лежали в блоге.

Загружаем четыре вещи, о которых сайт молчит. Действующий тарифный лист. Список документов для самозанятых заявителей. Памятку о том, чего кредитные специалисты не вправе обещать в чате. Отсканированную копию раскрытия информации по штату. Ничего из этого на сайте нет, и двум из них там быть не следует.

Пишем границу, а не факты. В инструкциях базы знаний: это наша действующая политика, и она имеет приоритет над общей отраслевой практикой; ставки всегда указывать с датой, на которую они действительны; всё, что касается конкретной заявки, передавать человеку. Факты живут в документах. Инструкции говорят, как с ними обращаться.

Всего времени — один вечер, большая часть которого ушла на решение, какие внутренние документы безопасно включать. Это и есть та часть, которая действительно требует человеческого суждения.

Где на самом деле работа

Обратите внимание, чего в примере не было: написания нового контента, форматирования, проставления тегов, построения таксономии. Слою поиска ничего из этого не нужно.

А было два решения, которые за вас не примет ни один инструмент. Какие внутренние материалы безопасно делать доступными клиентам через агента. И чего агенту нельзя обещать. Закладывайте время на эти два, а не на импорт.

Настроить первую базу знаний →

Нужны технические детали?Как поиск решает, чем отвечать