Respuestas fundamentadas
Cómo un documento se convierte en algo desde lo que un agente puede responder: segmentación, encabezado de contexto, reescritura de consultas y umbral de relevancia.
"Las respuestas de tus documentos" es fácil de afirmar y difícil de hacer bien. Esta página describe lo que la plataforma realmente hace entre la carga de un archivo y una frase fundamentada, incluyendo las partes que suelen omitirse.
De archivo a fragmento
Ingestión: una vez por documento
El archivo se analiza para extraer texto — y, para los documentos que contienen figuras, las figuras también se leen (ver más abajo). La extracción específica del formato ocurre aquí; todo lo posterior ve solo texto plano.
Se divide en fragmentos cuyo tamaño se mide en tokens — pero el texto se divide por caracteres, por lo que la proporción entre ellos se estima a partir del propio guion del documento. Una proporción latina aplicada al chino produciría fragmentos varias veces más grandes de lo previsto.
Cada fragmento se antepone con el título del documento (y opcionalmente una nota generada) solo para la incrustación. El texto almacenado permanece sin cambios; la cabecera existe para que el vector refleje de qué parte del documento es parte el pasaje.
El fragmento junto con su cabecera se incrusta en un vector.
Se almacena cifrado y acotado al espacio. A partir de aquí es recuperable — y solo dentro de ese espacio.
Se ejecuta cuando se carga un documento. La ruta de consulta que se describe a continuación se ejecuta en cada pregunta.
Consulta: una vez por pregunta
El cliente hace una pregunta — a menudo una continuación que solo tiene sentido en contexto: "¿y cuál es la tasa de esa?"
Si la pregunta depende de turnos anteriores, se reescribe en una autocontenida solo para el vector de recuperación. El modelo sigue recibiendo la redacción original del cliente, y cualquier fallo vuelve a ella.
La pregunta (posiblemente reescrita) se incrusta con el mismo modelo utilizado para los fragmentos.
Vecinos más cercanos por coseno, clasificados por distancia, acotados al espacio de ese usuario final a nivel de base de datos en lugar de mediante un filtro de aplicación.
Las coincidencias más allá de la distancia máxima se descartan. Devolver menos pasajes de los solicitados es el resultado correcto; rellenar hasta un conteo fijo es cómo los sistemas de recuperación producen respuestas fluidas pero incorrectas.
Lo que sobrevive se descifra y se envía al modelo. Si nada sobrevive, el agente dice que no tiene la respuesta.
El suelo es el paso que decide si el agente responde o no.
Un documento cargado se analiza para extraer texto, se divide en fragmentos, se incrusta y se almacena cifrado. Dos detalles de la división importan más de lo que parecen.
El tamaño del fragmento se mide en tokens, pero el texto se divide por caracteres — por lo que la plataforma tiene que convertir entre ellos, y la conversión depende del idioma. Una proporción latina aproximada de ~4 caracteres por token es incorrecta para el chino, japonés y coreano, donde un solo carácter se acerca más a un token completo. Usar una constante global significa que los documentos en CJK (chino, japonés y coreano) obtienen fragmentos varias veces más grandes de lo previsto: los fragmentos desbordan el contexto para el que se dimensionaron, y la recuperación devuelve muros de texto.
El divisor por lo tanto estima la proporción a partir del contenido del propio documento, interpolando entre las proporciones CJK y latinas según la cantidad de texto que sea CJK. Un contrato mixto chino/inglés queda entre ambos extremos en lugar de estar en uno de ellos.
Los párrafos se mantienen completos siempre que sea posible. Los fragmentos se acumulan párrafo a párrafo hasta el tamaño objetivo; solo un párrafo que ya es demasiado grande se divide de forma rígida. Los fragmentos consecutivos se superponen por una cantidad configurable, llevando la cola del fragmento anterior hacia adelante para que un hecho que cruza un límite siga siendo recuperable desde ambos lados.
Los valores predeterminados son chunk_target_tokens y chunk_overlap_tokens en la configuración de la plataforma. Son
ajustables por inquilino en lugar de garantías fijas — el tamaño correcto depende de tus documentos.
Figuras, no solo la capa de texto
La mayoría de las extracciones de documentos se detienen en la capa de texto. Sube un folleto de datos, un manual de instalación o un informe, y una tubería típica extrae la prosa y silencia todo lo que fue dibujado en lugar de escrito — el diagrama de cableado, el diseño de la placa, el gráfico en medio de la página. El archivo fue "procesado"; la mitad de lo que dice nunca se leyó. Pregunta "en qué cabecera está el ventilador de la CPU" y la respuesta no está en el índice, porque solo estaba en una imagen.
Esta plataforma también las lee.
- PDFs escaneados o solo de imagen — sin capa de texto en absoluto — se renderizan página por página y se transcriben por un modelo de visión, por lo que un contrato fotografiado o un formulario escaneado se convierte en texto buscable.
- Documentos mixtos — una capa de texto más figuras — son el caso que otros pasan por alto. Las páginas que llevan una figura real se renderizan y describen por el modelo de visión, y la descripción se integra en el texto del documento para que se fragmente, se incruste y sea recuperable junto con la prosa. Una página de diseño de placa devuelve los nombres de los conectores y dónde se encuentran; un gráfico devuelve la tendencia y los números.
- Imágenes incrustadas en archivos Word se extraen del documento y se describen de la misma manera.
La parte difícil no es llamar a un modelo de visión — es no llamarlo cuarenta veces en la misma barra lateral decorativa. Un manual repite un logotipo y un borde de página en cada página; describirlos sería puro coste y puro ruido. Por lo tanto, la detección de figuras distingue un diagrama genuino (muchas rutas vectoriales, una foto grande, un montaje de imágenes) de la decoración de plantillas (la misma imagen, por contenido, que se repite en las páginas) y solo envía las páginas que llevan información.
Describir figuras utiliza el modelo de visión, por lo que cuesta más que la extracción solo de texto. Dos medidas de seguridad:
un documento con muchas figuras solicita confirmación antes de aumentar la factura, y el gasto de descripción de imágenes aparece como su propia línea — vision_image — en el uso, para que siempre veas dónde fue.
La cabecera de contexto
Un fragmento incrustado por sí solo pierde el hecho de que proviene de un documento en particular. "La cláusula 7.2 se aplica cuando el prestatario está en mora" se recupera mal cuando la consulta es "qué pasa si me salto un pago en el producto puente" — el fragmento nunca dice a qué producto pertenece.
Antes de la incrustación, cada fragmento se antepone con una cabecera de contexto — el título del documento, y opcionalmente una nota situacional generada por LLM — para que el vector refleje tanto el pasaje como de qué es parte. El texto almacenado permanece sin cambios; solo la entrada de incrustación lleva la cabecera.
Reescritura de consultas: la parte que la mayoría de los sistemas omiten
La calidad de la recuperación suele discutirse como un problema de clasificación. A menudo no lo es — a menudo la consulta simplemente no contiene información.
Un cliente pregunta "¿y cuál es la tasa de esa?". El pronombre se refiere a algo dicho hace dos turnos. Incrustar esa frase produce un vector que está cerca de nada en particular, y la recuperación para ese turno es casi aleatoria. Ninguna cantidad de reordenamiento lo arregla, porque la señal nunca estuvo ahí.
Así que antes de la incrustación, una continuación que depende del contexto previo se reescribe en una pregunta autocontenida. Tres decisiones deliberadas:
- Se inclina hacia la activación excesiva. Una expresión regular de expresiones referenciales decide si se intenta una reescritura. Activar innecesariamente cuesta una llamada barata y una pregunta autocontenida vuelve a salir sin cambios; no activar cuesta la recuperación de ese turno por completo.
- Se reescribe en una oración más completa, no en palabras clave. Los modelos de incrustación están entrenados en oraciones. Reducir a palabras clave pierde relaciones ("la responsabilidad del prestatario hacia el prestamista" y su inversa colapsan al mismo vector) y negación ("qué casos no requieren una garantía").
- Solo afecta al vector de recuperación. El mensaje enviado al modelo es siempre la redacción original del cliente. La reescritura nunca entra en el prompt, el historial de conversación o el almacenamiento — y cualquier fallo vuelve a la oración original, por lo que el peor caso es exactamente el comportamiento antiguo.
Búsqueda, y el suelo de relevancia
El vector de consulta se compara por distancia coseno contra fragmentos acotados al espacio de ese usuario final. La acotación no es un filtro a nivel de aplicación que se pueda olvidar — se aplica a nivel de base de datos.
Las coincidencias principales se filtran entonces por una distancia máxima. Esta es la parte que separa un agente útil de uno confiado:
La recepción está atendida de lunes a viernes, de 9:00 a 17:00.
Las citas se reservan con al menos un día laborable de antelación.
Las cancelaciones dentro de las 24 horas se cobran a la mitad de la tarifa.
Fundada en 1998 por dos socios, ahora un equipo de nueve.
Illustrative. Distancias de ejemplo para una clínica ficticia. Los valores reales dependen de tus documentos y del modelo de incrustación — nada aquí está medido, y el suelo es configurable por inquilino.
Devolver menos fragmentos de los solicitados es el resultado correcto, no un defecto. Si nada en tu base de conocimientos es relevante, el agente no recibe nada y lo dice, en lugar de recibir los pasajes menos irrelevantes e inventar un puente entre ellos. Rellenar los resultados hasta un conteo fijo es cómo los sistemas de recuperación producen respuestas fluidas, con apariencia de fuente, pero incorrectas.
El filtro se aplica después de la recuperación ordenada por ranking en lugar de en el predicado SQL — los resultados ya están ordenados por distancia, por lo que el resultado es idéntico, pero mantiene un escaneo de índice limpio en lugar de degradarse en un post-filtro de tabla completa.
Cuando la recuperación tiene éxito y aún así falla
El suelo de relevancia captura el caso donde nada está lo suficientemente cerca. Hay un caso más difícil que no puede ver: cada pasaje supera el suelo, el tema es el correcto, y el único hecho sobre el que la pregunta era no está en ninguno de ellos.
Medido en el propio agente de preventas de este sitio. Preguntado "si estoy en Starter y mi uso crece un 30% al mes, ¿cuánto pagaré en seis meses", la recuperación devolvió tres pasajes: la página del plan Starter, una guía de uso de tokens, y los términos de servicio. Todos relevantes. Ninguno de ellos establece un precio — la página del plan es una página sobre para quién es el plan. Dado un documento titulado "Starter" sin ningún número en él, el modelo proporcionó uno. En cinco ejecuciones produjo $5, $250, $99, $0 y $29, cada uno con un marcador de cita adjunto. La cifra real es $49.
Nada falló de una manera que cualquier cosa pudiera detectar. Las distancias estaban bien, por lo que no hubo un fallo de recuperación para informar. La cita señalaba un pasaje que realmente fue recuperado. Solo la respuesta era incorrecta.
Una segunda pasada, decidida en código
Así que después de la primera búsqueda, se hacen dos preguntas sobre lo que regresó — ambas respondibles con comparaciones de cadenas, ninguna delegada a un modelo:
¿Mencionan siquiera la cosa que se pregunta? Sustantivos propios en la pregunta, más términos extraídos de los títulos de los documentos en tu base de conocimientos — un vocabulario curado por alguien en lugar de uno que adivinamos. Si un término aparece en la pregunta y en ninguno de los pasajes recuperados, ese término se busca por su cuenta.
¿Está el lado de la cosa que se pregunta ahí? Esta es la mitad que la primera comprobación pasa por alto, y la mitad
en la que la medición anterior aterrizó: Starter estaba en el texto recuperado; el precio no. Así que cada pregunta también se compara contra lo que pide por. Algunos de esos tienen formatos rígidos — los precios llevan un símbolo de moneda, las duraciones llevan una unidad de tiempo, los datos de contacto se parecen a un correo electrónico o una URL — y el material que cubre genuinamente ese lado casi nunca omite el formato. Otros (reembolsos, cumplimiento, pruebas, integraciones) no tienen formato, por lo que la señal es la palabra temática en sí misma, escrita por idioma en lugar de dejar que la similitud vectorial haga el puente.
Cuando cualquiera de las comprobaciones queda corta, los términos derivados se buscan una vez más y los resultados se fusionan. Una vez, nunca un bucle. Una falsa alarma cuesta una consulta vectorial — ninguna llamada de modelo extra, ninguna vuelta extra — mientras que un fallo cuesta una cifra inventada con una cita adjunta a ella.
- Starter — para quién esUn libro pequeño y definido de negocios — unas pocas decenas de clientes.sin precio
- Uso de tokens — qué cuentaTu panel muestra el uso como dos colores, prompt y finalización.sin precio
- Términos de servicioPuedes comprar tokens adicionales por adelantado a la tarifa publicada.sin precio
Dos cosas que vale la pena dejar claras. Esto es un suelo bajo la fabricación, no una prueba de corrección — nota que un lado de la pregunta no está representado, no que una respuesta sea correcta. Y no elimina la necesidad de que la base de conocimientos contenga realmente el hecho: la corrección que hizo que el ejemplo de arriba funcionara en producción fue también dar a cada plan un breve documento que establece su precio, porque una pregunta larga sobre crecimiento y exceso de uso superará a una tabla de precios combinada única cada vez.
El descifrado ocurre al final
El contenido de los fragmentos se almacena cifrado por espacio. Solo los fragmentos que realmente coincidieron se descifran, con un cifrado cargado para ese inquilino y usuario — la recuperación opera en vectores, y el texto plano aparece solo para los pasajes que están a punto de usarse.
Cuando la pregunta nombra un número de artículo
La similitud semántica es el instrumento equivocado para una cita. «Artículo 18», «Parte 9», «ISO 9408» — estas cosas no significan nada; identifican algo. Dos filas de una tabla de normas que se diferencian en un dígito son, para un embedding, la misma frase.
Por eso los identificadores de la pregunta se extraen y se buscan como texto, y un pasaje que lleva exactamente el que se pidió queda fijado por delante del orden semántico, que no puede moverlo. Esa última cláusula es todo el asunto, y conviene decirlo claro porque aquí una vez no fue cierta: la protección estaba descrita en el código y nunca implementada, así que un reordenador devolvía el pasaje fijado hacia abajo de la lista. Medido sobre una tabla de normas cuyas filas vecinas difieren en un solo dígito, la única fila que nombraba la parte preguntada quedaba primera con el reordenador apagado y fuera del top 20 con él encendido — y la respuesta salía de la fila de al lado.
De tratar un identificador como identidad y no como significado se siguen dos consecuencias:
Cuando el identificador aparece en más sitios de los que caben en el contexto, la cita ya no se descarta. Antes sí: si «Artículo 18» coincidía con más fragmentos de los que cabían, se tiraba el grupo entero con el razonamiento de que una muestra no es una respuesta. Eso es cierto si tomas los primeros en orden de archivo. No lo es si tomas los más cercanos a la pregunta. Ordenados así en un caso medido, los dos pasajes que la respondían estaban a distancia coseno 0,27 y 0,31, y el ruido empezaba en 0,51 — de modo que el salto mismo dice dónde parar, y no hay que adivinar ningún umbral. Cuando las distancias forman una pendiente suave en vez de un escalón, no se rescata nada: un reparto uniforme significa que los pasajes no son distinguibles, y eso sí es una muestra.
El pasaje más cercano por distancia vectorial siempre entra en el contexto de la respuesta. El reordenamiento puede reordenar; no puede descartar la coincidencia más próxima. En una tanda medida, el reordenador expulsó ese pasaje del contexto en una recuperación de cada siete, y en una muestra revisada a mano el pasaje descartado era a veces el único que respondía a la pregunta. Se añade, no se sustituye: no se desplaza nada para hacerle sitio.
Cuando el modelo pide más material
A veces los pasajes que tiene delante no resuelven la pregunta, y en lugar de responder busca él mismo en la base de conocimiento. Esa acción es la señal. Ha leído el material y ha alargado la mano más allá, así que lo que necesita es el siguiente lote, no el mismo otra vez — que es lo que devuelve una implementación ingenua y lo que no le dice nada.
El siguiente lote ya está en la mano. La recuperación trae un conjunto de candidatos más amplio del que muestra, lo ordena una vez y muestra la parte alta; el resto se guarda exactamente para este momento. Servirlo no cuesta ninguna segunda búsqueda, ninguna segunda ordenación y ninguna segunda pasada de relevancia — solo la llamada al modelo que ya iba a ocurrir. Una primera implementación sí repetía la búsqueda, y en una pregunta convirtió 22 segundos en 71; así se mide el coste de «echar otro vistazo», en vez de suponerlo.
Se sirve una vez por turno. Después, una búsqueda repetida vuelve a comportarse con normalidad, porque «obtendrías los mismos pasajes» también es una señal, y quitarla hace que un modelo cave sin fin.
Un número no es un significado
Todo lo anterior es maquinaria. Esta sección es la parte que tú controlas, y mueve los resultados más que cualquier ajuste en esta página.
La recuperación coincide con el significado. Un valor por sí solo lleva muy poco de él, por lo que un hecho puede estar en tu texto y aún así ser inaccesible — silenciosamente, porque la búsqueda sigue devolviendo algo.
Esta línea apareció en 1.480 de 1.500 fragmentos en un catálogo de cliente real:
Reading level: 1 · Age: 5 · Words: 1951Y "qué libros se adaptan a un niño que acaba de empezar a leer por su cuenta" devolvió un libro sobre
prodigios musicales. 1 no se parece a lector principiante de la manera en que una palabra se parece a otra.
Añadir una frase al lado del valor lo arregló, medido en ese registro:
Reading level: 1 · Age: 5
Suitable for around age 5, for children just starting to read on their own.| consulta | antes | después |
|---|---|---|
| qué libros se adaptan a un niño que acaba de empezar a leer por su cuenta | 0.625 | 0.540 |
| 什么书适合刚开始自己读的孩子 | 0.626 | 0.552 |
| lector principiante edad 5 | 0.598 | 0.498 |
Menor es más cercano, y — ver más abajo — dos pasajes no relacionados se sitúan alrededor de 0.61 en este modelo. Así que la última fila pasa de "apenas mejor que el azar" a una coincidencia real, y la ganancia se mantiene en todos los idiomas.
La regla general: si una pregunta sería respondida por una propiedad en lugar de por la prosa — precio, fecha, nivel, disponibilidad, stock — ponla en palabras además de en un campo. Los valores estructurados son para filtrar; la recuperación encuentra lo que está escrito.
Una cosa que no vale la pena el esfuerzo, porque lo medimos: las exportaciones a menudo se repiten a sí mismas (un
summary y un description con prosa idéntica). Eliminar la duplicación cambió la distancia de recuperación en +0.002 en 60 registros — nada. Una incrustación es una dirección, no un presupuesto que el texto repetido consume.
La distancia no es una puntuación, y no es comparable entre modelos
Una cosa más que vale la pena saber antes de leer cualquier figura de distancia. Los modelos de incrustación comprimen el texto en un
cono estrecho, y qué tan estrecho difiere por modelo. En el modelo que esta plataforma ejecuta hoy, dos
pasajes completamente no relacionados se sitúan aproximadamente 0.61 apartados — así que un acierto en 0.52 es una coincidencia fuerte, no una débil, y 0.5 no es un corte significativo en ninguna parte.
Dos consecuencias prácticas:
- Julga una distancia contra la línea base no relacionada, nunca contra un número que recuerdes de otro lugar. El mapa estelar de conocimientos en la consola marca esa línea base en su escala exactamente por esta razón.
- Las preguntas más largas recuperan mejor que las palabras clave. Una sola palabra contra un pasaje de 900 caracteres es una señal débil incluso cuando el pasaje trata literalmente sobre esa palabra; una pregunta completa es una coincidencia mucho más cercana. Los usuarios reales escriben oraciones, que es el buen caso — pero si pruebas con consultas de una sola palabra, espera que los números se vean peores de lo que el sistema realmente rinde.
Lo que la recuperación no puede hacer, y qué responde a esas preguntas en su lugar
Todo lo anterior trata de encontrar el pasaje que responde a una pregunta. Tres tipos de pregunta no tratan de un pasaje en absoluto, y ninguna cantidad de ajuste hace que la búsqueda por similitud las responda:
- Conteo — "cuántos tienes", "cuántos son no ficción"
- Filtrado numérico — "cuáles tienen menos de 200 palabras", "entre 1000 y 2000"
- Agrupación — "cuántos por categoría", "qué autor aparece más"
Estos fallan de una manera fácil de pasar por alto. Preguntado "hay alguno por unas 500 palabras", un agente con solo búsqueda vectorial informará sobre el registro que happened to estar en sus primeros pocos — una declaración verdadera sobre cuatro documentos, presentada como una declaración sobre la colección.
El índice estructurado
Una base de conocimientos puede por lo tanto llevar una segunda tabla pequeña junto a sus vectores: una fila por documento, construida a partir de los campos que los documentos ya contienen. Los valores se copian carácter por carácter — no se genera nada, no se reescribe nada.
Con ella, el agente elige la herramienta que se adapta a la pregunta:
| Pregunta | Respondida por |
|---|---|
| "¿algo sobre dinosaurios?" | búsqueda vectorial |
| "¿cuántos tienes?" | la tabla |
| "sobre dinosaurios, adecuado para un niño de cinco años" | los filtros de la tabla, la búsqueda vectorial clasifica |
| "¿cuál es el enlace?" | la tabla, citada exactamente |
Los campos son propuestos leyendo unos pocos de tus documentos y luego verificados contra toda la colección: un campo encontrado en solo una quinta parte de ellos se descarta e informa, porque filtrar por él omitiría silenciosamente el resto. Construir o cambiar el índice no vuelve a incrustar nada — los valores se leen de un texto que ya está almacenado — por lo que no altera la recuperación que ya está funcionando.
Los documentos que no comparten una cabecera legible por máquina no obtienen índice, y la plataforma lo dice en lugar de construir una tabla cuyos valores son todos diferentes. Eso no es una limitación para sortear: una tabla así no se puede contar o agrupar de manera significativa, y tenerla solo invitaría a preguntas que responde mal.
Por qué un enlace en una respuesta pertenecía al artículo equivocado
Hay un segundo fallo, más silencioso, que la misma tabla corrige.
La recuperación devuelve fragmentos, pero un título, un código de producto, un enlace y una imagen viven en el encabezado del documento — es decir, en el fragmento 1, mientras que el pasaje que respondió a la pregunta puede ser el fragmento 7. Así que el modelo recibe cuatro o cinco fragmentos de tres o cuatro documentos y tiene que averiguar a qué enlace pertenece a qué título.
Cuando se equivoca, nada parece incorrecto. El enlace es real, se abre, la imagen se renderiza — simplemente pertenece a un artículo diferente. En un catálogo de 4.500 documentos, 11 de 20 respuestas de prueba emparejaron un título con el enlace de otro documento.
Los campos que marcas como exactos — el enlace, la imagen, el identificador — ahora nunca se muestran al modelo en absoluto. Recibe un marcador de posición, escribe el marcador de posición, y la plataforma sustituye el valor almacenado en la salida. Un modelo no puede equivocarse al teclear una dirección que nunca vio. Las mismas 20 preguntas regresaron 20 de 20 correctas.
Qué enlace es el enlace para enviar a un cliente es un hecho de negocio que tus datos no establecen, por lo que tú nombras esos campos tú mismo; todo lo demás se propone para ti. Más en Índice estructurado.
Cuando tu material genuinamente no tiene respuesta
A veces la respuesta honesta es "eso no está en tu material", y a veces eso es el final de una conversación útil. Fallback de fuente pública es una alternativa opt-in, por agente: cuando la recuperación no encuentra nada, el agente puede buscar en la web, leer una de las páginas que encuentra, y responder desde eso.
Está apagado a menos que lo enciendas, y tres cosas son ciertas siempre que esté encendido.
Leer la página es parte de ello, no un extra. Un resultado de búsqueda es un título y un resumen de dos líneas, y las cifras que importan — un período de validez, una tarifa, una fecha límite — suelen estar solo en el cuerpo. Una página en nuestro conjunto de evaluación establece "válido por cinco años" en su fragmento y "renovación antes: 9 meses" solo en la página misma. Dado solo el resumen, un modelo tiene la pista sin el hecho, y llena el vacío desde la memoria. Así que un interruptor habilita tanto la búsqueda como la lectura; habilitar solo la búsqueda es mediblemente la peor configuración, no una más conservadora.
Buscar sin leer no es un resultado permitido. Si el agente busca y luego responde sin abrir una página, la plataforma lo hace volver a leer una antes de que se entregue la respuesta. La diferencia no es académica: preguntado quién dirige actualmente el PMDA de Japón, los resúmenes solos produjeron un nombre equivocado confiado; la misma pregunta con la página leída produjo el correcto.
Cualquier cosa de una página pública está etiquetada, y puedes ver qué buscó. El marcador de cita es de un color diferente, el panel muestra el dominio y establece claramente que esta es una fuente pública en lugar de tu material, y la distinción es aplicada por la plataforma — no se le pide al modelo, que olvidaría en exactamente la ocasión que importaba.
Las páginas que el agente leyó y los resultados que solo encontró se listan ambos, dibujados de manera diferente (sólido versus discontinuo) y etiquetados de manera diferente, porque son grados diferentes de evidencia. Una versión anterior mostraba solo las páginas que leyó, y el efecto fue el opuesto de la intención: en un turno donde la recuperación falló, la respuesta vino de resúmenes y llevó ningún marcador de fuente en absoluto — visualmente idéntico a una respuesta de tu propio material. Ocultar la evidencia más débil ocultó el hecho de que la evidencia era débil.
Cada una de estas respuestas aterriza en una cola de revisión, bajo Revisión de conocimientos en la consola. Pregunta, respuesta, URL de origen, una instantánea de la página tal como la leyó, y cualquier cifra que la verificación de salida no pudo rastrear a una fuente.
Lo que se escribe cuando apruebas es una entrada fresca, reescrita a partir de la pregunta y el material — no la respuesta que recibió el visitante. La respuesta se dirigió a una persona y se moldeó por esa conversación: abre con su nombre, se refiere a "tus líneas de productos", y termina con un llamado a la acción. Archivarla tal cual, el contexto privado de un visitante se convierte en la respuesta de todos. Así que la entrada se regenera sin ninguno de ello, con el título escrito a partir del material en lugar de a partir de la pregunta — una pregunta redactada "…sobre mi producto" es un título que lleva silenciosamente el contexto de alguien a un lugar donde los títulos pesan mucho en la recuperación. Las direcciones de correo electrónico y los números de teléfono se enmascaran antes de que se almacene nada. Ves la entrada reescrita, la editas si quieres, y apruebas eso.
Rechazar mantiene el registro, para que la misma página no se vuelva a revisar el próximo mes.
El número que preferiríamos que supieras
Medido en 24 preguntas que la base de conocimientos genuinamente no podía responder, ejecutadas tres veces: las respuestas rastreables a una fuente real pasaron de 8% a 33%, y las cifras que no pudimos rastrear a ninguna fuente cayeron de 13 a 6. Ese segundo número no es cero. Aproximadamente una respuesta de cada doce aún lleva una cifra que no podemos explicar, por lo que la verificación de hechos se envía con la función en lugar de después, y por lo que la cola de revisión existe en absoluto.
Lo que esto significa en la práctica
- Los conjuntos de documentos multilingües no se degradan silenciosamente — el fragmentador se adapta al guion.
- Un diagrama o gráfico dentro de un documento es respondible, no se descarta silenciosamente con el resto de la imagen.
- Las preguntas de continuación se recuperan tan bien como las preguntas de apertura.
- El "no tengo eso" honesto del agente es un resultado diseñado del suelo de relevancia.
La calidad de la recuperación depende mucho más de lo que subes que de cualquier parámetro aquí. Ver Espacios y conocimientos para cómo organizar una base de conocimientos, y Socios si preferirías que alguien lo hiciera contigo.