Inicio / Artículos / Dividir los documentos en partes según la evidencia y la respuesta necesarias

Dividir los documentos en partes según la evidencia y la respuesta necesarias

Elige los límites de los bloques examinando qué hechos deben ir juntos, y luego prueba la recuperación con un presupuesto de contexto fijo.

592 palabras

Imagínese preguntando a un manual de despliegue cuándo se debe revertir un servicio. La búsqueda devuelve la instrucción de reversión, pero la excepción está en el siguiente fragmento: dicha instrucción solo se aplica después de que falle un control de estado específico. El texto recuperado es relevante, pero la respuesta aún puede ser incorrecta.

Este es el problema central del fragmentación. La unidad que es fácil de indexar puede diferir de la unidad que es suficiente para explicar algo.

Antes de ajustar un modelo de embedding, examine qué es lo que sus fragmentos permiten ver al modelo.

Comience con la estructura que realmente tiene

Para un artículo técnico, un encabezado y sus párrafos constituyen un punto de partida razonable. Un ejemplo de código debe ir acompañado de la explicación de sus suposiciones. Una tabla necesita suficientes etiquetas para interpretar los valores. Una excepción debe encontrarse cerca de la regla que modifica.

Eso depende de recuperar un texto de fuente fiable. Si su analizador ya ha convertido una tabla en una secuencia ambigua, los fragmentos más pequeños solo distribuirán esa ambigüedad.

Un primer paso práctico es dividir el texto en los límites de las secciones, agrupar los párrafos adyacentes dentro de un límite de tamaño establecido y dividir las secciones demasiado grandes en los límites de las oraciones. Los bloques de código y las tablas requieren un tratamiento especial cuando exceden ese límite; se debe conservar su estructura y repetir las etiquetas necesarias para interpretar cada parte.

Este es un diseño inicial, no la solución óptima universal. Un glosario y un informe de incidentes organizan las pruebas de manera diferente.

Use la superposición por una razón específica

La superposición puede conservar una oración que de lo contrario quedaría dividida por un límite. También introduce texto repetido. Con suficiente superposición, varios resultados principales pueden contener prácticamente el mismo párrafo, agotando el presupuesto de contexto sin aportar evidencia adicional.

Mida tanto la cobertura útil como la relevancia de cada fragmento individual. Si los cinco fragmentos recuperados explican todos el desencadenante de la reversión pero ninguno incluye la excepción, recuperar más del mismo texto no resuelve el problema.

Después de la recuperación, identifique los pasajes superpuestos del mismo origen y únelos o elimine las duplicadas antes de elaborar la solicitud. Mantenga sus ubicaciones originales para que las citaciones sigan siendo rastreables.

Recupere de forma selectiva y amplíe intencionadamente

Un pasaje corto puede ser un buen objetivo de búsqueda porque se centra en una sola idea. La sección circundante puede ser un contexto de generación mejor, ya que proporciona definiciones y especificaciones.

Un diseño posible consiste en asignar a cada fragmento pequeño un identificador de sección padre. Se busca en las unidades más pequeñas y, cuando la respuesta necesita más contexto, se expanden los resultados seleccionados a sus secciones padre. La expansión sigue requiriendo recursos; cargar todo el documento para cada resultado simplemente traslada el problema original a un nivel posterior.

En el manual de implementación, el resultado de búsqueda podría identificar la condición para revertir cambios. La sección padre puede entonces proporcionar la excepción y los pasos de recuperación. De este modo, la respuesta cuenta con una explicación coherente sin que sea necesario que el sistema clasifique un fragmento enorme del documento.

Comparar configuraciones con las mismas preguntas

Crea preguntas que revelen los límites: una definición, una comparación entre párrafos, una búsqueda en tabla y una regla con excepción. Etiqueta la evidencia que requiere cada respuesta.

Compara una línea de base simple de tamaño fijo con tu versión que tenga en cuenta la estructura. Mantén constante el corpus, las preguntas y el presupuesto de contexto final. Examina si cada configuración obtiene suficiente evidencia, cuánta duplicación introduce y qué respuestas siguen siendo imposibles a partir del contexto proporcionado.

No confundas las palabras con los tokens del modelo al establecer presupuestos de producción. Un divisor de conteo de palabras es útil para un prototipo; el prompt final debe adaptarse al tokenizador y a los límites del modelo que lo procesará.

Una vez que las unidades de evidencia son fiables, la búsqueda híbrida puede ayudar a los usuarios a encontrarlas tanto mediante terminología exacta como en lenguaje cotidiano. Una mejor recuperación de información es especialmente útil cuando los fragmentos devueltos ya merecen ser leídos.