Inicio / Artículos / Su pipeline RAG comienza antes del primer embedding.

Su pipeline RAG comienza antes del primer embedding.

Cree un inventario de fuentes que distinga las pruebas utilizables del texto faltante, las atribuciones defectuosas y la extracción incompleta.

553 palabras

Un sistema de búsqueda puede devolver una respuesta coherente a partir de un documento que nunca debería haber formado parte de su conjunto de evidencias. El título puede pertenecer a una página mientras que la URL apunta a otra. Una página guardada podría contener solo una vista previa. Una tabla puede quedar tras la extracción como una lista de números sin sus etiquetas.

Incluir esos datos hace que sean buscables, pero no los vuelve fiables.

Para una aplicación de conocimiento, comenzaría con un inventario de fuentes: un registro de lo que se recopiló, de lo que realmente se extrajo y de qué puede respaldar de manera segura una respuesta. Ese inventario también facilita la revisión del flujo de trabajo de publicación basado en artículos, ya que cada borrador puede remitir a una versión específica de sus evidencias.

Separar el descubrimiento de las evidencias

Un título, el autor y una breve descripción son metadatos útiles para la búsqueda. Te ayudan a decidir qué artículo leer a continuación. No son suficientes para reconstruir el argumento del artículo, verificar sus ejemplos o indicar a qué conclusiones llegó su autor.

Indica explícitamente la disponibilidad del contenido. Los estados útiles incluyen solo metadatos, texto extraído con nivel de completitud desconocido, texto completo verificado y conflicto de identidad. Evita usar un único indicador indexed: true que oculte estas cuatro situaciones.

Un registro mínimo podría verse así:

{
  "source_id": "article-42",
  "canonical_url": "https://example.com/article-42",
  "content_status": "extracted_text",
  "completeness": "unverified",
  "content_hash": "sha256-of-extracted-text",
  "retrieved_at": "2026-09-17T12:00:00Z"
}

El hash identifica la versión del texto. No es una medida de su veracidad. De igual manera, una extracción extensa es evidencia de que existe texto disponible, pero no prueba que no haya sido modificado por un muro de pago, un error en el analizador o un bloqueo de navegación.

Preserva las relaciones que aportan significado

El análisis de documentos y su división en fragmentos resuelven problemas diferentes. El análisis debe recuperar la estructura; la división en fragmentos determina cómo dividirla. Si el proceso de extracción separa un valor de tabla de su encabezado de columna, un divisor posterior no puede reconstruir con fiabilidad esa relación perdida.

Considere una guía de mantenimiento que enumera un componente, su intervalo de inspección y las condiciones bajo las cuales ese intervalo cambia. Guardar solo el intervalo proporciona una respuesta convincente, pero incompleta. Preservar las etiquetas y las excepciones juntas es necesario antes de considerar la similitud vectorial.

Por esta razón, los límites de los fragmentos requieren un diseño explícito. Un divisor no puede compensar por evidencias que desaparecieron anteriormente.

Hacer visibles los fallos sin descartar el inventario

Mantenga los registros problemáticos accesibles para fines de mantenimiento, pero exclúyalos del conjunto de pruebas utilizado para redactar respuestas o publicaciones. Registre la razón: identificador no coincidente, ausencia de texto, idioma incierto o fallo en la extracción.

Esa distinción permite dos flujos de trabajo diferentes. Una búsqueda de mantenimiento busca qué necesita reparación, mientras que una búsqueda de respuestas determina qué fuentes son adecuadas para respaldar una afirmación. No deben devolver silenciosamente la misma información.

Para publicaciones, añada otra verificación: lea los fragmentos que pretende utilizar. Una fuente puede ser relevante para el tema pero no servir para respaldar la conclusión específica en su borrador.

Pruebe la calidad de las fuentes como parte del producto

Cree una pequeña colección de entradas intencionadamente problemáticas: un avance de artículo, una URL redirigida, una página de dos columnas, una tabla con notas al pie y dos versiones del mismo documento. Verifique el resultado extraído antes de medir la relevancia en las búsquedas.

El flujo de trabajo de evaluación más amplio debe distinguir entre la falta de evidencia, una clasificación deficiente y una generación sin soporte. De lo contrario, un problema de recuperación podría hacer que vuelva al prompt, mientras que el verdadero defecto permanece en el inventario de fuentes.

El primer hito útil es sencillo: cada registro debe explicar qué está disponible y de dónde proviene. Una vez que esto se cumpla, será más fácil interpretar las mejoras posteriores.