Diagnosticar problemas en las salidas de los LLM: cuándo usar prompts, recuperación o ajuste fino
Un enfoque basado en los síntomas para determinar si una función de IA deficiente necesita un prompt mejor, una capa de recuperación o ajuste fino, y por qué entrenar un modelo con hechos tiene efectos negativos.
La primera versión de cualquier función de IA genera resultados que no son del todo correctos. Existen tres formas de solucionarlo: cambiar las instrucciones, proporcionarle al modelo los documentos que le faltan o volver a entrenarlo con sus propios ejemplos. Estas opciones difieren enormemente en costo, desde unos minutos de trabajo hasta semanas de recolección de datos, y cada una soluciona un tipo diferente de problema. Esta guía le ofrece un enfoque basado en los síntomas para elegir la solución adecuada, de modo que evite perder semanas intentando arreglar algo que el problema nunca requirió.
Trate al modelo como a un empleado nuevo y capaz
Un modelo mental útil es pensar en el modelo como un empleado muy competente en su primer día de trabajo. Conoce una cantidad impresionante sobre el mundo en general, pero no sabe nada sobre su empresa: ni sobre sus productos, ni sobre sus políticas, ni sobre la forma en que su equipo prefiere que se redacten las respuestas. Cometerá errores, al igual que cualquier recién llegado talentoso.
Puede ayudar a ese nuevo empleado de exactamente tres maneras. Puede brindarle una información más detallada, entregarle el material de referencia o enviarlo a un curso de capacitación. Estas opciones corresponden a la inducción, la recuperación de información y el ajuste fino, y están ordenadas del método más económico al más costoso. La habilidad radica en adaptar la intervención al problema, por lo que tiene sentido considerarlas en ese orden.
Inducción: reescriba primero la información inicial
Siempre comience aquí. Una indicación es simplemente las instrucciones que envía junto con la solicitud: la tarea en sí, uno o dos ejemplos de una buena respuesta, para quién es la respuesta y el formato que espera recibir. Cambiarla no cuesta nada y solo toma unos minutos. Una gran parte de las quejas de que “la IA es mala” resultan ser quejas por el hecho de que la indicación era vaga.
Supongamos que las respuestas de su función son largas y formales. No es necesario volver a entrenarla. Agregue una instrucción como “responda en tres oraciones, con un tono cálido y sencillo”, pegue una buena respuesta de ejemplo y, por lo general, el problema se resuelve en una sola iteración. Las instrucciones permanentes que establece para cada solicitud se denominan prompt del sistema; las respuestas de ejemplo que incluye para demostrar un patrón se conocen como ejemplos de pocos casos.
No obstante, el uso de prompts tiene un límite claro: las instrucciones no pueden proporcionar conocimiento que el modelo nunca haya visto. Si al nuevo empleado nunca se le han mostrado las cifras de este trimestre, pedirle que “sea más preciso” no generará esas cifras. Cuando la verdadera carencia es información, se necesita el segundo enfoque.
Una verificación rápida antes de continuar
Antes de concluir que la inducción ha fallado, asegúrese de haber probado las mejoras obvias: especifique explícitamente el formato de salida, proporcione al menos un ejemplo concreto, indique qué hacer cuando la respuesta es desconocida y pruebe con un pequeño conjunto fijo de entradas reales en lugar de uno o dos casos seleccionados a mano. Sin ese conjunto fijo, es difícil saber si un cambio realmente ayudó.
Recuperación: entregar los archivos
La generación ampliada por recuperación de información, abreviada habitualmente como RAG, permite que el modelo acceda a sus documentos en el momento de responder: la lista de precios actual, la política de devoluciones, el historial de pedidos de un cliente en particular. Soluciona cualquier conocimiento que falte, cambie con frecuencia o sea privado de su organización. Cuando se actualiza un documento, las respuestas también cambian sin necesidad de volver a entrenar al modelo. Es la opción adecuada siempre que el conocimiento le pertenezca, cambie con frecuencia o necesite ser citado. La distinción entre lo que un modelo ha memorizado en sus pesos y lo que consulta en el momento de responder se explica con más detalle en cómo difieren la memoria, el contexto, las incrustaciones y los pesos del modelo en la IA.
En el caso de los nuevos empleados, ya no se trata de darles conferencias; se les entrega el manual y se les permite consultarlo antes de responder. Ahora pueden contestar preguntas sobre cambios que ocurrieron mucho después de que se entrenara el modelo, y pueden indicar con exactitud de dónde proviene cada respuesta.
El costo es mayor que un simple ajuste en la instrucción. Se está creando un pequeño sistema que almacena documentos y los busca por su contenido, lo cual generalmente implica días de trabajo en lugar de minutos. Aun así, sigue siendo mucho más económico que el ajuste fino del modelo, y el sistema se mantiene actualizado al igual que los documentos. También añade componentes móviles que ahora hay que mantener: cómo se dividen los documentos, cómo se mide la calidad de la búsqueda y qué ocurre cuando no se encuentra nada relevante.
La recuperación de información tiene sus propios límites claros. Un documento llena las lagunas en lo que sabe el modelo; no cambia su forma de comportarse. Entregarle a alguien el manual no modifica su estilo de escritura ni su juicio. Para eso, hay que entrenarlos.
Afinación: envíelos a un curso de entrenamiento
La afinación vuelve a entrenar al modelo con numerosos ejemplos hasta que un estilo o habilidad se vuelve automático. Es la herramienta para lograr un comportamiento consistente cuando los prompts no logran obtenerlo, o en los casos en que el prompt ya forma una página entera de reglas y sigue siendo poco fiable. Imagine necesitar que cada respuesta siga una voz de marca muy específica en un millón de conversaciones, sin que ninguna se desvíe. El entrenamiento con miles de ejemplos puede hacer que ese comportamiento sea el predeterminado, sin necesidad de instrucciones adicionales.
Lo que la gente suele entender mal es lo siguiente: el ajuste fino modifica el comportamiento del modelo, no lo que sabe. Es lento y costoso, requiere una cantidad considerable de datos de ejemplo, y cualquier información factual que se incluya se vuelve obsoleta en cuanto esos hechos cambian. Por lo tanto, no debe utilizarse para almacenar datos; a eso sirve la recuperación de información. Es la opción de entrenamiento entre las tres: poderosa cuando el problema es realmente de comportamiento, pero inútil para cualquier situación que se podría resolver con una explicación más clara. Para conocer un análisis detallado de los costos asociados a esta decisión, consulte el costo de un modelo ajustado frente a una llamada a API.
Elegir según los síntomas
Comience con una sola pregunta: ¿qué es exactamente lo que está mal en el resultado?
- El formato o el tono no son adecuados, o el modelo ignora partes de tus instrucciones. Eso es un problema de formulación, así que mejora el prompt.
- Falta un dato o está desactualizado, el modelo cita la versión incorrecta de algo, o necesitas que muestre su fuente. Eso es un problema de conocimiento, así que agrega funcionalidades de recuperación de información.
- Los datos son correctos, pero el comportamiento no es consistente independientemente de cómo formules la solicitud, y necesitas que sea fiable en miles de respuestas. Eso es un problema de comportamiento, así que considera el ajuste fino del modelo.
Los síntomas determinan la solución. Hay dos puntos más que es fácil pasar por alto.
Las herramientas se complementan en lugar de competir
Casi todas las funcionalidades comienzan con una instrucción. Muchas añaden posteriormente la recuperación de información cuando necesitan datos en tiempo real o privados, y un número menor incluye ajustes finos para lograr un comportamiento que la instrucción por sí sola no puede garantizar. Por lo general, usted decide qué capa añadir a continuación, en lugar de elegir un único enfoque para siempre. Un modelo ajustado con fines específicos sigue recibiendo instrucciones, y un sistema RAG sigue dependiendo de indicaciones que le indiquen al modelo cómo utilizar la información recuperada.
Solo vaya tan lejos como lo requiera el síntoma
Dado que las opciones van de las más económicas a las más caras en ese orden, deténgase en la primera que resuelva el problema. El mismo razonamiento aplica antes de construir cualquier cosa: si la tarea depende de datos que cambian, planifique la recuperación de información; si se necesita un comportamiento preciso a un volumen muy alto, los ajustes finos podrían justificarse con el tiempo; todo lo demás comienza con una instrucción.
El error costoso: ajustar modelos para enseñar hechos
El error que merece ser señalado explícitamente es recurrir al ajuste fino para hacer que el modelo conozca algo. Parece ser una opción seria y compleja desde el punto de vista ingenieril, y precisamente por eso los equipos la eligen primero. Pero un hecho que está en constante cambio no debe formar parte de los hábitos del modelo; pertenece a un documento al que el modelo pueda recurrir. Si lo haces al revés, podrías pasar semanas enseñando al modelo un hecho que ya estará incorrecto para cuando lo lances, sin una forma sencilla de mostrar de dónde proviene la respuesta.
Otra trampa relacionada es realizar ajustes finos para corregir lo que en realidad es una instrucción vaga. Si aún no has probado instrucciones de formato explícitas y algunos ejemplos claros con un conjunto de pruebas fijo, aún no sabes si realmente tienes un problema de comportamiento.
Puntos clave
- Diagnostica antes de invertir: determina si el fallo se debe a las instrucciones, al conocimiento o al comportamiento.
Lecturas relacionadas
- ¿Ajustar fino o usar la API? El costo de un pipeline de extracción de documentos — Un modelo de costos detallado para un pipeline de documentos de auditoría muestra por qué la enrutización de modelos es más económica que el ajuste fino, y cuándo la precisión del esquema o la residencia de datos en la UE justifican poseer un modelo.
- Seis conceptos de IA que te indican qué revisar antes de confiar en una respuesta — Tokens, ventanas de contexto, temperatura, alucinaciones, RAG y agentes explicados como herramientas de verificación, para que puedas detectar errores, controlar costos y evaluar las afirmaciones de los productos de IA.
- Servir un LoRA fine-tune localmente: verificar, fusionar y evitar fallos silenciosos — Demuestra que un adaptador LoRA realmente mejoró un modelo pequeño, únelo y síguelo ofreciendo a través de una API local compatible con OpenAI, además de detectar las fallas que generan resultados incorrectos aunque se muestre confianza.