Un modelo de lenguaje general sabe mucho del mundo, pero nada de tus precios, contratos o normas internas. La generación aumentada por recuperación, o RAG, cubre ese hueco sin entrenar un modelo nuevo.
Cómo funciona
RAG añade un paso de búsqueda antes de la respuesta. Tus documentos -artículos de la base de conocimiento, políticas, descripciones de productos, respuestas anteriores a clientes- se dividen en fragmentos pequeños y se indexan por significado. Cuando llega una pregunta, el sistema encuentra los fragmentos más relevantes y se los pasa al modelo junto con la pregunta. El modelo redacta la respuesta a partir de ese material, idealmente con enlaces a las fuentes utilizadas.
Cuándo RAG es la opción adecuada
RAG funciona bien cuando la información cambia a menudo y debe mantenerse exacta: catálogos de productos, conocimiento de soporte, procedimientos internos, documentación legal o técnica. Para actualizar el asistente basta con actualizar los documentos, sin reentrenar. Además es más fácil de controlar: se ve qué fragmentos se usaron y se puede contrastar la respuesta con ellos.
Qué suele fallar
La mayoría de los problemas vienen de los datos, no del modelo. Documentos desactualizados o contradictorios generan respuestas contradictorias. Archivos enormes sin estructura se dividen mal y la búsqueda devuelve fragmentos irrelevantes. A menudo se olvidan los permisos: un asistente para clientes no debe ver documentos internos. Y sin un conjunto de preguntas de prueba con respuestas correctas conocidas, nadie puede saber si un cambio mejoró o empeoró el sistema.
Cómo empezar
Elige un área concreta, por ejemplo las respuestas a las cien preguntas más frecuentes de los clientes. Ordena los documentos de esa área, define quién puede ver qué, prepara veinte o treinta preguntas de prueba y mide con qué frecuencia el asistente responde bien y cita la fuente correcta. Solo después amplía a nuevos temas.
En resumen
RAG convierte un modelo general en un asistente que habla a partir de tus documentos. Su calidad depende mucho más de datos limpios, permisos bien pensados y pruebas regulares que de la elección del modelo.