Um modelo de linguagem genérico sabe muito sobre o mundo, mas nada sobre os seus preços, contratos ou regras internas. A geração aumentada por recuperação, ou RAG, fecha essa lacuna sem treinar um novo modelo.
Como funciona
O RAG acrescenta um passo de pesquisa antes da resposta. Os seus documentos - artigos da base de conhecimento, políticas, descrições de produtos, respostas anteriores a clientes - são divididos em pequenos fragmentos e indexados pelo significado. Quando chega uma pergunta, o sistema encontra os fragmentos mais relevantes e envia-os ao modelo juntamente com a pergunta. O modelo escreve a resposta com base nesse material, idealmente com ligações às fontes usadas.
Quando o RAG é a escolha certa
O RAG funciona bem quando a informação muda com frequência e tem de se manter exata: catálogos de produtos, conhecimento de apoio ao cliente, procedimentos internos, documentação jurídica ou técnica. Para atualizar o assistente basta atualizar os documentos, sem novo treino. Também é mais fácil de controlar: vê-se que fragmentos foram usados e pode verificar-se a resposta.
O que costuma correr mal
A maioria dos problemas vem dos dados, não do modelo. Documentos desatualizados ou contraditórios geram respostas contraditórias. Ficheiros enormes e sem estrutura são mal divididos e a pesquisa devolve excertos irrelevantes. As permissões são muitas vezes esquecidas: um assistente para clientes não deve ver documentos internos. E sem um conjunto de perguntas de teste com respostas corretas conhecidas, ninguém consegue dizer se uma alteração melhorou ou piorou o sistema.
Por onde começar
Escolha uma área clara, por exemplo as respostas às cem perguntas mais frequentes dos clientes. Organize os documentos dessa área, defina quem pode ver o quê, prepare vinte ou trinta perguntas de teste e meça com que frequência o assistente responde corretamente e cita a fonte certa. Só depois alargue a novos temas.
Em resumo
O RAG transforma um modelo genérico num assistente que fala a partir dos seus documentos. A sua qualidade depende muito mais de dados limpos, permissões bem pensadas e testes regulares do que da escolha do modelo.