Універсальна мовна модель багато знає про світ, але нічого - про ваші ціни, договори та внутрішні правила. Генерація з пошуком, або RAG, закриває цю прогалину без навчання нової моделі.
Як це працює
RAG додає перед відповіддю крок пошуку. Ваші документи - статті бази знань, регламенти, описи продуктів, попередні відповіді клієнтам - діляться на невеликі фрагменти й індексуються за змістом. Коли надходить запитання, система знаходить найдоречніші фрагменти й передає їх моделі разом із запитанням. Модель пише відповідь на основі цього матеріалу, в ідеалі - з посиланнями на використані джерела.
Коли RAG - правильний вибір
RAG добре підходить, коли інформація часто змінюється й має залишатися точною: каталоги товарів, база знань підтримки, внутрішні процедури, юридична чи технічна документація. Щоб оновити асистента, достатньо оновити документи - перенавчання не потрібне. Його також простіше контролювати: видно, які фрагменти використовувалися, і відповідь можна звірити з ними.
Що зазвичай іде не так
Більшість проблем пов’язана з даними, а не з моделлю. Застарілі чи суперечливі документи дають суперечливі відповіді. Величезні неструктуровані файли погано діляться на фрагменти, і пошук повертає нерелевантні шматки. Часто забувають про права доступу: асистент для клієнтів не повинен бачити внутрішні документи. І нарешті, без набору тестових запитань із відомими правильними відповідями ніхто не може сказати, чи стала система кращою чи гіршою після змін.
З чого почати
Оберіть одну зрозумілу область, наприклад відповіді на сто найчастіших запитань клієнтів. Упорядкуйте документи з цієї теми, визначте, хто що може бачити, підготуйте двадцять-тридцять тестових запитань і виміряйте, як часто асистент відповідає правильно й посилається на потрібне джерело. Лише після цього розширюйтеся на нові теми.
Коротко
RAG перетворює універсальну модель на асистента, який говорить мовою ваших документів. Його якість значно більше залежить від чистих даних, продуманих прав доступу та регулярного тестування, ніж від вибору моделі.