Что такое RAG (генерация с дополненным поиском)?
RAG, или генерация с дополненным поиском, — это AI-паттерн, при котором модель сначала достаёт релевантные пассажи из источника, а потом порождает ответ, опираясь на них.
Обычная большая языковая модель отвечает по своим тренировочным данным — а они зафиксированы в момент обучения и склонны к галлюцинациям. RAG исправляет это, добавляя шаг поиска: при вопросе пользователя система ищет в корпусе (книге, PDF, базе знаний) наиболее релевантные пассажи, передаёт их модели как контекст — и только потом просит ответить.
Чат с саммари и доступным контекстом источника
Качество RAG зависит от трёх вещей: как источник разбит на чанки (абзац, секция, предложение), как чанки превращаются в эмбеддинги для поиска и как модель просят использовать найденный контекст. Слабое звено в любом из трёх рождает ответы, которые формально привязаны к источнику, но фактически ошибочны.
Чат с саммари и доступным контекстом источника
Узнать больше о SummioЧастые вопросы
Чем RAG отличается от файн-тюнинга?
Файн-тюнинг «зашивает» новые знания в веса модели — медленно, дорого, обновлять можно только переобучением. RAG оставляет модель неизменной и меняет контекст, передаваемый на каждый запрос: чтобы обновить знание, достаточно переиндексировать документ, переобучать модель не нужно.
Уберёт ли RAG галлюцинации?
Поиск фрагментов может лучше привязать ответ к источнику, но не устраняет галлюцинации. Модель может неверно прочитать или проигнорировать фрагмент либо ошибочно соединить верные детали; важное сверяйте с оригиналом.
Где применяется RAG?
В AI-поисковиках (Perplexity, ChatGPT search, Claude с веб-доступом), в чатах поверх корпоративных документов, в саппорт-ботах поверх базы знаний и в читательских приложениях вроде Summio — везде, где ответ должен опираться на конкретный источник.
