Глоссарий

Что такое RAG (генерация с дополненным поиском)?

RAG, или генерация с дополненным поиском, — это AI-паттерн, при котором модель сначала достаёт релевантные пассажи из источника, а потом порождает ответ, опираясь на них.

Обычная большая языковая модель отвечает по своим тренировочным данным — а они зафиксированы в момент обучения и склонны к галлюцинациям. RAG исправляет это, добавляя шаг поиска: при вопросе пользователя система ищет в корпусе (книге, PDF, базе знаний) наиболее релевантные пассажи, передаёт их модели как контекст — и только потом просит ответить.

Чат с саммари и доступным контекстом источника

Качество RAG зависит от трёх вещей: как источник разбит на чанки (абзац, секция, предложение), как чанки превращаются в эмбеддинги для поиска и как модель просят использовать найденный контекст. Слабое звено в любом из трёх рождает ответы, которые формально привязаны к источнику, но фактически ошибочны.

Где здесь Summio

Чат с саммари и доступным контекстом источника

Узнать больше о Summio

Частые вопросы

Чем RAG отличается от файн-тюнинга?

Файн-тюнинг «зашивает» новые знания в веса модели — медленно, дорого, обновлять можно только переобучением. RAG оставляет модель неизменной и меняет контекст, передаваемый на каждый запрос: чтобы обновить знание, достаточно переиндексировать документ, переобучать модель не нужно.

Уберёт ли RAG галлюцинации?

Поиск фрагментов может лучше привязать ответ к источнику, но не устраняет галлюцинации. Модель может неверно прочитать или проигнорировать фрагмент либо ошибочно соединить верные детали; важное сверяйте с оригиналом.

Где применяется RAG?

В AI-поисковиках (Perplexity, ChatGPT search, Claude с веб-доступом), в чатах поверх корпоративных документов, в саппорт-ботах поверх базы знаний и в читательских приложениях вроде Summio — везде, где ответ должен опираться на конкретный источник.