O que é RAG (Geração Aumentada por Recuperação)?
RAG, ou Geração Aumentada por Recuperação, é um padrão de IA em que o modelo primeiro recupera os trechos relevantes de uma fonte e só depois gera a resposta, ancorando o que diz no documento.
Um LLM comum responde a partir dos seus dados de treino, fixados no momento do treino e propensos a alucinações. O RAG corrige isso ao acrescentar um passo de recuperação: quando chega uma pergunta, o sistema procura num corpus (um livro, um PDF, uma base de conhecimento) os trechos mais relevantes, entrega-os ao LLM como contexto e só então lhe pede a resposta.
Chat com resumos e o contexto disponível da fonte
A qualidade de um sistema RAG depende de três peças: como a fonte é fatiada (parágrafo, secção, frase), como os pedaços são convertidos em embeddings para a busca por semelhança e como se pede ao modelo que utilize o contexto recuperado. Um elo fraco em qualquer destas peças gera respostas formalmente ancoradas mas materialmente erradas.
Chat com resumos e o contexto disponível da fonte
Saber mais sobre o SummioPerguntas frequentes
Em que difere o RAG do fine-tuning?
O fine-tuning grava o novo conhecimento nos pesos do modelo — lento, caro e só atualizável por re-treino. O RAG mantém o modelo congelado e altera o contexto recuperado por consulta: atualizar conhecimento é reindexar um documento, não re-treinar nada.
O RAG elimina alucinações?
A recuperação pode fundamentar melhor uma resposta, mas não elimina alucinações. O modelo pode interpretar mal ou ignorar uma passagem, ou combinar incorretamente detalhes certos; confirme os pontos importantes no original.
Onde se usa RAG?
Em motores de busca por IA (Perplexity, ChatGPT search, Claude com acesso à web), em chats sobre documentação interna, em bots de apoio sobre centros de ajuda e em apps de leitura como o Summio. Em qualquer lugar onde a resposta tenha de ser atribuível a uma fonte concreta.
