Glossário

O que é RAG (Geração Aumentada por Recuperação)?

RAG, ou Geração Aumentada por Recuperação, é um padrão de IA em que o modelo primeiro recupera os trechos relevantes de uma fonte e só depois gera a resposta, ancorando o que diz no documento.

Um LLM comum responde a partir dos seus dados de treino, fixados no momento do treino e propensos a alucinações. O RAG corrige isso ao acrescentar um passo de recuperação: quando chega uma pergunta, o sistema procura num corpus (um livro, um PDF, uma base de conhecimento) os trechos mais relevantes, entrega-os ao LLM como contexto e só então lhe pede a resposta.

Chat com resumos e o contexto disponível da fonte

A qualidade de um sistema RAG depende de três peças: como a fonte é fatiada (parágrafo, secção, frase), como os pedaços são convertidos em embeddings para a busca por semelhança e como se pede ao modelo que utilize o contexto recuperado. Um elo fraco em qualquer destas peças gera respostas formalmente ancoradas mas materialmente erradas.

Onde entra o Summio

Chat com resumos e o contexto disponível da fonte

Saber mais sobre o Summio

Perguntas frequentes

Em que difere o RAG do fine-tuning?

O fine-tuning grava o novo conhecimento nos pesos do modelo — lento, caro e só atualizável por re-treino. O RAG mantém o modelo congelado e altera o contexto recuperado por consulta: atualizar conhecimento é reindexar um documento, não re-treinar nada.

O RAG elimina alucinações?

A recuperação pode fundamentar melhor uma resposta, mas não elimina alucinações. O modelo pode interpretar mal ou ignorar uma passagem, ou combinar incorretamente detalhes certos; confirme os pontos importantes no original.

Onde se usa RAG?

Em motores de busca por IA (Perplexity, ChatGPT search, Claude com acesso à web), em chats sobre documentação interna, em bots de apoio sobre centros de ajuda e em apps de leitura como o Summio. Em qualquer lugar onde a resposta tenha de ser atribuível a uma fonte concreta.