Glossario

Che cos’è RAG (Generazione Aumentata da Recupero)?

RAG, o Generazione Aumentata da Recupero, è uno schema di IA in cui il modello prima recupera i passaggi rilevanti da una fonte e solo dopo genera la risposta, ancorandola al documento.

Un LLM ordinario risponde a partire dai suoi dati di addestramento, congelati al momento del training e inclini all’allucinazione. RAG aggiunge un passaggio di recupero: quando arriva una domanda, il sistema cerca in un corpus (un libro, un PDF, una base di conoscenza) i passaggi più rilevanti, li passa al modello come contesto e solo allora gli chiede di rispondere.

Chat con le sintesi e il contesto disponibile della fonte

La qualità di un sistema RAG dipende da tre cose: come la fonte viene spezzata (paragrafo, sezione, frase), come i frammenti vengono trasformati in embedding per la ricerca per somiglianza e come si chiede al modello di usare il contesto recuperato. Un anello debole in uno qualunque dei tre produce risposte formalmente ancorate ma sostanzialmente sbagliate.

Dove entra Summio

Chat con le sintesi e il contesto disponibile della fonte

Scopri di più su Summio

Domande frequenti

In cosa RAG differisce dal fine-tuning?

Il fine-tuning incide nuova conoscenza nei pesi del modello — lento, costoso, aggiornabile solo riaddestrando. RAG lascia il modello fermo e cambia il contesto recuperato a ogni richiesta: aggiornare la conoscenza significa reindicizzare un documento, non riaddestrare nulla.

RAG elimina le allucinazioni?

Il recupero può ancorare meglio una risposta, ma non elimina le allucinazioni. Il modello può leggere male o ignorare un passaggio, oppure combinare in modo errato dettagli corretti; verifica i punti importanti nell’originale.

Dove si usa RAG?

Nei motori di ricerca IA (Perplexity, ChatGPT search, Claude con accesso web), nelle chat su documentazione interna, nei bot di supporto sopra un centro assistenza e nelle app di lettura come Summio. Ovunque la risposta debba poter essere attribuita a una fonte precisa.