¿Qué es RAG (Generación Aumentada por Recuperación)?
RAG, o Generación Aumentada por Recuperación, es un patrón de IA en el que el modelo recupera primero los pasajes relevantes de una fuente y solo entonces genera la respuesta, anclando lo que dice en el documento.
Un LLM ordinario responde a partir de sus datos de entrenamiento, fijados en el momento de entrenar el modelo y propensos a alucinar. RAG corrige esto añadiendo un paso de recuperación: cuando llega una pregunta, el sistema busca en un corpus (un libro, un PDF, una base de conocimiento) los pasajes más relevantes, los entrega al LLM como contexto y solo entonces le pide responder.
Chat con resúmenes y el contexto disponible de la fuente
La calidad de un sistema RAG depende de tres piezas: cómo se trocea la fuente (párrafo, sección, frase), cómo se embeden los trozos para la búsqueda por similitud y cómo se le pide al modelo que use el contexto recuperado. Un eslabón débil en cualquiera de las tres produce respuestas formalmente ancladas pero materialmente erróneas.
Chat con resúmenes y el contexto disponible de la fuente
Saber más sobre SummioPreguntas frecuentes
¿En qué se diferencia RAG del fine-tuning?
El fine-tuning incorpora conocimiento nuevo en los pesos del modelo — lento, caro y actualizable solo reentrenando. RAG deja el modelo congelado y cambia el contexto recuperado en cada consulta, así que actualizar conocimiento es reindexar un documento, no reentrenar nada.
¿Elimina RAG las alucinaciones?
La recuperación puede fundamentar mejor una respuesta, pero no elimina las alucinaciones. El modelo puede interpretar mal u omitir un pasaje, o combinar datos correctos de forma errónea; verifica los detalles importantes con el original.
¿Dónde se usa RAG?
En buscadores con IA (Perplexity, ChatGPT search, Claude con acceso web), en chat sobre documentación interna, en bots de soporte sobre centros de ayuda y en apps de lectura como Summio. En cualquier sitio donde la respuesta deba poder atribuirse a una fuente concreta.
