Glosario de IARAG

¿Qué es RAG?

En términos técnicos, Retrieval-augmented generation is an architecture that retrieves external information at query time and supplies it as context to a generative model before or during response generation.

¿Qué es RAG?

En términos técnicos, Retrieval-augmented generation is an architecture that retrieves external information at query time and supplies it as context to a generative model before or during response generation.

RAG debe entenderse como un límite de sistema, no como una etiqueta de marketing. Sus entradas, salidas, estado, permisos y fallas necesitan contratos explícitos.

En producción, la definición también incluye el plano de control. Logging, identidad, políticas, reintentos y observabilidad determinan si la capacidad es confiable.

Una prueba útil es si dos equipos pueden implementar el mismo comportamiento desde la especificación. Si solo describe un resultado, la definición está incompleta.

¿Por qué es importante?

Es importante porque RAG grounds model output in current, private, or domain-specific knowledge without placing every fact in model weights. It can improve factuality and sourceability, but only when retrieval quality and context use are reliable.

El valor práctico de RAG aparece cuando el volumen, la diversidad de modelos, el contexto o el riesgo superan un proceso manual.

También cambia la economía del sistema. El equipo puede separar razonamiento costoso de ejecución rutinaria y aplicar controles donde se toman decisiones.

Las mejores implementaciones conectan métricas técnicas con resultados. La precisión no alcanza si latencia, costo, handoff o auditoría vuelven inviable el sistema.

Cómo funciona

El sistema funciona así: The system transforms a query, retrieves relevant documents or records, selects and formats context, sends that context with the request to the model, and returns an answer that may include citations.

La implementación comienza con entradas tipadas y un modelo de estado explícito. Cada transición registra observación, política, acción y evidencia.

El camino de ejecución necesita límites determinísticos. Schemas de tools, timeouts, idempotencia, rate limits y permisos deben vivir en código.

La evaluación cierra el circuito. Los traces deben permitir reproducir fallas, comparar versiones y separar errores de modelo, datos, tools o políticas.

Ejemplo técnico

Ejemplo: A support assistant retrieves the current refund policy and the customer's plan before drafting an answer, rather than relying on the model's general memory.

Lo importante es la cadena de cambios de estado. Cada lookup, decisión, tool call, respuesta y handoff debe vincularse con una solicitud e identidad.

Una implementación sólida trata con el mismo cuidado contexto faltante, identidad ambigua, fallas de proveedor, eventos duplicados y baja confianza.

El ejemplo debe poder probarse con fixtures reproducibles que validen salida, efectos, latencia, costo y registro de auditoría.

Notas de implementación

Notas técnicas: Measure retrieval recall separately from answer quality, preserve permissions and provenance, control chunking and context size, mitigate prompt injection in retrieved content, and require the model to acknowledge insufficient evidence.

Empezá por el circuito cerrado más pequeño que genere valor medible. Definí owner, entradas, acciones, evidencia, rollback y escalamiento.

Instrumentá desde el primer día con traces, políticas, versiones de modelos y tools, costos, feedback y correcciones humanas.

Seguridad y governance son arquitectura. Aplicá mínimo privilegio, aislá secretos, minimizá datos y exigí aprobación para acciones irreversibles.

Fuentes

Términos relacionados

Empieza con Frontline hoy