Evaluar RAG exige probar por separado si la búsqueda encuentra la evidencia necesaria y si el generador responde fielmente con ella. Una respuesta plausible puede ocultar un fallo en cualquiera de las dos etapas.
Fundamentos para aislar componentes en RAG
Evaluar rag a partir de consultas de usuarios reales exige descomponer la arquitectura en dos etapas independientes: la recuperación de documentos y la síntesis generativa. Cuando un sistema produce una respuesta incorrecta o incompleta, diagnosticar la causa raíz resulta complejo si se mide únicamente la salida final. Una mala respuesta puede surgir tanto de fragmentos irrelevantes proporcionados por el motor de búsqueda vectorial como de una alucinación del modelo generativo frente a fragmentos idóneos. Aislar ambos componentes permite determinar si los fallos radican en el modelo de incrustación, la estrategia de particionado o la adherencia del modelo de lenguaje al contexto provisto.
Procedimiento de captura y validación de consultas reales
El uso de preguntas reales como banco de pruebas requiere un flujo estricto de gobernanza técnica para evitar sesgos y problemas de seguridad. El procedimiento comienza con la autorización formal por parte de los propietarios del sistema y de la información para reutilizar registros de interacción. Posteriormente, cada lote de consultas se somete a una validación de esquema, descartando cargas útiles mal formadas, textos vacíos o entradas que no coincidan con la estructura esperada por la interfaz.
A continuación, se aplica una fase de privacidad destinada a eliminar identificadores personales o datos confidenciales antes de incorporar las entradas al conjunto de pruebas. Finalmente, un equipo técnico supervisa y clasifica una muestra representativa de estas consultas, vinculando cada pregunta con los fragmentos de referencia que contienen los hechos requeridos. Este banco curado servirá como patrón de comparación fiable.
Evaluación técnica del paso de recuperación
Para evaluar la recuperación de forma independiente, se prescinde del modelo generativo. Se introduce la consulta validada en el componente de búsqueda y se analizan exclusivamente los fragmentos devueltos por el índice.
En un escenario técnico de soporte de infraestructura, por ejemplo, una consulta sobre la configuración de puertos en un cortafuegos debe devolver fragmentos específicos del manual técnico y no secciones de garantías o términos de servicio. El análisis evalúa si la información indispensable para responder está presente en los primeros resultados devueltos y si la similitud semántica calculada refleja la relevancia contextual. Medir este paso sin invocar la generación reduce costes computacionales y aísla problemas derivados del modelo de incrustaciones o del tamaño de partición documental.
Evaluación de la generación sobre contexto controlado
Una vez acotada la recuperación, la etapa generativa se examina anulando la variabilidad del motor de búsqueda. Para ello, se proporciona al modelo de lenguaje la pregunta real junto a un contexto documental fijo y verificado previamente por supervisores humanos.
En esta etapa se comprueban propiedades como la fidelidad factual y la relevancia de la respuesta. La fidelidad verifica que el modelo no introduzca afirmaciones ajenas ni contradictorias respecto a los fragmentos entregados, mitigando las alucinaciones. Por su parte, la relevancia comprueba si la redacción aborda la intención del usuario sin divagaciones innecesarias. Si se detectan fallos en este punto, las correcciones deben enfocarse en las instrucciones de contexto, los parámetros de inferencia o las capacidades del modelo fundacional elegido.
Límites operativos y controles de calidad continuos
La evaluación desacoplada presenta limitaciones intrínsecas que exigen controles regulares. Los bancos de preguntas reales pierden vigencia si la documentación base se actualiza, lo que obliga a revisar periódicamente la validez del material de referencia. Del mismo modo, el uso de modelos automatizados para juzgar la calidad de otros modelos puede introducir sesgos de benevolencia o interpretaciones erróneas de ambigüedades técnicas.
Para mitigar estos riesgos, deben implementarse controles que combinen revisiones humanas por muestreo, auditorías periódicas del rendimiento del índice y seguimiento de la deriva temática en las consultas nuevas. Mantener separados los indicadores de búsqueda y de síntesis facilita diagnósticos más precisos y facilita el mantenimiento a largo plazo.
Al evaluar RAG, incluye preguntas sin respuesta en la base documental para comprobar si el sistema reconoce la falta de evidencia.