La mayoría de los equipos que crean pipelines de evaluación de LLM dedican mucho tiempo al juez en sí: qué modelo usar, cómo redactar la rúbrica y qué dimensiones evaluar. Casi nada de ese esfuerzo se destina a evaluar si el juez realmente tiene razón.
La suposición implícita es que un modelo capaz con un prompt claro producirá veredictos fiables. Esa suposición falla de una manera específica y predecible: el juez aprende a preguntar "¿esto suena correcto?" cuando la pregunta adecuada para cualquier LLM como juez evaluación es "¿cada afirmación en esta respuesta es directamente rastreable hasta el contexto recuperado?". Parecen la misma pregunta, pero producen comportamientos completamente distintos en los casos de fallo que más importan.
Conocimientos previos: haber creado o utilizado un juez LLM y comprender la configuración básica.
Qué significa realmente ser fiel en un contexto RAG
Para un agente basado en RAG, la fidelidad es la dimensión de evaluación más común y la más difícil de lograr. Una respuesta fiel es aquella en la que cada afirmación fáctica, cada número, regla, característica de producto, negación o comparación está directa y explícitamente respaldada por el contexto recuperado y no solo implícita. No es consistente con lo que el modelo sabe por su entrenamiento, sino que está explícitamente presente en el pasaje recuperado.
Este es un estándar más estricto de lo que parece. Un agente puede producir una respuesta que sea fácticamente precisa en el mundo real, pero infiel al contexto recuperado, porque recurrió a conocimientos externos a ese contexto. Un juez que evalúa la fidelidad debe detectar eso. En la práctica, un prompt de fidelidad genérico no lo hace.
Donde falla el juez genérico
El modo de fallo que aparece de forma más consistente en los jueces en producción es el error de atribución entre documentos: el agente recupera contexto del documento A, pero la respuesta contiene una afirmación que pertenece al documento B. La afirmación es precisa en abstracto, pero no está respaldada por lo que se recuperó. El juez, al operar basándose en la plausibilidad superficial en lugar de en la trazabilidad a nivel de afirmación, califica la respuesta como fiel.
En un conjunto de pruebas de 30 ejemplos etiquetados (21 respuestas fieles y nueve infieles), un juez GPT-4.1 genérico con un prompt de fidelidad estándar produjo estos resultados:
El juez tuvo un buen desempeño en los casos sencillos, identificando correctamente las respuestas correctas. Sin embargo, falló en los casos que importan para la seguridad y la fiabilidad. Una tasa de falsos negativos del 100% en alucinaciones significa que el pipeline de evaluación está proporcionando una falsa confianza precisamente en el punto donde la confianza es más peligrosa.
Tres patrones de fallo explicaron los nueve errores.
- Atribución entre productos es el más común. El agente recupera contexto sobre el producto A, pero la respuesta establece una regla que pertenece al producto B, un producto similar pero distinto. El contexto recuperado para el producto A no contiene tal regla. El juez ve contenido que suena plausible y lo aprueba. Nunca verifica a qué producto pertenece realmente la regla.
- Inyección de datos de entrenamiento es más sutil. El agente responde correctamente a una parte de la pregunta utilizando el contexto recuperado, y luego añade una afirmación sobre una entidad relacionada que no se encuentra en el pasaje recuperado, sino que proviene de los datos de entrenamiento. La afirmación puede ser precisa. El juez califica la respuesta completa como fiel porque no distingue entre la información proveniente del contexto recuperado y la información de la memoria paramétrica.
- Atribución errónea de cifras es lo más difícil de detectar para un juez genérico. El contexto recuperado contiene una cifra que pertenece a la entidad A. La respuesta cita esa cifra al responder a una pregunta sobre la entidad B. El juez encuentra el número en la ventana de contexto, lo hace coincidir con el número en la respuesta y concluye que la respuesta está respaldada. La atribución de la entidad no interviene en absoluto en el razonamiento.
La causa raíz: es un problema de razonamiento
El juez genérico falla no porque carezca de conocimiento sobre lo que significa la fidelidad, sino porque no aplica ese conocimiento al nivel de granularidad adecuado.
Un prompt de fidelidad genérico pide al juez que evalúe si la respuesta es fiel al contexto. El juez interpreta esto como: ¿suena la respuesta coherente con la información recuperada? Comprueba si hay inconsistencias graves y fabricaciones obvias. Lo que no hace es extraer cada afirmación fáctica discreta y verificarla de forma independiente frente a los pasajes recuperados.
El juez conoce la definición de fidelidad. Lo que no realiza son los pasos de razonamiento necesarios para aplicar esa definición correctamente: enumerar las afirmaciones, comprobar cada una frente al pasaje de respaldo específico, verificar la atribución de la entidad y señalar el contexto truncado como un respaldo insuficiente.
Las anotaciones humanas son las que hacen posible la calibración. Cuando un experto en la materia analiza la misma entrada en la que el juez falló y registra el veredicto correcto, está produciendo algo más valioso que una etiqueta: está produciendo evidencia de dónde el razonamiento del juez se desvió del razonamiento correcto. La calibración utiliza esa evidencia para reescribir el prompt, no para inyectar nuevos conocimientos en el modelo, sino para reestructurar los pasos de razonamiento que aplica el modelo. El modelo ya sabe lo que significa la fidelidad. Solo necesita que se le indique cómo comprobarla, afirmación por afirmación.
Medición de la precisión del juez LLM: el conjunto de 7 métricas
Una única puntuación de precisión no siempre revelará el fallo. En el conjunto de pruebas anterior, el juez genérico tuvo una precisión de 20/21 en las respuestas fieles. Presentado como una métrica de precisión agregada, parece razonable, pero oculta un recuerdo (recall) de 0/9 en la clase de fallos.
Evaluar la calidad del juez requiere un conjunto de métricas que expongan simultáneamente diferentes puntos ciegos. Las siete métricas utilizadas en el marco de calibración de Galtea:
La puntuación de alineación final es el promedio de las siete. Las métricas individuales engañan de formas específicas. Una precisión alta con un Kappa de Cohen bajo significa que el juez está acertando los veredictos por azar, no por comprensión; produciría una precisión similar en un conjunto de datos aleatorio. Una precisión alta con un recuerdo bajo significa que el juez es conservador: cuando califica algo como un fallo, suele tener razón, pero pasa por alto la mayoría de los fallos reales. Ninguna de las dos configuraciones es fiable en producción.
Informe la puntuación de alineación por separado para cada dimensión de evaluación (fidelidad, relevancia y precisión fáctica) en lugar de como un promedio único. Una alineación agregada de 0,80 puede ocultar una alineación de fidelidad de 0,55, lo cual está cerca del azar en una tarea de clasificación binaria.
Cómo calibrar su juez LLM

La calibración es el proceso de mejorar el comportamiento del juez hasta que la puntuación de alineación del conjunto alcance un umbral que usted haya definido como aceptable. Se requieren tres entradas antes de comenzar.
El conjunto de datos de referencia (golden dataset). Utilice ejemplos de su distribución de evaluación real: consultas reales, contexto recuperado real y respuestas reales del agente. Haga que expertos en la materia etiqueten cada uno con el veredicto correcto (no recurra a anotadores generalistas; aquí el conocimiento del dominio es fundamental). Para tareas de clasificación binaria, 30 ejemplos etiquetados son un punto de partida viable si las clases de error están bien representadas; más de 200 es más seguro para los filtros de despliegue en producción. Mida el acuerdo entre evaluadores antes de utilizar el conjunto. Si dos evaluadores humanos coinciden en menos del 80% de los ejemplos, la definición de la tarea es ambigua; calibre la rúbrica, no al juez.
La línea base. Ejecute el prompt del juez actual contra el conjunto de datos de referencia, calcule las siete métricas y registre el resultado. Este es el paso 0. Cada iteración posterior se mide en comparación con este.
Optimización del prompt. El enfoque más eficaz es la reescritura iterativa del prompt utilizando un meta-LLM como optimizador, inspirado en OPRO (Optimización por PROmpting). El ciclo: proporcione al optimizador el prompt actual y los ejemplos con peor rendimiento del conjunto de datos de referencia (incluyendo entradas completas, contextos recuperados y respuestas del agente); genere prompts candidatos aplicando cada uno una estrategia de reescritura diferente (mejora general, corrección de falsos positivos, corrección de falsos negativos, adición de una rúbrica explícita o simplificación radical); evalúe cada candidato frente al conjunto de datos de referencia completo utilizando el conjunto de siete métricas; conserve el candidato con mayor puntuación; registre todos los prompts probados y sus puntuaciones para evitar volver a configuraciones que ya fallaron; repita hasta que la alineación se estabilice o alcance un techo (≥0.95 en esta implementación).
En una ejecución de calibración sobre un conjunto de datos de referencia de 30 ejemplos, el ciclo de optimización realizó nueve iteraciones antes de estabilizarse:
La alineación no mejora de forma monótona. Algunas iteraciones presentan regresiones. El registro de puntuaciones evita que el optimizador vuelva a configuraciones que ya fallaron, lo cual es lo que impide que se quede estancado.
Lo que aprendió el juez calibrado

"Evalúe si la respuesta del asistente es fiel a la documentación fuente recuperada. Una respuesta es fiel si cada afirmación fáctica está respaldada directamente por el contexto. Una respuesta no es fiel si añade, modifica o presenta suposiciones como hechos. Asigne 1 si es fiel, 0 si hay alguna afirmación sin respaldo."
El prompt genérico tenía 10 líneas. El prompt calibrado tiene 59 líneas. La diferencia no es la longitud, sino la estructura de razonamiento. El prompt genérico suena razonable, pero no detecta ninguna de las nueve alucinaciones.
El optimizador derivó seis directivas de razonamiento específicas a partir del patrón de desacuerdos humanos. Antes de evaluar nada, el juez debe extraer primero cada afirmación fáctica discreta de la respuesta, números, reglas, características, negaciones y comparaciones como un paso de enumeración independiente. Luego, cada afirmación se verifica de forma independiente contra el contexto recuperado: coincidencia exacta en números, unidades, alcance y nombre de la entidad, no solo consistencia superficial.
Dos instrucciones abordan los modos de fallo que los prompts genéricos pasan por alto por completo. La ausencia de evidencia no es evidencia: el juez nunca debe tratar el "no mencionado" como respaldo para una afirmación negativa, y cualquier oración recuperada que esté cortada o truncada cuenta como cero respaldo para lo que sigue al corte. La atribución de entidades tiene su propio paso de verificación; las afirmaciones deben coincidir exactamente con el producto, persona o documento correcto, sin transferir detalles entre entidades con nombres similares.
La regla de puntuación es estricta: una afirmación sin fundamento equivale a una puntuación de 0, independientemente de cuántas otras afirmaciones sean correctas.
Tras la calibración: seis de cada nueve alucinaciones detectadas, puntuación de alineación de 0.75, dos falsos positivos de 21 respuestas fieles. Del 0% de recuperación en la clase de error al 67%, utilizando nueve anotaciones humanas como única señal de entrenamiento.
Coste frente a alineación: el resultado de la selección del modelo

La calibración de prompts cambia la decisión de selección del modelo de una forma que la mayoría de los equipos no prevé. Tras calibrar un modelo capaz, se transfirió el mismo prompt optimizado a un modelo más pequeño y económico. Resultados:
Esta es una comparación controlada: las tres configuraciones utilizaron el mismo conjunto de referencia de 30 ejemplos, las mismas métricas de evaluación y los mismos contextos recuperados. La única variable fue el modelo de evaluación y el prompt.
gpt-4o-mini con el prompt optimizado alcanza una alineación de 0.71 con un coste por inferencia aproximadamente 13 veces menor que gpt-4.1. Con un millón de evaluaciones diarias (un volumen razonable para un agente en producción que atiende a usuarios activos), esa brecha se traduce en aproximadamente 3.200 $/día en gpt-4.1 frente a 240 $/día en gpt-4o-mini, una diferencia de cerca de 1,1 millones de dólares anuales, con una puntuación de alineación superior. El modelo más económico gana en ambas dimensiones.
El prompt realiza más trabajo que el modelo. gpt-4.1 con un prompt genérico no sustituye a un prompt calibrado en GPT-4o-mini; es un error de planteamiento. Si su evaluador se ejecuta en cada respuesta de producción, implemente el modelo calibrado y más económico. Con una alineación de 0.71, supera a la configuración predeterminada en todas las métricas importantes, y la diferencia de costes se multiplica a gran escala.
El ciclo continuo y cuándo detenerse

Un evaluador calibrado se degrada. A medida que el sistema bajo evaluación mejora, la distribución de los resultados cambia y el evaluador encontrará ejemplos fuera del rango en el que fue calibrado. Trate la calibración como un bucle operativo: evalúe, anote los desacuerdos, optimice, implemente, vuelva a anotar los fallos restantes y repita.
El primer ciclo produce las mayores ganancias. Una ronda de calibración sobre nueve desacuerdos anotados elevó la alineación de 0.40 a 0.75, una mejora del 88 %. Cada ciclo posterior produce ganancias menores, pero reales. Más anotaciones mejoran la señal del optimizador; una mejor señal produce evaluadores que detectan más fallos a un coste menor.
Existen tres condiciones legítimas para detenerse. Una alineación superior a 0.80 con iteraciones que producen ganancias inferiores a 0.02 por paso: los cambios incrementales en el prompt en ese punto solo están calibrando la varianza del conjunto de datos de referencia, no los modos de fallo reales. Un acuerdo entre evaluadores humanos inferior a 0.6 en el índice Kappa de Cohen sobre el conjunto de datos de referencia: si los evaluadores no están de acuerdo entre sí a ese nivel, la tarea de evaluación es ambigua y una mayor calibración optimizará el ruido. La tercera es una decisión de producto: un evaluador que detecta seis de cada nueve alucinaciones puede ser insuficiente para un ámbito de alto riesgo, pero aceptable para una herramienta de productividad de desarrollo. Defina ese umbral antes de empezar a calibrar, no después.
No se detenga porque el evaluador funcione bien en los casos correctos. El evaluador genérico identificó correctamente 20 de 21 respuestas fieles. Esa cifra, aislada, sugeriría que funcionaba. No era así.
