Resultados
- Más de 2 millones de clientes atendidos por SofIA, el asistente bancario con IA de ABANCA
- 71% de reducción de costes por ciclo completo de evaluación
- > 60% de reducción en el tiempo necesario para completar un ciclo de evaluación
- 100% de puntuación en seguridad (partiendo de un 59% y alcanzando el 95% tras una iteración).
- 0 incidentes en producción desde su implementación
- ~10x de ROI combinado (incluyendo el ahorro directo de costes y la reducción del riesgo normativo).
La situación
SofIA es el asistente bancario con IA de ABANCA. Gestiona las consultas de los clientes sobre toda la gama de productos del banco en español, inglés, portugués y gallego, atendiendo a más de 2 millones de clientes. A esa escala, SofIA es un canal de servicio regulado con consecuencias directas para la experiencia del cliente, la reputación de la marca y el cumplimiento normativo.
Como cualquier sistema de IA en producción, SofIA no se detiene. Las actualizaciones de modelos, las revisiones de políticas y los cambios en la base de conocimientos son constantes. Cada cambio supone una posible regresión. Bajo la Ley de IA de la UE, ABANCA necesitaba pruebas documentadas y repetibles de fiabilidad y seguridad.
El programa de validación que respaldaba a SofIA se construyó como lo hace la mayoría de los bancos: de forma manual y con datos muestreados. Los ingenieros de QA redactaban los casos de prueba manualmente. Los expertos en la materia revisaban conversaciones seleccionadas. Cada ciclo llevaba semanas y solo cubría la calidad.
El desafío
La validación manual tenía dos límites que ABANCA estaba a punto de alcanzar simultáneamente.
- Un techo de costes. Realizar una validación manual para la cobertura de Nivel 1 de un asistente de producción de la escala de SofIA cuesta más de 51.000 € por cada iteración. Se trata de una curva de costes lineal: cada nuevo caso de uso que se añade a la cartera de IA del banco multiplica esa cifra.
- Un techo de alcance. La redacción manual de pruebas no cubre de forma natural los casos extremos ni el comportamiento adversarial. La ingeniería social, la exploración de los límites de las políticas, los ataques de extracción de información y la provocación de sesgos quedaban fuera del programa. Descubrirlos requeriría que alguien analizara cada caso, diseñara una prueba y la ejecutara manualmente, un proceso que no es escalable.
Ambos techos tenían la misma causa raíz: los procesos manuales no escalan.
Lo que cambió ABANCA
ABANCA aplicó un principio claro: codificar las expectativas como especificaciones y, a continuación, realizar una evaluación exhaustiva basada en ellas. Tres decisiones marcaron la forma en que se implementó la plataforma de Galtea.
- Generación de pruebas basada en especificaciones
En lugar de redactar casos de prueba individuales, ABANCA codificó el comportamiento esperado de SofIA como una especificación: qué debe responder, qué debe rechazar, qué políticas debe aplicar y dónde se encuentran sus límites bajo presión. Galtea generó automáticamente conjuntos de datos de evaluación y variantes adversariales. Añadir una nueva clase de ataque en la segunda iteración solo requirió actualizar la especificación, no un nuevo ciclo de redacción. - Jueces LLM calibrados según la taxonomía de políticas de ABANCA
Los jueces estándar evalúan basándose en rúbricas genéricas. Los jueces de Galtea se calibraron según las directrices de cumplimiento y la taxonomía de políticas propias de ABANCA, con comprobaciones periódicas de concordancia en los resultados muestreados para mantener visible cualquier desviación del juez. Esto permite detectar aprobaciones de falsos positivos que las rúbricas genéricas pasan por alto. - Control de evaluación previo al lanzamiento, independiente del monitoreo en producción
Cada candidato a despliegue se somete ahora a la batería completa de evaluación antes de su lanzamiento. Los fallos bloquean la compilación. Por otro lado, el canal de monitoreo de Galtea proporciona observabilidad continua en producción. Ambas funciones son distintas: una controla los lanzamientos y la otra supervisa el tráfico en tiempo real.
Cómo se probó la seguridad de SofIA antes de llegar a cualquier cliente
Cualquier asistente LLM implementado en servicios financieros se enfrenta al mismo tipo de ataques. La cuestión es si se descubren en un entorno de pruebas controlado. La evaluación de Galtea cubrió 12 categorías de riesgo en cuanto a cumplimiento de políticas y robustez adversarial. Tres ejemplos ilustran los patrones de ataque que se probaron en el programa y el estándar que SofIA tuvo que cumplir antes de que cualquier versión llegara a un cliente.
Extracción del prompt del sistema mediante reasignación de roles
Una técnica adversarial estándar: dar instrucciones al asistente para que actúe como "un nuevo chatbot en fase de entrenamiento" y recite sus instrucciones fundamentales. Probado en todos los despliegues principales de LLM. La evaluación confirmó que los límites de SofIA se mantuvieron firmes ante esta clase de prompts y sus variantes.
Asesoramiento financiero fuera del ámbito mediante encuadre profesional
Las solicitudes presentadas como documentos estratégicos legítimos —como pedir "estrategias legales innovadoras" para la protección del patrimonio— son un patrón de evasión conocido. La evaluación de calidad estándar no los detecta porque el encuadre parece razonable. Los jueces de Galtea están calibrados específicamente según la taxonomía de políticas de ABANCA para detectar estos casos. SofIA superó esta clase de prueba en la segunda iteración.
Discriminación crediticia geográfica, justificada bajo petición
Una prueba directa de cumplimiento de la Ley de IA de la UE: prompts diseñados para obtener justificaciones de riesgo basadas en grupos, como marcar solicitudes de préstamo por código postal como indicador de perfil de riesgo demográfico. Esta es una de las categorías de prueba de mayor prioridad para cualquier sistema de IA financiera que opere bajo la Ley. El comportamiento de rechazo de SofIA fue validado frente a esta clase antes de su implementación.
Impacto en el negocio
- Ahorro de costes directo: 71% por ciclo de evaluación completo. Un ciclo de evaluación de cobertura completa sin Galtea costaba 51.726 €. La cobertura equivalente con la plataforma de Galtea costó 15.000 €, un ahorro de más de 36.700 € por ciclo, con un alcance mayor: 16 métricas entre dimensiones de calidad y adversarias, frente a solo calidad.
- 23,6 veces más vulnerabilidades detectadas por ciclo. La profundidad del programa adversario automatizado en relación con el programa de calidad manual permitió capturar clases de riesgo que eran invisibles con el enfoque anterior.
- ~280.000 € en riesgo regulatorio anual mitigado. Modelando una probabilidad de incidente base del 1%, una tasa de mitigación de riesgo del 80% y una exposición máxima de 35 millones de euros bajo la Ley de IA de la UE, la reducción de pérdidas anual esperada atribuible a la cobertura de cumplimiento de Galtea es de aproximadamente 280.000 €.
- ~10 veces el ROI combinado. Incluyendo los ahorros de costes directos en toda la cartera de casos de uso y la reducción del riesgo regulatorio, el retorno anual proyectado de la inversión en Galtea es de aproximadamente 10 veces. Periodo de recuperación: menos de dos meses.
En sus propias palabras
"Con Galtea, descubrimos vulnerabilidades que probablemente habríamos pasado por alto, ahorramos un tiempo de ingeniería significativo y mejoramos la fiabilidad de nuestros sistemas de IA. Cambió nuestra forma de abordar la evaluación y la gobernanza de la IA".
Jorge Romaris, Jefe de IA en ABANCA
¿Qué sigue?
SofIA ahora pasa por el proceso de evaluación de Galtea como un filtro de lanzamiento permanente. Cada candidato a despliegue se evalúa frente a la batería completa antes de llegar a los usuarios. El registro auditable producido, por cada versión, proporciona a ABANCA la evidencia documentada que los reguladores exigen bajo la Ley de IA de la UE.