Cómo el simulador de conversaciones de Galtea evita fallos de IA en el mundo real

Las pruebas de un solo turno pasan por alto los fallos importantes: agentes que pierden el contexto, eligen la herramienta incorrecta o se desvían del objetivo del usuario. Descubra cómo nuestro simulador de conversaciones ejecuta escenarios de múltiples turnos con personas y objetivos, y qué medir cuando "la respuesta fue correcta" no es suficiente.

>Loading the Elevenlabs Text to Speech AudioNative Player...
Resumir este artículo

Su agente de IA conversacional puede superar todas las pruebas estándar y, aun así, fallar en lo único que realmente importa: completar tareas reales para usuarios reales.

Puede responder preguntas aisladas como "¿Cuál es el estado de mi reembolso?" con total precisión. Pero en producción, todo se desmorona. El agente olvida el contexto, invoca la herramienta equivocada o no logra coordinarse con el componente interno adecuado. ¿El resultado? Una tarea que comienza pero nunca termina, dejando a los usuarios confundidos y sin asistencia.

Este colapso ocurre porque la mayoría de las pruebas todavía se centran en la precisión de un solo turno. Pero en sistemas complejos donde los agentes gestionan flujos de trabajo, activan herramientas e interactúan con subsistemas, la corrección paso a paso no es suficiente. Lo que importa es si todo el sistema puede mantener el rumbo y ofrecer resultados de principio a fin.

El marco de pruebas de Galtea está diseñado exactamente para esto. Nuestras evaluaciones basadas en escenarios de múltiples turnos miden el éxito de la tarea, no solo la calidad de la respuesta. Simulamos recorridos de usuario realistas donde su agente debe:

  • Mantener y actualizar el contexto en evolución
  • Elegir y secuenciar herramientas de manera efectiva
  • Coordinar procesos internos o componentes especializados
  • Mantenerse alineado con el objetivo del usuario de principio a fin

Con el Simulador de Conversaciones y el Generador de Escenariosde Galtea, puede descubrir los fallos que las pruebas tradicionales pasan por alto antes de que afecten a sus usuarios. Porque en implementaciones del mundo real, aprobar una prueba no es suficiente. Completar la tarea es lo que cuenta.

Por qué las pruebas de múltiples turnos son críticas para completar tareas

Las pruebas simples de preguntas y respuestas pasan por alto los desafíos reales que impiden completar tareas en agentes de IA conversacional de múltiples turnos:

Estos fallos a menudo pasan desapercibidos hasta llegar a producción, donde impactan directamente en la experiencia del usuario y en los resultados del negocio.

Presentamos el Simulador de Conversaciones de Galtea

El Simulador de Conversaciones de Galtea es un marco de trabajo diseñado específicamente para probar sistemas de IA conversacional en escenarios de diálogo realistas. En lugar de pares de preguntas y respuestas aisladas, genera mensajes de usuario dinámicos que simulan conversaciones auténticas de varios turnos, guiadas por escenarios de prueba estructurados.

Véalo en acción

Antes de entrar en detalles, eche un vistazo rápido a nuestra demostración a continuación para ver cómo funciona el Simulador de Conversaciones en menos de 2 minutos.

En esta demostración, aprenderá a:

  1. Configurar escenarios de prueba dinámicos
  2. Ejecutar una simulación para verla en acción
  3. Revisar los resultados y las conclusiones para mejorar su IA

Cómo funciona

Cada simulación somete a su IA a un flujo conversacional completo, impulsado por:

  • Objetivos del usuario: Lo que el usuario desea lograr en la conversación
  • Personas: Los antecedentes, el estilo de comunicación y los rasgos de comportamiento del usuario
  • Escenarios: El contexto o la situación específica que enmarca la interacción
  • Criterios de éxito: Definiciones claras de lo que constituye un resultado exitoso en la conversación

Casos de uso clave

Pruebas de flujo de diálogo
Asegúrate de que tu IA genere conversaciones coherentes y lógicas que resulten naturales para los usuarios.

Adherencia al rol
Verifica que tu agente mantenga su personalidad, nivel de experiencia y estilo de comunicación previstos durante interacciones prolongadas.

Finalización de tareas
Pon a prueba si tu IA puede guiar con éxito a los usuarios a través de procesos complejos de varios pasos.

Pruebas de robustez
Descubre cómo maneja tu IA el comportamiento inesperado del usuario, los cambios de tema o las solicitudes ambiguas.

Listo para la integración: El simulador se integra perfectamente en los flujos de trabajo CI/CD mediante el SDK de Python de Galtea, lo que permite realizar pruebas continuas a medida que tu IA evoluciona.

Primeros pasos: La interfaz del agente

Antes de comenzar con las simulaciones, deberás envolver tu IA conversacional usando la interfaz de agentede Galtea. Esta sencilla clase de Python garantiza que tu agente reciba el contexto completo de la conversación y pueda ser evaluado en condiciones realistas.


import galtea

class MyGalteaAgent(galtea.Agent):
    def __init__(self):
        # Initialize your model here (e.g., load LLM or service)
        self.agent = MyAgent()

    def call(self, input_data: galtea.AgentInput) -> galtea.AgentResponse:
        # Access the latest user message
        user_message = input_data.last_user_message_str()

        # Generate a response using your own logic/model
        response = self.agent.generate_response(user_message)

        # Return a structured response (optionally with metadata)
        return galtea.AgentResponse(content=response)

Ejecución de tu primera simulación

Una vez que tu agente esté listo, ejecutar simulaciones es muy sencillo:


# Initialize the Galtea client
galtea_client = galtea.Galtea(api_key="YOUR_API_KEY")

# Call the product and version you want to evaluate
product = galtea.products.get_by_name("your-product-name")
version = galtea.versions.get_by_name(
    product_id=product.id,
    version_name="your-version-name"
)

# Create a test suite
test = galtea_client.tests.create(
    product_id=product.id,
    name="Multi-turn Conversation Test",
    type="SCENARIOS"
)

# Get your test scenarios
test_cases = galtea_client.test_cases.list(test_id=test.id)

# Create your agent
agent = MyGalteaAgent()

# Run simulations
for test_case in test_cases:
    session = galtea_client.sessions.create(
        version_id=version.id,
        test_case_id=test_case.id
    )

    result = galtea_client.simulator.simulate(
        session_id=session.id,
        agent=agent,
        max_turns=test_case.max_iterations or 10,
        log_inference_results=True
    )

    # Analyze results
    print(f"Scenario: {test_case.scenario}")
    print(f"Completed {result.total_turns} turns")
    print(f"Success: {result.finished}")
    if result.stopping_reason:
        print(f"Ended because: {result.stopping_reason}")

Evaluar resultados:


evaluation_task = galtea_client.evaluation_tasks.create(
    session_id=session.id,
    metrics=["Role Adherence", "other_metrics"],  # Replace with your metrics
)
print(f"Evaluation task created: {evaluation_task.id})")

Cómo se ve el éxito

Tras ejecutar las simulaciones, obtendrás información detallada sobre el rendimiento de tu IA basada en las métricas que elijas para evaluarla, y tendrás visibilidad sobre:

Información de rendimiento:

  • Análisis turno a turno: observa exactamente dónde tienen éxito o fallan las conversaciones.
  • Métricas de éxito: realiza un seguimiento de las tasas de cumplimiento de objetivos en diferentes escenarios.
  • Preservación del contexto: supervisa qué tan bien mantiene tu IA el estado de la conversación.
  • Tendencias de rendimiento: identifica patrones de fallos según los tipos de personalidad o la duración de la conversación.

Generador de escenarios: probando lo que realmente importa

Crear escenarios de prueba exhaustivos de forma manual consume mucho tiempo y a menudo pasa por alto casos límite. El Generador de escenarios de Galtea resuelve esto creando automáticamente casos de prueba diversos y específicos para su producto, adaptados a su caso de uso.

Nuestro generador crea escenarios que están tanto basados en la funcionalidad de su producto como lo suficientemente diversos para detectar modos de fallo inesperados. El objetivo es lograr una cobertura integral sin el esfuerzo manual de escribir cientos de casos de prueba.

Cómo funciona

Al crear una prueba, simplemente seleccione “Generado por Galtea” en lugar de cargar su propio archivo CSV. Nuestro sistema analiza la información de su producto y genera escenarios como:

Este escenario fue generado para un bot de soporte de RR. HH.

Opciones de personalización

Enfoque en perfiles personalizados
Oriente la generación de escenarios hacia funcionalidades específicas proporcionando una descripción del enfoque:

Céntrate en los empleados que necesiten solicitudes de excedencia superiores a 2 meses.

Integración de la base de conocimientos [Próximamente...]
Esta futura función te permitirá subir tu base de conocimientos para crear personas aún más personalizadas y fundamentadas que reflejen tus casos de uso e interacciones reales. Tenemos previsto lanzar esta funcionalidad en un futuro próximo, ¡permanece atento!

Primeros pasos

¿Listo para ir más allá de las pruebas de un solo turno? Reserva una demostración con nosotros: Demostración de Galtea

Las conversaciones de varios turnos son el futuro de las interacciones con IA. No dejes que las pruebas de un solo turno te impidan ver los fallos que más afectan a tus usuarios.