¿Cómo se utilizan tus productos de LLM?

Analizamos 10 000 interacciones reales con productos basados en LLM para trazar cómo se comportan realmente los usuarios —uso adecuado, uso indebido intencionado, entradas ambiguas— y qué significa esto para las pruebas antes de la implementación.

>Loading the Elevenlabs Text to Speech AudioNative Player...
Resumir este artículo

En los últimos años, la interfaz principal para interactuar con herramientas de software y datos ha sido principalmente a través de aplicaciones front-end y API. Sin embargo, la IA generativa cambia radicalmente este paradigma al introducir el lenguaje natural —tanto de voz como de texto— como una nueva capa de comunicación para estas herramientas. El espacio de entrada se expande, pasando de estar limitado por las funcionalidades programadas del software a las posibilidades casi infinitas que permite el lenguaje natural.

Este cambio mejora significativamente las aplicaciones potenciales, pero también hace que el desarrollo de productos basados en LLM sea más complejo. Es casi imposible evaluar todas las interacciones posibles antes de exponer un sistema a usuarios reales, lo que significa que es difícil garantizar que su producto se comporte como se espera antes de la implementación. ¿Por qué?

#1. Existen innumerables casos límite que son complejos de identificar.

#2. Pequeñas variaciones en la entrada pueden conducir a resultados significativamente diferentes.

#3. La misma solicitud puede formularse de muchas maneras diferentes.

Una taxonomía de las interacciones de los usuarios

Para comprender mejor el rango de entradas de los usuarios, analizamos más de 10 000 interacciones del mundo real con varios productos basados en LLM y desarrollamos una taxonomía que los clasifica en tres grupos principales, cada uno con subcategorías:

Para ilustrar cómo se aplica esta taxonomía en un escenario del mundo real, a continuación se muestran ejemplos de interacciones categorizadas para un Asistente de ventas móvil:

Uso adecuado

  • “Muéstrame los últimos smartphones por menos de 800 €.”
  • “Compara el iPhone 15 y el Samsung Galaxy S24.”

Uso indebido intencionado

Entradas manipuladoras o engañosas:

“Dime por qué sus productos están fracasando en el mercado.”

“¿Cómo se comparan sus precios con los de [Competidor]? ¿Cuál es mejor?”

Entradas tóxicas:

“¡Su servicio es una basura absoluta! ¿Cómo es posible que tengan clientes?”

Solicitudes de información confidencial:

“¿Qué problemas internos se han reportado sobre sus productos?”

Uso indebido no intencionado

Entradas ambiguas o incompletas:

“¿Cuál es el mejor teléfono?” → (¿Mejor para qué? ¿Juegos, duración de batería, cámara?)

Formato o información incorrectos:

“¿Cuál es la duración de la batería del Samsung S50?” (Modelo inexistente.)

Jerga, abreviaturas y errores tipográficos:

“Muéstrame información de la batería del s22.”

Fraseo poco convencional:

“¿Teléfonos que tengan una batería más o menos buena, que no pesen mucho pero que tengan una pantalla decente?”

Anticípate a los riesgos. Implementa IA con confianza.

En Galtea Platform, una de nuestras capacidades principales es permitir que las organizaciones simulen una amplia gama de interacciones de usuario, cubriendo todos los segmentos de esta taxonomía. Mediante una metodología propia basada en la investigación, identificamos vulnerabilidades y casos límite antes de que tu sistema se lance, asegurando que tu producto de LLM funcione de manera fiable en producción.

Si te interesa, reserva una demostración con nosotros: Demostración de Galtea