Evaluaciones para agentes de IA
Las evaluaciones (evals) son pruebas sistemáticas que miden lo bien que un agente de IA realiza una tarea: una batería de pruebas para sistemas no deterministas, usada para detectar regresiones y comparar cambios.
Como los agentes son no deterministas, no puedes juzgar un cambio probándolo una sola vez. Las evaluaciones ejecutan el agente contra un conjunto fijo de tareas con criterios de éxito definidos y puntúan los resultados —de forma automática, mediante otro modelo que actúa como juez, o por personas. Un buen conjunto de evaluaciones convierte el «parece que va mejor» en un número que puedes seguir, de modo que puedes saber si un nuevo prompt, modelo o herramienta realmente mejoró las cosas o rompió algo silenciosamente.
Puntos clave
- Un conjunto de tareas repetible con criterios de éxito, puntuado para medir la calidad del agente.
- Esencial porque los agentes son no deterministas: una sola ejecución no prueba nada.
- La puntuación puede ser automática, juzgada por un modelo (LLM como juez) o humana.
- Convierten el subjetivo «parece mejor» en una métrica seguible y detectan las regresiones antes de que lo hagan los usuarios.
Apréndelo construyendo
Way of the Agent enseña ingeniería de agentes de IA nivel a nivel — conceptos como este y luego práctica, XP y las AI Chronicles.
Empieza gratis →