Sigue la cobertura, explicaciones e historias tecnológicas relacionadas.
Susan Chang, de Elastic, explica cómo los equipos pasaron de evaluaciones aisladas de agentes de IA a un marco unificado que combina evaluación programática, LLM-as-a-judge y trazabilidad profunda. La experiencia demuestra que la automatización no elimina la necesidad de expertos en el dominio, especialmente al crear datos de prueba y calibrar métricas.