Suivez les dernières actualités, explications et histoires technologiques associées.
Susan Chang d’Elastic explique comment les équipes sont passées d’évaluations disparates des agents d’IA à un cadre unifié combinant évaluation programmatique, LLM-as-a-judge et traçage approfondi. L’expérience montre que l’automatisation ne supprime pas le besoin d’experts du domaine, notamment lors de la constitution des données de test et de l’étalonnage des métriques.