Aktuelle Berichte, Erklärungen und verbundene Technologiethemen.
Susan Chang von Elastic erläutert, wie Teams von verstreuten Bewertungen für KI-Agenten zu einem einheitlichen Framework übergingen, das programmatische Bewertungen, LLM-as-a-judge und tiefgehendes Tracing kombiniert. Die Erfahrung zeigt, dass Automatisierung den Bedarf an Fachexperten nicht beseitigt, insbesondere beim Aufbau von Testdaten und bei der Kalibrierung von Metriken.