En son haberleri, açıklamaları ve bağlantılı teknoloji hikâyelerini takip edin.
Elastic’ten Susan Chang, ekiplerin yapay zekâ ajanlarına yönelik dağınık değerlendirmelerden programatik değerlendirmeyi, LLM-as-a-judge yaklaşımını ve derin izlemeyi birleştiren birleşik bir çerçeveye nasıl geçtiğini açıklıyor. Deneyim, özellikle test verileri oluşturulurken ve metrikler kalibre edilirken otomasyonun alan uzmanlarına duyulan ihtiyacı ortadan kaldırmadığını gösteriyor.