Para transferi, sağlık hizmetleri veya altyapıyla ilgilenen sistemlerde yapay zekâ ajanının çoğu sefer başarılı olması yeterli değildir. Üretimde dil modeli sistemlerini çalıştırmaya yönelik altı seviyeli bir olgunluk modelinin ilk seviyesindeki temel fikir, modeli tek bir düğümün içine hapsetmek ve çevresindeki her şeyi test edilebilen, incelenebilen ve denetlenebilen sıradan kod olarak bırakmaktır.
Makale bu yaklaşımı “determinizm katmanı” olarak sunuyor: Sistem, modelin karmaşık girdiler üzerinde muhakeme yapma yeteneğini koruyor, ancak modelin iş durumu üzerinde doğrudan yetkiye sahip olmasını veya hassas eylemleri gerçekleştirmesini engelliyor.
Ajan önerir, uygulamaz
Ajan, bağlamı önerilen bir karara dönüştüren saf bir işlev olarak çalışır. Karar kimliği, gereken yetki, önerilen değişiklik, güven puanı, yönlendirme yolu, gerekçeler ve kanıtlar üretir; ancak iş durumunu değiştirmez. Sonuç, makalenin substrate olarak adlandırdığı ve gerekli onay alındıktan sonra sonucu uygulamakla görevli ayrı bir bileşene aktarılır.
Bu ayrım sisteme üç pratik özellik kazandırır: dış dünyayı simüle etmeden ajanı test edebilme, hatalı çıktıların etkisini reddedilebilir bir öneriyle sınırlama ve ajanlar arasındaki gizli yan etki zincirlerini önleme. Böylece denetlenebilir soru şu hâle gelir: Model ne önerdi, kim onayladı ve gerçekte ne uygulandı?
Serbest döngü yerine sabit akış şeması
Makale, ReAct modelinin her seferinde bir sonraki adımı belirlemesine izin vermek yerine her yetenek için sabit bir akış şeması öneriyor. Örneğe göre istek; karar girdisi, girdilerin kontrolü ve bağlamın yüklenmesi düğümlerinden, ardından dilsel çıkarım için tek bir düğümden, sonra da çıktı engelleri ve doğrulama, isteğe bağlı tahkim, güvenin birleştirilmesi, yönlendirme, önerinin hazırlanması ve belleğe ve karar kaydına yazma düğümlerinden geçiyor.
Bu yapı, yürütme yolunu önceden bilinir hâle getirir, yürütme süresini ve maliyetini sınırlar ve her düğümün ayrı ayrı test edilmesine olanak tanır. Deterministik olmayan düğüm ise llm_decision düğümüdür; yapılandırılmış bir girdi alır ve yapılandırılmış bir çıktı üretir. İzin verilen değerlerin, şema uyumunun ve iş kurallarının doğrulanmasını ise uzmanlaşmış kod gerçekleştirir.
Yapılandırılmış çıktılar kararın doğruluğu anlamına gelmez
Makale, serbest metne güvenip kararı daha sonra metinden çıkarmaya çalışılmasına karşı uyarıyor. Bunun alternatifi bir JSON şeması, araç çağırma veya dilbilgisi kurallarıyla kısıtlanmış üretim kullanmak; ardından sonuç eşleşmediğinde sınırlı sayıda yeniden denemeyle doğrulama yapmak ve sonraki aşamalara bir tahmini aktarmak yerine güvenli şekilde başarısız olmaktır.
Ancak bu işlem çıktının biçimini düzenler, hükmün doğruluğunu değil. Bir JSON nesnesi sözdizimsel açıdan doğru olabilir, ancak yanlış bir karar içerebilir. Bu nedenle iş kurallarının doğrulanması, değerlendirme ve bağımsız güven sinyalleri sonraki katmanlarda tutulmalıdır.
Güven, yükseltme ve silinemeyen kayıt
Güven; model sinyali, doğrulama sonuçları ve hassas kararlardan örnekler alınırken ikinci bir modelin incelemesinden elde edilen sonuçların birleştirilmesiyle oluşturulur. Ardından sistem kararı otomatik uygulamaya, insan incelemesi önerisine, zorunlu insan incelemesine veya kararın reddine yönlendirir. Makale, güven puanının ajanın kendisi tarafından belirlenen bir alan olmaması gerektiğini; bunun yerine bağımsız sinyallerden hesaplanan bir sonuç olması gerektiğini vurguluyor. Eşiklerin başlangıçta ihtiyatlı belirlenmesi ve yalnızca veriler bunun güvenli olduğunu kanıtladığında düşürülmesi gerekir.
Ayrıca her karar; model ve istem sürümünü, karar girdilerinin özetini, kararı, güveni ve yönlendirme yolunu içeren ek ve silinemeyen bir kayda yazılmalıdır. Düzeltmeler önceki kayıtları değiştirmez; bunların yerine geçen karara işaret eden yeni kayıtlar olarak eklenir. Makale, hassas girdilerin ham verileri yerine özetlerinin saklanmasını ve baskı altında bile yazma işleminin atlanmamasını öneriyor; çünkü kayıt yalnızca izleme verisi değil, temel başvuru kaynağıdır.
Yinelemeli döngüye ne zaman izin verilir?
Metodoloji ReAct döngülerini tamamen reddetmiyor, ancak bunları adımların sayısı ve sırasının modelin arama sırasında keşfettiklerine bağlı olduğu durumlarla sınırlıyor. Kullanıldıklarında bile yinelemeler için açık bir sınır, her yetenek için izin verilen araçların listesi ve her adımın kaydedilmesi zorunlu olmalı; çıktı da aynı engeller, doğrulama, güven ve yönlendirme aşamalarına yeniden tabi tutulmalıdır. Sonuca ulaşılmadan sınıra erişilirse, yol sonsuz bir döngü yerine insan incelemesine yönelmelidir.
Editoryal değerlendirme: Buradaki gerçek değişiklik daha iyi bir model seçmek değil, güvenin merkezini “ajan özerkliğinden” onu çevreleyen sınırların mühendisliğine taşımaktır. Bu tasarım, hükmün doğruluğu veya güvenin kalibrasyonu sorununu otomatik olarak çözmez; ancak başarısızlığın yalıtılabilir, yeniden üretilebilir ve incelenebilir olmasını sağlar. Bu nedenle sürekli değerlendirmenin veya her yetenek için uzmanlaşmış doğrulamanın alternatifi olarak değil, yüksek sonuçlu sistemler için temel bir kurucu ilke olarak kullanılabilir.