Ajanlara dayanan yapay zekâ uygulamaları, mutlaka yeni bir protokol gerektiği için değil, trafik modeli farklı olduğu için geleneksel web arayüzlerinden farklı bir tasarım gerektirir. Tek bir konuşma onlarca bağımsız isteğe yayılabilir; ajan ise altyapı üzerindeki yükü azaltacak insanlara özgü bekleme aralıkları olmadan, makine hızında çalışmayı sürdürür.
The New Stack'te Oracle sponsorluğundaki bir içerik kapsamında yayımlanan makale, ölçeklenebilir ve OpenAI uyumlu arayüzler oluşturmak için mikro hizmetlerdeki eski ilkelerin yeniden kullanılmasını öneriyor. Kavram kanıtı modelinde ise Oracle AI Database Free temel alınıyor.
Ajanların trafiği web uygulamalarından neden farklıdır?
Tarayıcı, yönlendirmenin sabit olması ve kullanıcının düşünme aralıkları sayesinde oturumu tek bir sunucu üzerinden sürdürebilir. Ajan ise art arda 40 döngü yürütebilir ve her döngü, protokolün aynı sunucuya yönlendirileceğini garanti etmediği bağımsız bir HTTP isteği olarak ulaşır. Konuşma geçmişi yerel bir işlem belleğinde tutulursa, bir sonraki istek hizmetin başka bir örneğine geçtiğinde bağlamı kaybedebilir.
Araç çağrıları da beklenmedik biçimde dallanabilir; tek bir istek hiçbir ek hizmet çağırmayabileceği gibi, aralarında 400 milisaniye sürebilen vektör aramalarının da bulunduğu birden fazla çağrıya yol açabilir. Ajanlar kendi yeniden deneme politikalarıyla yükü artırırken trafik, kullanıcı davranışından çok eşzamanlılık ve donanım sınırlarının belirlediği sürekli partiler hâlinde gelir.
İlk tasarımdaki sessiz sorun
Yazar, konuşma geçmişini işlem içindeki bir sözlükte tutan, eşzamanlılığı kontrol etmek için tek bir küme kullanan ve araç çağrılarını isteğin kendi akışı içinde gerçekleştiren bir prototip sunuyor. Bu tasarım testlerde çalışır; ancak pratikte konuşmanın tüm rollerinin aynı makineye ulaşmasına bağlıdır.
Her biri dört rolden oluşan 200 konuşma birden fazla örneğe sırayla dağıtıldığında, sunucular HTTP 200 kodları döndürmeye devam ederken model doğru konuşma geçmişi olmadan yanıt verebilir. Bu nedenle sorun mutlaka açık bir teknik arıza olarak görünmez; bunun yerine kullanıcı açısından yanlış davranış şeklinde ortaya çıkar.
Sorunu ele almak için üç ilke
- Durumu işlem dışına çıkarmak: Konuşma durumu ve araç çağrılarının kaydı ortak bir depoda saklanır; böylece herhangi bir hizmet örneği konuşmanın herhangi bir rolüne hizmet edebilir.
- Yalıtım veya bariyerler: Konuşmanın tamamlanması ve araçların yürütülmesi gibi farklı akışlara ve bağımlılıklara bağımsız eşzamanlılık sınırları ve zaman aşımları verilir. Böylece bunlardan birinin arızalanmasının tüm sistemi tüketmesi önlenir.
- Akıllı uç noktalar ve basit işlem hatları: OpenAI uyumlu protokol istikrarlı bir taşıma katmanı olarak kalırken yönlendirme mantığı, bütçe ve bellek yönetimi ile araç çağırma politikaları bunun üzerinde konumlandırılır.
Pratikte ne değişir?
Kavram kanıtı modeli sistemi, OpenAI protokolüyle konuşan ve durum tutmayan bir ağ geçidine; konuşma kaydı ile denetim kaydının sahibi olan bir bellek hizmetine; özel eşzamanlılık sınırları ve zaman aşımları bulunan bağımsız bir araç hizmetine; ortak depo işlevi gören Oracle AI Database Free veritabanına ayırır. Tasarım, konuşma eşzamanlılığı için 24 yuva ve araç çağrıları için 8 yuva gibi bağımsız kontrol sinyalleri kullanır.
Bu ayrım, yerel dosya sistemine veya istek yönlendirmesinin sabit olmasına bağlı kalmadan yatay ölçeklendirmeye olanak tanır. Protokol uyumlu olduğu sürece resmî OpenAI istemcisi de SDK'da değişiklik yapılmadan arayüzü kullanabilir.
Editoryal sonuç, yapay zekâ ajanlarının ölçeklenebilirliğinin yalnızca örnek sayısını artırarak çözülemeyeceğidir. Asıl test, durumu korumak, yavaş bağımlılıkları kontrol etmek ve yeniden denemelerin veya araç çağrılarının ajan partilerini ardışık bir arızaya dönüştürmesini önlemektir. İçerik Oracle sponsorluğunda olduğu için makale, bağımsız bir veritabanı karşılaştırması veya her ortamda belirli bir performans garantisi değil, mimari bir yaklaşım ve kavram kanıtı modeli sunuyor.