Forter, programlama uzmanlığı ihtiyacını azaltan ve analistlerle mühendislerin fikirlerini hızlıca denemesine olanak tanıyan bir ortam tasarladıktan sonra, iki hafta süren uygulamalı bir çalışma maratonu kapsamında yaklaşık 200 kişiyi yapay zekâ ajanları oluşturmaya dahil etmeyi başardı. Şirketin baş mühendisi Ben Maraney, bu deneyimi ajan oluşturmanın tüm zorluklarını bir kerede çözmeye çalışmak yerine gereksiz karmaşıklığı ortadan kaldırmaya yönelik bir ders olarak sunuyor.
Başlangıç: beş haftalık bir uygulamalı çalışma maratonu
Amaç, araştırma ve geliştirme ekiplerini kendi ajanlarını oluşturmaları konusunda eğitmekti. Bu ekiplerde hukuk, psikoloji ve bilim geçmişine sahip, hatta bazılarının daha önce SQL yazmadığı analistler de bulunuyordu. Ekibin ortamı beş hafta içinde hazırlaması, ardından iki haftalık bir oluşturma maratonu yürütmesi gerekiyordu. Bu nedenle tasarım üç alana odaklandı: araçlar, platformlar ve kullanıcıların önündeki engellerin kaldırılması.
Dağınık araçlar yerine merkezi bir MCP sunucusu
Forter, Toolchain adını verdiği, MCP protokolünü temel alan dahili bir sunucu kullandı. Sunucu, araçları keşfetmek, denemek ve her ajana özgü bağlantıları oluşturmak için tek bir arayüz sağladı. Ayrıca kullanıcıya ajanın yalnızca ihtiyaç duyduğu araçları seçme imkânı verdi; böylece ajana kafasını karıştırabilecek veya uygunsuz araçları kullanmasına yol açabilecek geniş bir erişim tanınmadı.
Araçların sayısı, ekibin kuruluşunda yaklaşık 20 iken maraton başladığında yaklaşık 60'a, maratonun sona ermesinden iki hafta sonra ise yaklaşık 100'e yükseldi. Deponun birleştirilmesi ve açık örneklerle yapılandırma dosyalarının bulunması, yeni araçların hızlıca eklenmesine yardımcı oldu; ayrıca belirteç tüketimini ve araç kullanımını izleme gibi yönetişim imkânları sağlandı.
Şirket, kısa süre içinde özel bir artırılmış getirimli üretim (RAG) sistemi oluşturmak yerine Toolchain'i Confluence, Asana, Jira, Slack ve Salesforce gibi dahili kaynaklarda arama yapmak için kullanılan Glean platformuna bağladı. Üç tür araç sunuldu: ilgili belgeleri ve bölümleri arama, belgenin tamamını okuma ve belgeyi ajanın belirlediği bir soru veya eksen doğrultusunda özetleme.
Kodsuz platformdan özelleştirilebilir çözümlere
Forter, hızlı ve az kod gerektiren bir sohbet deneyimi sunmak için LibreChat kullandı. Kullanıcılar ajanın çağırdığı araçları, gönderdiği sorguları ve parametreleri ve aldığı sonuçları görebiliyordu. Bu, MCP entegrasyonu zaman zaman istikrarsız olsa ve sürüm ile özelleştirme üzerindeki kontrol sınırlı kalsa da ajanların davranışını anlamaya ve sorunları erken keşfetmeye yardımcı oldu.
Daha karmaşık durumlar için şirket, geliştiricilere kod üzerinde tam kontrol, araçlar ve alt ajanlar ekleme imkânı veren örnek depolar sağladı. Ancak bunların kurulumu ve dağıtımı, özellikle analistler için daha yavaştı. Forter daha sonra AI Hub adlı dahili bir arayüz oluşturdu. Bu arayüz, modelin seçilmesine, sistem mesajının yazılmasına ve araçların belirlenmesine, ardından ajanın birkaç adımda paylaşılmasına olanak tanıyordu.
Etkileşimli olmayan ajanlar için ise Strands çerçevesi, Jira ve Asana biletlerinin oluşturulması gibi zaman çizelgelerine veya olaylara göre çalıştırılmaları amacıyla Argo Workflows ile birlikte kullanıldı. Maraney, mevcut bir zamanlama ve çalıştırma sisteminin bulunmasının ajanlara özgü yeni bir mimariye duyulan ihtiyacı ortadan kaldırabileceğini belirtiyor.
Gerçekte ne oluşturuldu?
Kullanım alanları arasında analistlerin daha iyi hipotezler ve deneyler formüle etmesine yardımcı olan, olay sonrası raporları inceleyen ve Snowflake ile Databricks not defterlerini kullanarak satıcı performansındaki düşüşleri analiz eden ajanlar yer aldı. Şirket ayrıca işlem kararları ve faturalandırmayla ilgili soruları yanıtlamak üzere kodlara, yapılandırmalara ve verilere erişen Layla ve Penny gibi uzman ajanlar geliştirdi. Layla'nın kullanımı, sistem hakkındaki bilgisi herhangi bir tek kişinin bilgisinden daha kapsamlı hâle geldikten sonra müşteri başarısı ve destek ekiplerine de yayıldı.
Etkileşimli olmayan ajanlara örnek olarak benzer satıcılara dayanarak yeni bir satıcı için başlangıç yapılandırmaları önermek, bir destek bileti geldiğinde ön araştırma hazırlamak ve anomali uyarılarını analiz ederek bunları kod değişiklikleriyle ilişkilendirmek verilebilir. Forter ayrıca olaylara müdahale eden bir ajanı test etti, ancak görünüşte mükemmel sonuçlarının esas olarak insanların daha önce BetterNext raporlarında yazdığı kök neden analizlerini kopyalamaya dayandığını keşfetti.
Pratikte ne değişiyor?
Bu deneyim, gözlemlenebilirliğin ikincil bir özellik olmadığını gösteriyor. Ajanın dayandığı araçları, parametreleri ve sonuçları göstermek, olaylara müdahale eden ajanın gerçekte kök nedeni çıkarım yoluyla belirlemediğini keşfetmek için gerekliydi. Bu nedenle Forter daha sonra ajan oturumlarını, araç çağrılarını ve iş akışını izlemek üzere Langfuse'u ekledi.
Deneyim ayrıca birden fazla platform kullanılmasının kasıtlı olabileceğini gösteriyor: hızlı deneme için kodsuz bir platform, özelleştirme için yazılım çözümleri ve olaylara veya zaman çizelgelerine göre çalışan ajanlar. Buna karşılık şirket, her ajan için ayrı bir depo oluşturma modelinde sorunlarla karşılaştı. Ardından izleme gibi ortak yeteneklerin eklenmesini kolaylaştırmak için birbiriyle bağlantılı ajanları içeren daha az sayıda depoya geri döndü.
Maraney ayrıca uygunluk, tutarlılık ve güvenlik gibi genel değerlendirme ölçütlerinin kalite konusunda yanlış bir izlenim verebileceği konusunda uyarıyor. Yararlı bir değerlendirme; yanıtın doğruluğunu, uygun araçların kullanılmasını ve doğru bağlamın getirilmesini sınamalıdır. Bunlar daha zordur ve iyi bir yanıtın ne anlama geldiği konusunda kesin bilgi gerektirir. Bu nedenle insanın karar verme döngüsünün içinde kaldığı dahili deneylerde gelişmiş değerlendirmeler ertelenebilir, ancak bu durum değerlendirmelerin kalıcı bir alternatifi olarak görülmemelidir.
Ölçeklendirme girişimlerinin, özellikle verilerin nerede işlendiği ve saklandığı konusunda hukuk ve güvenlik ekiplerini de erken aşamada sürece dahil etmesi gerekir. Maraney, Amazon Bedrock gibi bir bulut hizmetinin kullanılmasının ve verilerin saklanmamasına ilişkin politikaların belgelenmesinin, her ajanı ayrı bir onay sürecine dönüştürmek yerine bu endişelerin kurumun kontrolleri kapsamında ele alınmasına yardımcı olduğunu belirtiyor.