Kurumlar sınırlı sayıda yapay zekâ ajanını denemekten düzinelerce veya yüzlerce ajanı günün her saati çalıştırmaya geçtiğinde, belirleyici unsur artık yalnızca modelin kalitesi olmuyor. Stack Overflow’un yayımladığı Leaders of Code söyleşisinin ikinci bölümünde Google’dan Andy Gutmann, Stack Overflow platform mühendisliği yöneticisi Peter O’Connor ile bu geçişin ekonomisini ele aldı: gereken bağlam miktarı, sembol maliyeti, yatırım getirisinin ölçülmesi ve platform mühendisliği ekiplerinin ajanları pratikte yönetebilmek için neler geliştirmesi gerektiği.
Söyleşinin temel tezi, sorunun tek bir modelin değil, bütünleşik bir sistemin sorunu hâline geldiği yönünde. Nihai performans; modele, modelin çalıştırılma mekanizmasına, kendisine sunulan bağlama, özelleştirme düzeyine ve çağırdığı araçlara bağlı. Gutmann’a göre amaç her görevde en gelişmiş modeli kullanmak değil, gerekli sonucu en düşük maliyetle sağlayan en az karmaşık modeli seçmek. Gemini 3.5 Flash gibi hafif modeller bazı kullanımlar için yeterli olabilirken, diğer durumlarda Gemini Pro modeli gerekebilir.
Uygun bağlam, sembol sayısından daha önemli
Gutmann, “sembol maksimizasyonu” olarak adlandırdığı yaklaşımı eleştiriyor; girdilerin boyutunu artırmak veya çıkarım döngülerini uzatmak mutlaka daha iyi bir sonuç anlamına gelmiyor. Ona göre pratik yönelim, bağlamı sonucu gerçekten etkileyen bilgilerle sınırlamak ve ajanın daha az düşünme döngüsüne ihtiyaç duyması için yürütme yollarının doğruluğunu artırmak. Bu da maliyeti yalnızca modelin fiyatına değil, araştırma ve veri erişiminin kalitesine doğrudan bağlıyor.
Ancak “kullanılabilir en az bağlamı” belirlemek basit bir iş değil. Gutmann, hangi bağlam bölümünün sonucu gerçekten iyileştirdiğini anlamak için veri ve model değerlendirmesinin birlikte yapılması gerektiğini söylüyor. Bu nedenle bağlam sorununu tamamen çözdüğünü iddia eden kurumlara şüpheyle yaklaştı; Google’ın bile bu sorunu bütünüyle çözmediğini ve her göreve neyin dâhil edilmeye değer olduğunu belirlemek için değerlendirmelere, ajanların izlediği yolların takibine, aramanın iyileştirilmesine ve verilerin zenginleştirilmesine dayandığını vurguladı.
Bu nokta yapay zekâ ekipleri için önemli; çünkü düzenlenmiş bilgiyi veya veri şemalarını başlı başına bir amaç hâline getirmeye karşı uyarıyor. İnsanların bir bilgiyi yararlı görmesi, bunun ajan için daha iyi bir sonuç doğuracağını kanıtlamaz. Ölçüm, gerçek çıktılardan ve izlenen yollardan başlamalı; karar yetkisinin veya insan muhakemesinin gerekli olduğu durumlarda insan döngünün içinde tutulmalı.
Ölçek, maliyet ve getiri hesabını değiştiriyor
Geleneksel çalışma ortamında kullanım hacmi, çalışan sayısı ve çalışma saatlerinden yaklaşık olarak tahmin edilebilir. Ajanlar ise daha yüksek hızda ve günün her saati çalışır; Gutmann’ın ortaya koyduğu senaryoya göre tek bir çalışanın düzinelerce ajanı veya kurumun milyonlarca ajanı olabilir. Bu nedenle kullanım ve maliyet doğrusal olmayan bir biçimde büyüyebilir; bu da tüketim için açık bir yönetişimi ve her kullanımın ürettiği getirinin bilinmesini zorunlu kılar.
Gutmann, yatırım getirisinin işlenen sembol sayısıyla ölçülmesi gerektiğini düşünmüyor. Ölçüt, kurumun geçmişte elde ettiğinden farklı veya daha iyi bir sonuç elde edip etmediği. Müşteri desteği, site güvenilirliği ve operasyonlarının iyileştirilmesi ve Deutsche Telekom’da proaktif bakım da dâhil olmak üzere ağların bağımsız biçimde yönetilmesi gibi kullanımlara atıfta bulundu. Bunlar söyleşide yer alan örneklerdir; materyalde yayımlanmış nicel sonuçlar veya karşılaştırmalı bir çalışma bulunmuyor.
Söyleşinin ortaya koyduğu pratik yönlerden biri de denemenin maliyetini düşürmek. Gutmann, daha önce bir mühendisin üç ila dört ayını alabilecek bir fikir için bir hafta sonunda prototip oluşturduğunu söyledi. Modelin üretime hazır kod olmadığını, ancak tasarım risklerini erken ortaya çıkarmaya ve yanlış bir yola aylarca yatırım yapma olasılığını azaltmaya yardımcı olduğunu açıkladı. Buradaki değer, üretim geliştirmesinin yerine geçmek değil, daha fazla kaynağı taahhüt etmeden önce hipotezlerin sınanmasını hızlandırmak.
Ajan, platform için yeni bir kişilik
Gutmann, platform ekiplerinin ajanı; geliştiriciler, veri bilimcileri, veri mühendisleri ve iş birimlerindeki kullanıcıların yanı sıra hizmet verilmesi gereken bir kişilik olarak ele almasını öneriyor. Bu, mevcut araçların ajanlar çağına olduğu gibi aktarılmayabileceği anlamına geliyor; ancak bazı eksenler temel önemini koruyor: güvenlik ve yönetişim, maliyet, kullanılabilirlik ve ölçeklenebilirlik ile ajanlara özgü operasyonel izleme.
Pratikte kurumun ajanın üretim ortamında ne yaptığını, hangi araçları ve verileri çağırdığını, bunun ne kadara mal olduğunu ve istenen sonuca doğru ilerleyip ilerlemediğini bilmesi gerekiyor. Ayrıca denetimsiz kullanımı önleyecek becerilere ve kontrollere de ihtiyaç var. Söyleşi, altyapının hata önleme sorumluluğunun daha büyük bir bölümünü platforma aktarması gerektiğine işaret ediyor; her operasyonel kararı kullanıcıya veya ajana bırakmak yerine.
Gutmann, sayıları fazla olmasa bile veri bilimcileri ve veri mühendislerini platform ekiplerine dâhil etmenin yararlı olabileceğini düşünüyor. Veri mühendisliği, doğru, denetlenen ve etkinleştirilebilir verilerin doğru yere ulaşmasını sağlamak için önemini koruyor; dolandırıcılık tespiti ve tahmin gibi uygulamalar ise geleneksel makine öğrenmesinden yararlanmaya devam ediyor. Bu da “önce yapay zekâ” yaklaşımının veri kalitesi veya uzman muhakemesi ihtiyacını ortadan kaldırmadığını gösteriyor.
Yeni uzmanlar neler öğrenmeli?
Söyleşinin sonunda Gutmann, matematik, sistemlerin yapısı ve teknolojilerin nasıl oluşturulduğunu anlama dâhil olmak üzere bilgisayar biliminin temellerinin önemini koruduğunu vurguladı; yazılıma odaklanılan yılların ardından donanımın öneminin yeniden arttığına da dikkat çekti. Bununla birlikte ajanlarla programlama ve onlar aracılığıyla sonuç elde etme becerisinin, iş sorunlarını anlamanın yanı sıra talep edilen bir yetkinlik hâline geleceğini ekledi.
certi.news’un editoryal değerlendirmesi: Materyalin tanımladığı asıl değişim yeni bir platformun veya modelin piyasaya sürülmesi değil, darboğaz noktasının “Model bunu yapabilecek kapasitede mi?” sorusundan “Sistemi nasıl tasarlıyor, denetliyor ve ölçüyoruz?” sorusuna kayması. Bununla birlikte röportaj, maliyet tasarruflarına veya karşılaştırılabilir performans ölçütlerine ilişkin bağımsız rakamlar sunmuyor; örnekleri de konuşmacıların deneyimlerinden ve öngörülerinden geliyor. Bu nedenle röportaj, nicel bir kanıt olarak değil, pratik bir analiz ve tasarım yönelimi olarak ele alınmalı; her kurumun yalnızca ajan kullanımını artırarak maliyetlerini düşüreceği sonucuna varılmamalı.