OpenAI, yüksek performans ile düşük işletim maliyetini bir araya getiren görevlere odaklanan, GPT-6 Sol’un geliştirilmiş sürümü GPT-6.1 Sol’u duyurdu. Şirket, modelin programlama, bilgisayar kullanımı, belge analizi ve çok adımlı profesyonel iş akışlarında GPT-6 Astra’ya yaklaştığını, standart fiyatlarının ise Astra fiyatlarının yaklaşık beşte biri olduğunu söylüyor.
Geniş ölçekli kullanım için tasarlanan fiyatlandırma
GPT-6.1 Sol API’nin maliyeti, bir milyon giriş belirteci başına 2 dolar ve bir milyon çıkış belirteci başına 10 dolar. Önbelleğe alınan belirteçlerin maliyeti ise bir milyon belirteç başına 0,10 dolar; OpenAI’ye göre bu, standart giriş fiyatına kıyasla %95 indirim anlamına geliyor. Bu durum modeli, aynı bağlamı tekrarlanan isteklerde yeniden kullanan aracı uygulamalar için özellikle uygun hale getiriyor.
Uygulamalı test sonuçları
Gerçek kod tabanlarında uzun yazılım mühendisliği görevlerini ölçen DeepSWE v1.1 testinde GPT-6.1 Sol, GPT-6 Astra ile aynı sonucu elde etti, ancak maliyeti yaklaşık beşte bir düzeyinde kaldı. Profesyonel belge analizini ölçen GDP.pdf testinde model; finans, sağlık ve hukuk gibi alanlardaki tabloları, grafikler ve PDF dosyalarını içeren görevlerde Astra’nın performansına yaklaştı.
Çok adımlı iş akışlarını ölçen AutomationBench testinde model, orta düzey akıl yürütmede Opus 5.5’i 2,2 puan ve GPT-6 Sol’u 4,8 puan geride bıraktı. Bilgisayar kullanımını ölçen OSWorld 2.0 testinde ise Astra’nın 2,1 puan altında kaldı; belirtilen kurulumda görev başına maliyeti Astra’nın yaklaşık yedide biri, GPT-6 Sol’un ise yarısından azdı.
Veri analizi, simülasyon ve teorem ispatını ölçen Terminal-Bench Science 0.1’de görev başına ortalama maliyet 5,47 dolar oldu; bu tutar Opus 5.5 için 23,21 dolar ve GPT-6 Astra için 23,80 dolardı. Bununla birlikte Astra, testte %68,1’lik sonuçla en yüksek performansını korudu.
Doğruluk ve güvenlik sınırlamaları
GPT-6.1 Sol, en yüksek akıl yürütme düzeyinde gerçeklere ilişkin hata oranını %4,1’e düşürdü; bu oran GPT-6 Sol’da %4,5 ve GPT-6 Astra’da %4’tü. OpenAI, bu değerlendirmenin hata üretme ihtimali yüksek zorlu istemlere dayandığı ve ChatGPT’nin olağan kullanımını temsil etmediği konusunda uyarıyor.
Şirket ayrıca modelin çalışmayan araçları kullanıcıya bildirme, izin verilmeyen sonuçlardan kaçınma ve açık kısıtlamalara uyma konusunda daha iyi hale geldiğini söylüyor. Ayrıca GPT-6 Astra ve GPT-6 Sol gibi modelin de otomatik güvenlik kontrolünü aşmaya çalışmadığını belirtti. Kaynak, bu iddiaların doğrulama metodolojisi hakkında bağımsız ayrıntılar sunmuyor.
Uygulamada ne değişiyor?
OpenAI, GPT-6.1 Sol’u her testte mümkün olan en yüksek sonucu elde etmektense belirteç maliyetini düşürmenin daha önemli olabileceği yüksek hacimli uygulamalar için bir seçenek olarak sunuyor. Bu durum yazılım aracıları, belge analiz hizmetleri ve otomasyon geliştiricileri için önem taşıyor; ancak sonuçlardaki fark görev türü ve akıl yürütme düzeyiyle bağlantılı olmaya devam ediyor. Bu nedenle daha düşük maliyet, Astra’nın her durumda yerine geçeceği anlamına gelmiyor.
Model; Plus, Pro, Business, Enterprise ve Edu aboneleri tarafından ChatGPT Work ve Codex üzerinden kullanılabiliyor. Geliştiriciler ise OpenAI API’de modeli gpt-6.1-sol adıyla kullanabiliyor. Model henüz standart ChatGPT sohbet arayüzünde sunulmadı. OpenAI ayrıca GPT-6.1 Sol Ultrafast ve GPT-6 Astra Ultrafast’ı duyurdu ve Astra’ya kıyasla sekiz kata varan hız iddiasında bulundu. Buna karşılık, bu hafta piyasaya sürülmesi beklenen GPT-6.1 Astra’yı, dahili testlerdeki güvenlik endişelerine ilişkin raporların ortasında henüz piyasaya sunmadı.