Meta, temel iyileştirmeleri programlama, uzun süreli aracı görevler ve karmaşık çok adımlı iş akışlarına odaklanan yapay zekâ modeli Muse Spark 1.3’ü duyurdu. Model, Muse Spark 1.2’nin piyasaya sürülmesinden yaklaşık bir ay sonra, 3 Eylül 2026 itibarıyla Muse Code programlama aracı ve Meta Model API üzerinden kullanıma sunuldu.
Meta, yeni sürümü şimdiye kadarki en yetenekli modeli olarak tanımlıyor; ancak bu ifade şirketin kendi nitelendirmesi olmaya devam ediyor ve modelin tüm testlerde veya kullanım alanlarında üstün olduğu anlamına gelmiyor.
Uzun süreli görevleri yönetmede daha iyi yetenekler
Muse Spark 1.3, tek bir uzun görüşme içinde birden fazla görevi ele alacak şekilde tasarlandı. Açık uçlu bir hedef verildiğinde model, gerekli bağlamı oluşturmak için araçları kullanabiliyor, çalışma planındaki eksikleri tespit edip düzeltebiliyor ve yürütme sırasında öğrendiği bilgileri nihai sonuca aktarabiliyor.
Meta ayrıca modelin, doğrudan varsayımlara başvurmak yerine belirsiz talimatlarla başa çıkma konusunda daha yetenekli hâle geldiğini söylüyor. Model; açıklayıcı sorular sorabiliyor, görevin gerçekleştirilememesi durumunda kullanıcıdan yardım isteyebiliyor ve geri alınamaz işlemlerden veya önemli sonuçlar doğurabilecek eylemlerden önce ön onay alabiliyor. Şirket, uzun talimatlardaki kısıtları koruma ve aynı görüşme içinde eski talepleri yeni taleplerle ilişkilendirme konusunda da iyileşme olduğunu vurguluyor.
Meta, modelin yeteneklerini değerlendirmede daha isabetli hâle geldiğini ve gerçekte gerçekleştiremeyeceği bir görevi tamamlamış izlenimi verdiği durumları azaltmayı amaçladığını belirtiyor.
Programlama ve kaynak kullanımında kazanımlar
Meta mühendislerinin yaptığı karşılaştırmalara göre Muse Spark 1.3, Muse Spark 1.2’ye kıyasla benzer görevleri yaklaşık %20 daha az araç çağrısı ve %25 daha az token kullanarak gerçekleştiriyor. Şirkete göre bu kazanımlar, gereksiz diyalog turlarının azaltılması ve daha az ayrıntılı ancak daha temiz kod üretilmesiyle de bağlantılı.
Uzun süreli yazılım geliştirme görevlerine yönelik DeepSWE v1.1 testinde model 75,4 puan aldı. Test, TypeScript, Go, Python, JavaScript ve Rust dilleriyle yazılmış 91 yazılım deposunda 113 görevi kapsıyor. Meta’nın tablosuna göre bu sonuç, GPT-5.6 Sol ve Claude Opus 5’i geride bıraktı; ancak başka değerlendirmelerde gelişmiş rakip modellerin gerisinde kaldı.
Rakamlar gerçekte neyi kanıtlıyor?
DeepSWE sonuçları, söz konusu testte ölçülebilir bir iyileşme olduğunu gösteriyor; ancak tek başına Meta’nın tüm kullanım senaryolarında OpenAI ve Anthropic arasındaki farkı kapattığını kanıtlamaya yetmiyor. Şirketin kendisi de diğer kuruluşlara ait modeller üzerindeki testlerin her model için optimize edilmemiş olabileceği ve bu nedenle ilgili modelin ulaşabileceği en yüksek performansı yansıtmayabileceği konusunda uyarıyor.
Artificial Analysis platformu da modelin max sürümüne Intelligence Index’te 62 puan verdi ve Muse Spark 1.3’ün bir milyon tokenlık bağlam penceresine sahip olduğunu, metin, görüntü ve video girdilerini desteklediğini belirtti. Pratik karşılaştırma; kullanılan teste, değerlendirme yöntemine ve modeli çevreleyen aracı yapısına bağlı olmaya devam ediyor.
Kullanılabilirlik, fiyatlandırma ve açık kalan kısıtlamalar
Meta, performans iyileştirmelerini duyurmasına rağmen API fiyatlarını değiştirmedi. Standart fiyatlar, her bir milyon token için girdilerde 1,25 dolar, önbelleğe alınan girdilerde 0,15 dolar ve çıktılarda 4,25 dolar olarak belirlendi.
Şirket, modelin talimat enjeksiyonu saldırılarına ve kötü amaçlı girdilere karşı direncini artırdığını, ayrıca geri alınamaz işlemleri gerçekleştirmeden önce daha temkinli davranması için modeli eğittiğini söylüyor. Mevcut reasoning modları şu anda kullanılabiliyor; max reasoning seçeneğinin ise ek güvenlik testleri tamamlandıktan sonra sunulması planlanıyor.
Yol haritasında daha büyük Muse Spark modelleri ve ağırlıkları açık modeller yer alıyor; ancak Meta, Muse Spark 1.3’ün ağırlıklarını yayımlayıp yayımlamayacağını açıklamadı. Bu nedenle sürümün pratik değeri, bağımsız kullanım sonuçlarına, ek reasoning yeteneklerinin ne zaman sunulacağına ve açıklık planlarının özellikle bu modeli kapsayıp kapsamayacağına bağlı olacak.