Yapay zekâ

SpaceXAI, önceki modelin fiyatıyla programlama ve bilişsel çalışma için Grok 4.7’yi tanıttı

SpaceXAI, Grok 4.7’yi programlama ve bilişsel çalışma alanındaki en güçlü modelleri olarak tanıttı; Grok 4.6’nın fiyatını ve hızını koruyor. Model, bazı programlama, mühendislik ve hukuk testlerinde üstünlük sağlarken terminal görevleri ve klinik akıl yürütme alanlarında rakip modellerin gerisinde kalıyor.

2026-09-22
4 dk okuma
77 görüntülenme
certi.news
SpaceXAI, önceki modelin fiyatıyla programlama ve bilişsel çalışma için Grok 4.7’yi tanıttı

SpaceXAI, yerel saatle 21 Eylül’de, şirketlere ve geliştiricilere programlama ve bilişsel çalışma için tasarlanmış en güçlü modeli olarak sunduğu Grok 4.7 yapay zekâ modelini duyurdu. Model, Grok 4.6 ile aynı fiyat ve hızla sunulurken şirket, aynı sınıftaki modellerle karşılaştırıldığında iki kat daha hızlı ve maliyetinin yarı yarıya daha düşük olduğunu belirtiyor.

Grok 4.7’de ne değişti?

Model, daha büyük bir temel modele dayanıyor; saatler sürebilecek sorunları çözmek üzere tasarlanmış bileşik görevlerle daha uzun pekiştirmeli öğrenme eğitimi alıyor. SpaceXAI’ye göre bu, modelin kendi çalışmasını gözden geçirme ve uzun bağlamlarla çalışma becerisini geliştirdi. Model ayrıca, diyalog görevleri ve genel bilişsel çalışmadaki performansını artırmak amacıyla şirketin yazılım aracısı Grok Bot’un çalışma biçimini özgün olarak anlamak üzere eğitildi.

İyileştirmeler arasında belge ve sunum oluşturmanın yanı sıra avukatların, hemşirelerin ve finansal analistlerin çalışmalarını taklit eden uzmanlık gerektiren görevlerdeki performans da yer alıyor. GDPval testinde Grok 4.7, 1695 Elo puanı alarak 1605 puan alan Grok 4.6’nın ve 1542 puan alan GPT-6 Astra’nın önüne geçti; ancak 1735 puan alan Fable 5.1’in gerisinde kaldı.

Bazı testlerde ileri sonuçlar, ancak tümünde değil

Uzun programlama görevlerine yönelik CursorBench 4.0’da Grok 4.7 yüzde 46,3 puan alırken Grok 4.6 yüzde 40,4 ve GPT-5.6 Sol yüzde 41,7 puan aldı; Fable 5.1 ise yüzde 51,8 ile en yüksek sonucu elde etti. Model ayrıca karşılaştırılan modeller arasında EEBench elektrik mühendisliği testinde yüzde 64,0 ve Harvey Legal Agent Benchmark hukuk görevleri testinde yüzde 19,6 ile en yüksek sonucu elde etti.

Ancak üstünlük kapsamlı değildi; uzun terminal görevlerine yönelik Terminal-Bench 4.0’da yüzde 38,0 puan alırken Fable 5.1 yüzde 57,9 puan aldı. Klinik akıl yürütmeye yönelik HealthBench Professional’da ise yüzde 56,7 puan alarak GPT-5.6 Sol’un yüzde 60,5 ve Fable 5.1’in yüzde 62,1 puanlarının gerisinde kaldı. Bu sonuçlar, model seçiminin yalnızca genel sıralamaya veya fiyata değil, görevin türüne de bağlı kalacağını gösteriyor.

Fiyat ve kullanılabilirlik

Grok API’nin fiyatı, bir milyon giriş belirteci için iki dolardan ve bir milyon çıkış belirteci için altı dolardan başlıyor. Karşılaştırma için GPT-5.6 Sol’un fiyatı girişte dört dolar, çıkışta 20 dolar; Fable 5.1’in fiyatı ise girişte 10 dolar, çıkışta 50 dolar. SpaceXAI, temel sürümün iki katı hıza sahip daha hızlı bir sürüm de sunuyor; bu sürümün fiyatı da iki katına çıkıyor.

Grok 4.7 aynı gün Cursor ve Grok Build programlama aracı üzerinden, ayrıca Grok API, üçüncü taraflara ait programlama araçları, model yönlendiricileri ve bulut bilişim platformları aracılığıyla kullanıma sunuldu.

Güvenlik ve test araçlarına erişim

SpaceXAI, koruma mekanizmalarını tamamen yeniden tasarladığını, kısıtlamaları aşma girişimlerine karşı direnci ve tehlikeli talepleri reddetme becerisini geliştirdiğini belirtti. Model, biyoloji alanındaki güvenliğe yönelik LatchBio testinde yüzde 62,4 puan alarak şirketin karşılaştırdığı modeller arasında en yüksek sonucu elde etti. HackerBench v0.3’te model, çift kullanımlı ve siber risk taşıyan taleplerin yalnızca yüzde 3,3’ünü geçirdi; şirket, meşru güvenlik görevlerinin çoğunu engellemediğini belirtiyor.

SpaceXAI ayrıca bazı siber güvenlik ortaklarına savunma amaçlı araştırmalar için kırmızı takım işlevlerine davet yoluyla erişim vermeye başladı. Bu iddialar, şirketin seçtiği testler ve yöntemlerle bağlantılı olmaya devam ediyor; alanlar arasındaki sonuç farklılıkları da geliştirme ve iş ekiplerinin modeli gerçek kullanım senaryolarına göre değerlendirmesini gerektiriyor.

Haber kaynağı
ITmedia NEWS Japan
Özgün kaynağı aç ↗
c
Yazar

certi.news

Aynı kategoride

Bunlar da ilginizi çekebilir

Tüm haberleri gör