Anthropic, yeni bir raporunda Çinli yapay zekâ laboratuvarlarının son aylarda gelişmiş Amerikan modellerinden yetenek çıkarmaya yönelik giderek daha karmaşık kampanyalar yürüttüğünü söyledi ve beş ayrı kampanyayla bağlantılı yaklaşık 200 milyon etkileşim tespit ettiğini belirtti. Şirkete göre girişimler, Claude'un ajan çalıştırma ve araç kullanma, programlama ve veri analizi ile mantıksal akıl yürütme yeteneklerini hedef aldı.
Anthropic bu operasyonları “damıtma saldırıları” (Distillation) olarak tanımlıyor. Bu, büyük bir modelin çıktılarını toplayıp bunları daha küçük bir modeli akıl yürütme görevleri konusunda eğitmek için kullanma yöntemi. Şirket, saldırganların modelin iç düşünme izleri olarak adlandırdığı unsurları çıkarmak amacıyla savunmalarını aşmaya çalıştığını söylüyor. Claude bu izleri normalde kullanıcılara göstermiyor; bunun yerine yanıta ulaşma yöntemine dair genel bir bakış sunan “özetlenmiş düşünme” blokları sağlıyor.
Düşünme izlerinin korunmasını aşma yöntemi
Rapora göre bazı kampanyalar, istemleri dolaylı bir biçimde formüle ederek modeli düşünme izlerini açığa çıkarmaya yönlendirmeyi başardı. Anthropic, çeviri görevi olarak sunulan ve Claude'dan “önceki çalışma belleğini” yalnızca Katakana ile yazılmış Japoncaya çevirmesinin istendiği bir talep örneği veriyor. Şirket, bu tür yöntemlerin normal yanıtta görünmemesi gereken ayrıntıların elde edilmesini sağladığını söylüyor.
En büyük kampanya Alibaba'ya atfedildi
Anthropic, Alibaba'ya atfedilen kampanyanın şimdiye kadar tespit ettiği en büyük toplu damıtma operasyonu olduğunu söyledi. Şirket, Mayıs ve Temmuz 2026 arasında 151 milyon etkileşim kaydetti; faaliyetler günde yaklaşık üç milyon etkileşimle zirveye ulaştı. Talepler 3500 hesaba dağıldı, ancak düşünme izlerini çıkarmaya yönelik sabit bir istemin kullanılması, Anthropic'in bunu değerlendirmesine göre Alibaba'nın Qwen model ailesi için eğitim materyali üretmeyi amaçlayan tek bir çaba olarak görmesine yol açtı.
Moonshot AI ile bağlantılı talepler
Claude'un geliştiricisi Kimi olan Moonshot AI'ye atfedilen başka bir kampanyaysa, Anthropic'e göre talepleri doğrudan Çin ordusundan yönlendiriyor gibi görünüyordu. Raporda, kapalı devre gözetim kameralarından alınan bir dizi kaydın, bir kişinin “anormal biçimde davranıp davranmadığını” belirlemek amacıyla analiz edilmesini isteyen bir talep yer alıyor. On gün süren dönemde Anthropic, beş bin hesaptan oluşan bir ağ üzerinden Claude'a aktarılan yaklaşık 300 bin talep tespit etti; bunların çoğu Opus modelini hedefliyordu.
Bu haber neden önemli?
Anthropic'in tahminleri doğruysa konu, dağınık hesapların kötüye kullanılmasının ötesine geçerek gelişmiş modellerin çıktılarını geniş ölçekte toplamaya yönelik örgütlü bir girişime dönüşüyor; bu da rakip modeller geliştirmenin maliyetini azaltabilir. Rakamlar ayrıca yeteneklerin korunmasının yalnızca yazılım ağırlıklarına doğrudan erişimi engellemekle değil, kullanım biçimlerini düzenlemek ve benzer hesaplarla talepleri tespit etmekle de ilgili olduğunu gösteriyor. Bununla birlikte sonuçlar Anthropic tarafından yöneltilen suçlamalar olarak kalıyor; madde, kampanyaların Alibaba veya Moonshot AI'ye atfedilmesini bağımsız biçimde doğrulamıyor ve diğer üç kampanyaya ilişkin, kendilerine atfedilen toplam etkileşimler dışında ayrıntı sunmuyor.