Yapay zekâ

Qwen3.8-27B, gelişmiş yapay zekâ modellerini yerel çalıştırmaya yaklaştırıyor

Alibaba’nın açık modeli Qwen3.8-27B, yaklaşık 17 gigabayta sıkıştırıldıktan sonra yerel olarak çalıştırılabilecek bir boyut içinde çok modlu yetenekler, kodlama ve yazılım ajanları sunuyor. Güçlü performans göstergelerine rağmen yüksek token tüketimi ve yavaş çıkarım, kalite ile hız arasında pratik bir denge kurulmasını gerektiriyor.

2026-08-17
6 dk okuma
12 görüntülenme
فريق تحرير certi.news
Qwen3.8-27B, gelişmiş yapay zekâ modellerini yerel çalıştırmaya yaklaştırıyor

Alibaba, Qwen3.8-27B modelini cuma günü Hugging Face platformunda açık kaynaklı Apache 2.0 lisansıyla yayımladı. Bu lisans, geliştiricilerin model ağırlıklarını indirmesine, incelemesine, değiştirmesine ve bulut model arayüzlerinden uzakta çalıştırmasına olanak tanıyor. Sürümün önemi yalnızca 27 milyar parametreye sahip olmasından kaynaklanmıyor; görüntü ve video anlayışını, 262.144 tokene kadar bağlamı, ayarlanabilir çıkarımı, programlama görevleri desteğini ve yazılım ajanlarının iş akışlarını bir araya getirmesinden de kaynaklanıyor.

Kaynak, modeli Qwen3.8 neslinin kompakt ve dağıtımı kolay bir yetenekler sürümü olarak tanımlıyor. 16 bitlik sürüm yaklaşık 56 gigabayt GPU belleğine ihtiyaç duyarken FP8 sürümü yaklaşık 28 gigabayt gerektiriyor. 4 bite sıkıştırıldığında modelin kendisinin boyutu yaklaşık 17 gigabayta düşüyor. Bu da modeli güçlü bir oyun bilgisayarı veya iyi donanımlı bir dizüstü bilgisayar gibi gelişmiş tüketici cihazlarında çalıştırılabilir hâle getiriyor.

Daha küçük boyutta büyük yetenekler

Performans ile boyut arasındaki denge, geliştiricilerden ve ileri düzey yapay zekâ kullanıcılarından gelen geniş tepkilerin başlıca nedenlerinden biriydi. Alibaba, lansman sırasında birden fazla testte güçlü sonuçlar sundu. Model SWE-bench Pro’da 61,7, LiveCodeBench v6’da 90,3, CoWorkBench’te 70,7 ve OSWorld-Verified’da 84,3 puan aldı.

Şirketin yayımladığı karşılaştırma tablosunda Qwen3.8-27B, SWE-bench Pro ve LiveCodeBench testlerinde Claude Opus 4.6 Max için listelenen sonucu geride bıraktı. Buna karşılık Claude, Terminal-Bench, GPQA Diamond ve Humanity’s Last Exam testlerinde önde kaldı. Ancak bu sonuçlar genel bir kazanan ilan etmek için yeterli değil; Alibaba’nın bazı değerlendirmeleri kurum içi ve test araçları ile ölçüm yöntemleri tüm modeller arasında zorunlu olarak aynı değil.

Daha sonra gelen bağımsız sonuçlar sürüme ek ivme kazandırdı. Artificial Analysis, programlama, bilim, akıl yürütme ve profesyonel görevlere yönelik dokuz değerlendirmeyi birleştiren bileşik bir gösterge olan Intelligence Index’te modele 52 puan verdi. Bu puan, göstergenin en yüksek akıl yürütme ayarında OpenAI’ın GPT-5.6 Luna modeline şu anda atfettiği puanla aynı. GPT-5.6 Luna, yalnızca bulut üzerinden kullanılabilen, mülkiyetli bir model. Qwen3.8-27B ayrıca Agentic Index’te 51 puan alarak en yüksek akıl yürütme çabasında Claude Opus 4.8’in önüne geçti.

Bu karşılaştırmalar modellerin tamamen denk olduğu anlamına gelmiyor, ancak geliştiricilerin neden ilgi gösterdiğini açıklıyor. Açık kaynaklı bir yazılım ajanı olan Cline, sonucu yerel bir modelin ilk kez öncü modellere yakın bir yetenek sergilemesi olarak nitelendirdi. Joshua “Xenova” Lochner da özel WebGPU çekirdeklerini kullanarak modelin çalıştırılmasını test etti; bu, modelin farklı çalışma ortamlarına entegre edilebileceğine işaret ediyor.

Yerel çalıştırma pratikte ne sağlıyor?

Simon Willison, yaklaşık 17 gigabayt boyutundaki Q4_K_M sıkıştırılmış sürümü M5 Max işlemcili bir MacBook Pro’da ve Nvidia DGX Spark’ta test etti. Model, deneylerinde kod yazabildi, görüntüleri anlayabildi ve Pi agent çerçevesi üzerinden bir yazılım ajanı döngüsü çalıştırabildi. Ayrıca kimlik doğrulama mekanizmasını açıklamak için bir kod tabanında gezindi ve JSONL biçimindeki bir ajan günlüğünü Markdown’a dönüştürmek için bir Python aracı yazıp test etti.

Bu deneyler, yalnızca API üzerinden erişilebilen bir model ile bir iş istasyonunda tutulabilen bir dosya arasındaki pratik farkı ortaya koyuyor. Geliştirici modeli çalıştırabilir, değiştirebilir ve kendi altyapısının içinde tutabilir; böylece verileri harici bir sağlayıcıya göndermek zorunda kalmaz. Bu durum gizlilik, bilgi güvenliği, yönetişim ve dağıtım üzerinde kontrol açısından seçenekler sunuyor. Ancak bu, modelin otomatik olarak her göreve uygun olduğu veya hızlı çalışacağı anlamına gelmiyor.

İlgi, kullanım oranında da görüldü. Cybernews’e göre model, Hugging Face’teki ilk üç gününde 3 milyondan fazla indirmeyi aştı. Bu sırada yerel çıkarım araçlarıyla uyumlu sıkıştırılmış sürümler de hızla ortaya çıktı. Reddit’teki LocalLLaMA topluluğu, test sonuçlarını, sıkıştırılmış sürümleri, kurulum yönergelerini ve karşılaştırmaları bir araya getirmek üzere özel bir konu başlığı oluşturdu.

Kalite zamansal bir maliyetle geliyor

Qwen3.8-27B’nin en belirgin sınırlaması, fazla düşünme eğiliminde olması. Artificial Analysis, modelin Intelligence Index testleri sırasında 160 milyon çıktı tokeni ürettiğini, benzer açık ağırlıklı modellerde medyanın ise 43 milyon token olduğunu belirtiyor. Kaynak, bunu varsayılan xhigh akıl yürütme ayarıyla ilişkilendiriyor. Willison’ın deneyinde bir bisiklete binen kuğunun SVG çizimini oluşturmak 21 dakika sürdü ve 22 binden fazla akıl yürütme tokeni tüketti. Bu nedenle normal kullanıma düşük akıl yürütme seviyesiyle veya akıl yürütme olmadan başlanmasını önerdi.

Tomasz Tunguz, DeepSeek V4 Flash ile karşılaştırmalı dokuz görevden oluşan küçük bir testte benzer bir denge gözlemledi. Akıl yürütme etkinleştirildiğinde Qwen, kullandığı ajan sistemi içinde kalite açısından az farkla öne geçti; ancak yaklaşık 30 kat daha yavaştı ve 4,5 kat daha pahalıydı. Tunguz, yine de dokuz görevin sonucu kesinleştirmek için yeterli olmadığı konusunda uyardı.

Çıkarım yazılımları bu farkı azaltmaya yardımcı olabilir. Model, Multi-Token Prediction teknolojisini içeriyor. Willison, llama.cpp üzerinden etkinleştirildiğinde DGX Spark’taki performansta varsayılan LM Studio ayarına kıyasla yaklaşık %72 iyileşme gözlemledi. Bununla birlikte LM Studio üzerinden yaptığı olağan çalıştırmalarda saniyede 15 ila 30 token üretti; bu hız, barındırılan birçok modelin yanıtından çok daha düşük.

Bu şirketler için ne anlama geliyor?

Kurumlar açısından en önemli karşılaştırma, 27 milyar parametreli bir modelin tek bir tabloda Claude veya GPT’yi geçip geçmediği değil. Asıl mesele, pratik iş kategorilerinde API çağrılarının yerine geçecek kadar programlama, belge analizi, görsel anlama ve ajan görevini yerel olarak gerçekleştirip gerçekleştiremeyeceği. Apache 2.0 lisansı sayesinde ağırlıklar incelenebilir, değiştirilebilir ve kurumun denetimleri arkasında barındırılabilir. Alibaba ayrıca modelin vLLM, SGLang ve TokenSpeed çerçeveleriyle uyumlu olduğunu belgeliyor.

Alibaba, daha sonra varsayılan bağlamı 1 milyon token ve yerleşik araçları olan yönetilen bir Qwen Cloud sürümünün geleceğini söylüyor. Ancak Qwen3.8-27B’nin mevcut değerini, bulut altyapısına daha az bağımlı yerel dağıtım seçeneği oluşturuyor. Sonuçlarının bağımsız olarak daha fazla doğrulanması gerekiyor ve çıkarım hızının yavaşlığı, gerçek zamanlı etkileşimlerdeki faydasını sınırlayabilir. Bu nedenle sürüm, yerel modellerin öncü modellerle genel bir eşdeğerliğe ulaştığını kanıtlamıyor; ancak yakın zamana kadar pahalı hizmetlerle ilişkilendirilen yeteneklerin, kullanıcının sahip olduğu donanımda daha küçük bir dosyadan çalıştırılabilir hâle geldiğini gösteriyor.

Haber kaynağı
VentureBeat Startups & Funding
Özgün kaynağı aç ↗
ف
Yazar

فريق تحرير certi.news

Aynı kategoride

Bunlar da ilginizi çekebilir

Tüm haberleri gör