Fransız girişimi Kog, veri merkezlerinde kullanılan geleneksel grafik işlem birimlerinin henüz tüm kapasitelerini tüketmediğine ve düşük seviyeli yazılım optimizasyonlarının, yeni ve özel donanımlara ihtiyaç duyulmadan yapay zekâ modeli çıkarım performansını artırabileceğine güveniyor. Bu iddia, çıkarım hızı ve maliyetinin yapay zekâ uygulamalarının, özellikle de ajan tabanlı iş akışlarının, genişlemesinin önündeki başlıca darboğazlardan biri hâline geldiği bir dönemde geliyor.
Kog, mayıs ayında Hacker News’in ana sayfasında yer aldı. Şirket, kurumların hâlihazırda kullandığı AMD MI300X ve Nvidia H200 gibi standart GPU’larla tekil isteklerin kod çözümünde çok yüksek hızlara ulaşmanın mümkün olduğunu kanıtlamayı amaçlayan erken bir teknik sürümünü tanıttı. Gösterim, bazı takipçilerde hayal kırıklığına neden olan bir nokta olarak dizüstü bilgisayarlardaki grafik işlem birimlerini hedeflemiyordu; ancak belirgin bir ticari ilgi çekti. Şirketin CEO’su ve tek kurucusu Gaël Dielalo, Kog’un 200 somut ticari fırsat elde ettiğini söyledi.
Mühendislik yazılımı, çıkarım pazarına açılan kapı olarak
Şirket, yazılım mühendisliğinin Kog Inference Engine hizmetinin (kısaca KIE) ilk kullanım alanlarından biri olmasını bekliyor. Claude Code gibi araçların profesyonel kullanıcıları, sonuçları almadan önce bazen saatler süren bekleme dönemleriyle karşılaşıyor. Anthropic de hızın finansal bir değeri olduğunun farkında ve hızlı modu için daha yüksek ücret talep ediyor.
Kog, yapay zekâyı profesyonel görevlerde kullanırken bu gecikmelerin engel olduğu müşterileri hedefliyor. Şirketin ayrıca kullanıcıların tek bir istemle oyunlar ve uygulamalar oluşturmasını sağlayan tasarım ortakları bulunuyor. Dielalo’nun aktardığına göre daha hızlı sonuçlar daha yüksek gelire dönüşebilir.
Ancak şirketin pazardan aldığı geri bildirimler, potansiyel müşterilerin küçük modelleri kendi başlarına ayarlamaya henüz hazır olmadığını ortaya koydu. Bu nedenle Kog, tespit ettiği talebe yanıt olarak kuruluşundan bu yana daha büyük modelleri hızlandırmaya odaklandı; bu da şirketi ilk gösterimden çok daha büyük bir zorlukla karşı karşıya bırakıyor.
Saniyede 3.000 tokendan daha büyük modellere
Kog, büyük dil modellerinde yaklaşık 30 kat daha hızlı çıkarım elde etmeyi hedeflediğini söylüyor. Ancak şirketin şimdiye kadarki gösterimi, yaklaşık iki milyar parametre büyüklüğündeki ve açık kaynak hâle gelen özel küçük bir model olan Laneformer 2B’yi kullanarak istek başına saniyede 3.000 tokena ulaştı.
Dielalo, bu yaklaşımın büyük dil modelleriyle de başarılı olabileceğine inanıyor; ancak bu modellerin boyutu, çıkarım donanımı açısından zorluk oluşturuyor. Ona göre GPU’ların kod çözümü için uygun olmadığı düşüncesi yanlış bir anlayış hâline geldi, çünkü bu birimlerin daha yeni nesilleri daha yüksek bellek bant genişliği sunuyor ve bunun yalnızca yazılımsal olarak değerlendirilmesi gerekiyor.
Kog bu yönde tek başına çalışmıyor. Fransız şirketi ZML, rakip çiplerde hızlı çıkarımı desteklemek için Nvidia’nın CUDA’sını aşan, donanımdan bağımsız yazılımlar başlattı. Ancak Dielalo, Kog’un yaklaşımını Stanford Üniversitesi’ndeki Hazy Research laboratuvarının çalışmalarına daha yakın olarak tanımlıyor ve GPU hızlandırmasına daha derin bir odaklanma taşıdığını belirtiyor.
Yüksek mühendislik maliyetli düşük seviyeli yaklaşım
Kog’un odağı, kurucusunun Fransa’daki École Polytechnique’te katı hâl fiziği eğitimi almasının, ardından saldırı siber güvenliği veya etik bilgisayar korsanlığı alanında çalışmasının oluşturduğu geçmişle bağlantılı. Dielalo, fizik eğitiminin doğa yasalarını ve bir GPU’nun çalışma yasalarını anlayarak onlardan mümkün olan en yüksek ölçüde yararlanma fikrini güçlendirdiğini söyledi. Bilgisayar korsanlığı alanındaki çalışmasının ise sistemi başlangıçta tasarlanmadığı hedeflere ulaştırmak için montaj dili ve ikili kod seviyesine kadar çok düşük seviyede tersine mühendislik yapmayı öğrettiğini belirtti.
Ancak bu yaklaşım aynı zamanda pratik ve yavaş. Dielalo, şirketin her yeni GPU’ya kendini kaptırmak ve üzerinde mühendislik araştırmaları yürütmek için birkaç hafta, hatta aylar ayırdığını söylüyor. 11 kişilik bir ekiple bu durum, Kog’un öngörülebilir gelecekte destekleyebileceği çip sayısını sınırlıyor.
Bir sonraki kritik adım
Uzun vadede Kog, daha fazla çip ve modeli desteklemesine olanak tanıyacak ajan tabanlı işleme hatlarına metodolojisini dönüştürmek istiyor. Bu, Avrupa’nın bu alanda kendi kapasitesini geliştirmeye çalıştığı bir dönemde şirkete Avrupa’nın teknolojik egemenliğiyle bağlantılı bir ivme kazandırabilir. Şirket Scaleway’den destek alıyor; ayrıca Bpifrance ve French Tech 2030 programı tarafından destekleniyor. Kog’un kurucusunun eski ortağı Kamel Zeroual’ın yer aldığı Varsity VC fonu, şirketin tohum yatırım turuna ortak liderlik etti.
Bununla birlikte en önemli sınav, Kog’un sonuçlarını Laneformer 2B’den gerçek bir büyük dil modeline aktarabilme kapasitesi olmaya devam ediyor. Dielalo, şirketin ilk büyük modeli eylül ayında on kat hızla çalıştırmayı beklediğini ve müşteri çekmeye yönelik gösterim başladıktan sonra Series A yatırım turunu toplamayı umduğunu söyledi. Bu nedenle Kog’un vaatleri, hâlâ yalnızca gösterim için tasarlanmış küçük bir modelde değil, müşterilerin gerçekten kullanmak istediği modellerde pratik olarak doğrulanmayı bekliyor.