스타트업

Kog, GPU에서 더 많은 성능을 끌어내기 위해 소프트웨어 최적화 심화에 베팅

프랑스 스타트업 Kog는 기존 GPU가 심층적인 소프트웨어 최적화를 통해 AI 모델 추론 속도를 여전히 더 높일 수 있다고 보고 있다. 그러나 먼저 소형 모델에서 초당 3,000토큰을 달성한 자사의 접근 방식이 더 큰 언어 모델에서도 작동한다는 점을 입증해야 한다.

2026-08-14
4 분 읽기
17 조회수
فريق تحرير certi.news
Kog, GPU에서 더 많은 성능을 끌어내기 위해 소프트웨어 최적화 심화에 베팅

프랑스 스타트업 Kog는 데이터센터에서 사용되는 기존 그래픽 처리 장치(GPU)가 아직 역량을 모두 소진하지 않았으며, 저수준 소프트웨어 최적화를 통해 새로운 특수 하드웨어 없이도 AI 모델 추론 성능을 높일 수 있다고 보고 있다. AI 애플리케이션, 특히 에이전트 기반 워크플로의 확장을 가로막는 주요 병목으로 추론 속도와 비용이 부상한 시점에 나온 전략이다.

Kog는 5월 Hacker News 첫 화면에 등장했다. 당시 기업들이 보유한 AMD MI300X와 Nvidia H200 같은 표준 GPU를 사용해 단일 요청 디코딩에서 매우 높은 속도에 도달할 수 있음을 입증하는 것을 목표로 한 초기 기술 버전을 선보였다. 이 시연은 노트북에 탑재된 그래픽 칩을 대상으로 한 것은 아니었으며, 이는 일부 팔로워들에게 실망을 안겼다. 그러나 분명한 상업적 관심을 끌었다. 회사의 최고경영자이자 단독 창업자인 가엘 들랄로에 따르면 Kog는 200건의 구체적인 사업 기회를 받았다.

추론 시장으로 들어가는 관문으로서의 엔지니어링 소프트웨어

회사는 소프트웨어 엔지니어링이 Kog Inference Engine, 줄여서 KIE 서비스의 초기 사용 사례 중 하나가 될 것으로 예상한다. Claude Code 같은 도구의 전문 사용자들은 결과를 받기까지 때때로 몇 시간에 이르는 대기 시간을 겪는다. Anthropic도 속도에 금전적 가치가 있음을 인식하고 빠른 모드에 더 높은 가격을 부과한다.

Kog는 전문 업무에 AI를 사용할 때 이러한 지연으로 어려움을 겪는 고객을 겨냥한다. 들랄로가 전한 바에 따르면 회사에는 사용자들이 한 번의 프롬프트로 게임과 애플리케이션을 만들 수 있도록 하는 디자인 파트너도 있으며, 더 빠른 결과는 더 높은 수익으로 이어질 수 있다.

그러나 시장에서 얻은 회사의 피드백에 따르면 잠재 고객들은 아직 소형 모델을 직접 조정할 준비가 되어 있지 않다. 이에 Kog는 확인한 수요에 대응해 출시 이후 더 큰 모델의 가속에 집중했으며, 이는 초기 시연보다 훨씬 더 큰 과제를 안겨 준다.

초당 3,000토큰에서 더 큰 모델로

Kog는 대규모 언어 모델에서 약 30배 더 빠른 추론을 달성하는 것을 목표로 한다고 말한다. 그러나 지금까지 선보인 시연은 약 20억 개의 파라미터로 구성된 맞춤형 소형 모델이자 오픈 소스가 된 Laneformer 2B를 사용해 요청당 초당 3,000토큰을 달성했다.

들랄로는 이러한 접근 방식이 대규모 언어 모델에서도 성공할 수 있다고 본다. 다만 이러한 모델의 규모는 추론 하드웨어에 과제를 제기한다. 그의 관점에 따르면 GPU가 디코딩에 적합하지 않다는 믿음은 잘못된 인식이다. 최신 세대 GPU는 더 큰 메모리 대역폭을 제공하며, 이를 소프트웨어적으로 활용하기만 하면 되기 때문이다.

Kog만 이 방향으로 나아가는 것은 아니다. 프랑스 기업 ZML은 Nvidia의 CUDA를 넘어 경쟁 칩에서 빠른 추론을 지원하는 하드웨어 독립적 소프트웨어를 출시했다. 그러나 들랄로는 Kog의 접근 방식이 스탠퍼드대학교 Hazy Research 연구실의 연구에 더 가깝고, GPU 가속에 더욱 깊이 집중한다고 설명한다.

높은 엔지니어링 비용을 수반하는 저수준 접근 방식

Kog의 집중 분야는 프랑스 에콜 폴리테크니크에서 고체물리학을 전공한 뒤 공격적 사이버보안, 즉 윤리적 해킹 분야에서 일한 창업자의 배경과 관련이 있다. 들랄로는 물리학을 공부하면서 자연의 법칙과 GPU의 작동 법칙을 이해해 이를 최대한 활용해야 한다는 생각이 강화됐다고 말했다. 또한 해킹 업무를 통해 어셈블리 언어와 바이너리 코드에 이르기까지 매우 낮은 수준에서 리버스 엔지니어링을 수행해, 시스템이 원래 설계된 목적이 아닌 목표를 달성하는 방법을 배웠다고 설명했다.

그러나 이러한 접근 방식은 실용적인 동시에 느리다. 들랄로에 따르면 회사는 새로운 GPU 하나마다 세부 사항을 깊이 파고들고 엔지니어링 연구를 수행하는 데 몇 주에서 몇 달을 할애한다. 11명으로 구성된 팀 규모를 고려하면, 이는 가까운 미래에 Kog가 지원할 수 있는 칩의 수를 제한한다.

다음 핵심 단계

장기적으로 Kog는 방법론을 에이전트 기반 처리 파이프라인으로 전환해 더 많은 칩과 모델을 지원하고자 한다. 이는 유럽이 이 분야에서 자체 역량을 구축하려는 시점에 유럽의 기술 주권과 관련된 추진력을 제공할 수 있다. Kog는 Scaleway의 지원을 받고 있으며 Bpifrance와 French Tech 2030 프로그램의 지원도 받는다. Kog 창업자의 전 직장 동료인 카멜 제루알이 참여한 Varsity VC가 회사의 시드 투자 라운드를 공동으로 주도했다.

그럼에도 가장 중요한 시험은 Kog가 Laneformer 2B에서 얻은 결과를 실제 대규모 언어 모델로 이전할 수 있는지 여부다. 들랄로는 회사가 9월에 첫 번째 주요 모델에서 10배 속도를 달성할 것으로 예상한다고 말했다. 고객을 유치하기 위한 시연을 시작한 뒤에는 Series A 투자 라운드를 유치할 계획이다. 따라서 Kog의 약속은 여전히 시연용 맞춤형 소형 모델이 아니라 고객이 실제로 사용하고자 하는 모델에서 실질적으로 검증되어야 한다.

뉴스 출처
TechCrunch Startups
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기