法国初创公司Kog押注于这样一种判断:数据中心使用的传统图形处理器仍未耗尽其能力,底层软件优化可以提升人工智能模型的推理性能,而不必依赖新的专用硬件。这一押注正值推理速度和成本成为人工智能应用扩展的主要瓶颈之际,尤其是在基于智能体的工作流中。
Kog曾于5月登上Hacker News首页,当时该公司展示了一个技术早期版本,旨在证明利用机构现有的标准GPU(如AMD MI300X和Nvidia H200),可以实现极高的单请求解码速度。这一展示并非面向笔记本电脑中的图形处理器,这一点令部分关注者感到失望,但它显然吸引了商业兴趣;公司首席执行官兼唯一创始人盖尔·德拉卢表示,Kog已获得200个具体商业机会。
工程软件作为进入推理市场的切入点
公司预计,软件工程将成为Kog推理引擎(Kog Inference Engine,简称KIE)的首批使用场景之一。Claude Code等工具的专业用户有时需要等待数小时才能获得结果,而Anthropic深知速度具有经济价值,并会对其快速模式收取更高价格。
Kog的目标客户是那些在将人工智能用于专业任务时受到这些延迟阻碍的用户。德拉卢称,公司还拥有设计合作伙伴,让用户通过单条提示创建游戏和应用;在这些场景中,更快的结果可能转化为更高收入。
但公司从市场获得的反馈显示,潜在客户尚未准备好自行调整小型模型。因此,Kog自成立以来便根据观察到的需求,专注于加速更大的模型,这使它面临的挑战远大于最初的展示。
从每秒3,000个令牌到更大的模型
Kog表示,其目标是在大型语言模型中实现约30倍更快的推理。不过,截至目前,该公司的展示使用的是一个定制的小型模型Laneformer 2B,其规模约为20亿个参数,并且该模型现已开源;展示实现了每个请求每秒3,000个令牌。
德拉卢认为,同样的方法也能适用于大型语言模型,尽管这些模型的规模给推理硬件带来了挑战。按照他的观点,认为GPU不适合解码已成为一种错误观念,因为新一代GPU提供了更大的内存带宽,只需要通过软件加以利用。
Kog并非唯一朝这一方向发展的公司。法国公司ZML推出了独立于硬件的软件,绕过Nvidia的CUDA,以支持在竞争性芯片上的快速推理。但德拉卢称,Kog的方法更接近斯坦福大学Hazy Research实验室的研究,重点更深入地放在GPU加速上。
底层方法与高昂的工程成本
Kog的专注方向与其创始人的背景有关:他曾在法国综合理工学院学习固体物理,随后从事进攻性网络安全,也就是道德黑客工作。德拉卢表示,物理学研究强化了他理解自然规律以及GPU运行规律、从而最大限度利用GPU的想法;而黑客工作则教会他在极低层级进行逆向工程,深入汇编语言和二进制代码,以实现系统原本并未被设计用来完成的目标。
但这种方法既实用,又十分缓慢。德拉卢表示,公司会为每一种新的GPU投入数周甚至数月,深入研究其细节并对其开展工程研究。由于团队由11人组成,这限制了Kog在可预见的未来能够支持的芯片数量。
下一步关键行动
从长期来看,Kog希望将其方法转化为基于智能体的处理流水线,使其能够支持更多芯片和模型。这可能让公司获得与欧洲技术主权相关的推动力,因为欧洲正努力在这一领域建设自身能力。该公司获得Scaleway的支持,同时得到Bpifrance和French Tech 2030计划的支持。Varsity VC基金共同领投了公司的种子轮融资,该基金包括Kog创始人的前合伙人卡迈勒·泽鲁阿尔。
然而,最重要的考验仍在于Kog能否将其在Laneformer 2B上的成果迁移到真正的大型语言模型上。德拉卢表示,公司预计将在9月实现首个主流模型十倍速运行;在启动吸引客户的展示后,公司希望筹集A轮融资。因此,Kog的承诺仍需在客户真正希望使用的模型上进行实际验证,而不是仅在用于展示的定制小型模型上验证。