Стартапы

Kog рассчитывает получить больше производительности от GPU за счёт углублённой оптимизации программного обеспечения

Французский стартап Kog считает, что традиционные графические процессоры всё ещё способны обеспечить более высокую скорость вывода моделей искусственного интеллекта благодаря глубокой оптимизации программного обеспечения. Однако сначала компании предстоит доказать, что её подход, обеспечивший 3 000 токенов в секунду на небольшой модели, работает с более крупными языковыми моделями.

2026-08-14
5 мин. чтения
17 просмотров
فريق تحرير certi.news
Kog рассчитывает получить больше производительности от GPU за счёт углублённой оптимизации программного обеспечения

Французский стартап Kog рассчитывает, что традиционные графические процессоры, используемые в центрах обработки данных, ещё не исчерпали свои возможности и что низкоуровневые программные оптимизации способны повысить производительность вывода моделей искусственного интеллекта без необходимости в новом специализированном оборудовании. Эта ставка сделана в момент, когда скорость и стоимость вывода стали главным узким местом для расширения применения искусственного интеллекта, особенно в рабочих процессах на основе агентов.

Kog оказалась на первой странице Hacker News в мае, когда представила технический прототип, призванный доказать возможность достичь очень высокой скорости декодирования отдельных запросов с использованием стандартных GPU, уже имеющихся у организаций, таких как AMD MI300X и Nvidia H200. Демонстрация не была ориентирована на графические процессоры в ноутбуках — этот момент разочаровал некоторых наблюдателей, — однако она вызвала заметный коммерческий интерес: генеральный директор и единственный основатель компании Гаэль Делало сообщил, что Kog получила 200 конкретных коммерческих возможностей.

Инженерное программное обеспечение как путь на рынок вывода

Компания ожидает, что разработка программного обеспечения станет одним из первых вариантов использования сервиса Kog Inference Engine, сокращённо KIE. Профессиональные пользователи таких инструментов, как Claude Code, иногда сталкиваются с ожиданием результатов, которое длится часами, тогда как Anthropic понимает финансовую ценность скорости и взимает более высокую плату за свой быстрый режим.

Kog ориентируется на клиентов, которым такие задержки мешают использовать искусственный интеллект в профессиональных задачах. У компании также есть партнёры по разработке, позволяющие пользователям создавать игры и приложения с помощью одного запроса; по словам Делало, более быстрые результаты могут превратиться в более высокий доход.

Однако отзывы компании с рынка показали, что потенциальные клиенты пока не готовы самостоятельно настраивать небольшие модели. Поэтому с момента запуска Kog сосредоточилась на ускорении более крупных моделей в ответ на выявленный спрос, что ставит перед ней значительно более сложную задачу, чем первоначальная демонстрация.

От 3 000 токенов в секунду к более крупным моделям

Kog заявляет, что стремится обеспечить примерно в 30 раз более быстрый вывод в больших языковых моделях. Однако представленная ею на данный момент демонстрация достигла 3 000 токенов на запрос в секунду с использованием небольшой специализированной модели объёмом около двух миллиардов параметров — Laneformer 2B, которая стала открытой.

Делало считает, что тот же подход может сработать с большими языковыми моделями, хотя размер этих моделей создаёт проблемы для оборудования вывода. По его мнению, представление о том, что GPU не подходят для декодирования, стало ошибочным, поскольку более новые поколения этих устройств обеспечивают большую пропускную способность памяти, которую нужно лишь задействовать программными средствами.

Kog не единственная компания, работающая в этом направлении. Французская компания ZML выпустила независимое от оборудования программное обеспечение, которое выходит за рамки CUDA компании Nvidia для поддержки быстрого вывода на конкурирующих чипах. Однако Делало описывает подход Kog как более близкий к исследованиям лаборатории Hazy Research Стэнфордского университета, с более глубоким акцентом на ускорение GPU.

Низкоуровневый подход с высокой инженерной стоимостью

Акцент Kog связан с опытом её основателя в области физики твёрдого тела в Высшей политехнической школе во Франции, а затем с его работой в наступательной кибербезопасности, или этичном хакинге. Делало сказал, что изучение физики укрепило в нём идею о необходимости понимать законы природы и принципы работы GPU, чтобы использовать их максимально эффективно, тогда как работа в сфере хакинга научила его выполнять обратную разработку на очень низком уровне — вплоть до языка ассемблера и двоичного кода — для достижения целей, для которых система изначально не предназначалась.

Однако этот подход одновременно практичен и медленен. По словам Делало, компания посвящает каждому новому GPU несколько недель или даже месяцев, чтобы глубоко изучить его особенности и провести инженерные исследования. При команде из 11 человек это ограничивает число чипов, которые Kog сможет поддерживать в обозримом будущем.

Следующий решающий шаг

В долгосрочной перспективе Kog хочет преобразовать свою методологию в агентные конвейеры обработки, что позволит ей поддерживать большее число чипов и моделей. Это может дать компании преимущество, связанное с европейским технологическим суверенитетом, в то время как Европа стремится развивать собственные возможности в этой области. Компанию поддерживает Scaleway, а также Bpifrance и программа French Tech 2030. Фонд Varsity VC, в который входит бывший партнёр основателя Kog Камеля Зеруаля, совместно возглавил посевной раунд финансирования компании.

Тем не менее главным испытанием остаётся способность Kog перенести свои результаты с модели Laneformer 2B на полноценную большую языковую модель. Делало заявил, что компания рассчитывает в сентябре запустить первую основную модель со скоростью, в десять раз превышающей исходную, а после начала демонстраций для привлечения клиентов надеется провести раунд финансирования Series A. Поэтому обещания Kog всё ещё требуют практической проверки на моделях, которыми клиенты действительно хотят пользоваться, а не на небольшой специализированной модели, созданной для демонстрации.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости