Следите за последними материалами, объяснениями и связанными технологическими историями.
JetBrains представила функцию Junie Local, которая запускает программного агента Junie локально на компьютере Mac с использованием модели Qwen3.6-27B, не отправляя код или запросы в облако. Для работы требуется Mac с процессором M5 и 64 ГБ памяти, а объём загрузки составляет около 20 ГБ.
JetBrains объясняет изменения, внесённые в Junie и движок инференса для локального запуска Qwen3.6-27B на MacBook с чипом M5. Эксперимент показывает, что производительность локальных агентов программирования зависит от управления контекстом и этапа prefill не меньше, чем от скорости генерации токенов.
Центры обработки данных переходят к неоднородным кластерам, объединяющим CPUs, GPUs, NPUs, специализированные ускорители и оптические соединения, вместо зависимости от одного GPU для всех задач. Поэтому программное обеспечение, управление сетями и энергопотреблением становятся ключевыми факторами снижения стоимости токенов и повышения эффективности использования оборудования.
Стартап Etched привлёк 700 млн долларов при оценке в 21 млрд долларов после того, как Jane Street протестировала первую полностью укомплектованную систему искусственного интеллекта, поставленную компанией, и приобрела её для эксплуатации в своём центре обработки данных. Финансирование отражает ставку на разработки компании, призванные ускорить инференс моделей искусственного интеллекта и снизить его стоимость.
Шарад Чоул из Expedera анализирует, как переход периферийных устройств от традиционных сетей компьютерного зрения к моделям LLM и VLM меняет характер узкого места — с вычислительной мощности на перемещение данных и памяти. Он описывает роль пакетной обработки в сокращении внешней передачи данных и улучшении работы моделей в автомобилях и встраиваемых устройствах.