Suivez les dernières actualités, explications et histoires technologiques associées.
JetBrains a lancé la fonctionnalité Junie Local, qui exécute l’agent de programmation Junie localement sur un Mac à l’aide du modèle Qwen3.6-27B, sans envoyer le code ni les requêtes vers le cloud. L’exécution nécessite un Mac doté d’une puce M5 et de 64 Go de mémoire, ainsi qu’un téléchargement d’environ 20 Go.
JetBrains explique les modifications apportées à Junie et au moteur d’inférence pour exécuter localement Qwen3.6-27B sur des MacBook équipés d’une puce M5. L’expérience montre que les performances des agents de programmation locaux dépendent autant de la gestion du contexte et de l’étape de préremplissage que de la vitesse de génération des tokens.
Les centres de données s’orientent vers des grappes hétérogènes combinant des CPUs, des GPUs, des NPUs, des accélérateurs personnalisés et des interconnexions optiques, plutôt que de s’appuyer sur un seul GPU pour toutes les tâches. Cette transition fait des logiciels ainsi que de la gestion des réseaux et de l’énergie des facteurs essentiels pour réduire le coût des jetons et améliorer l’utilisation du matériel.
La start-up Etched a levé 700 millions de dollars pour une valorisation de 21 milliards de dollars, après que Jane Street a testé le premier système d’intelligence artificielle complet livré par l’entreprise et l’a acheté pour l’exploiter dans son centre de données. Ce financement reflète le pari sur les conceptions de l’entreprise visant à accélérer l’inférence des modèles d’intelligence artificielle et à en réduire le coût.
Sharad Chol, d’Expedera, analyse comment le passage des appareils périphériques des réseaux de vision traditionnels aux modèles LLM et VLM modifie la nature du goulet d’étranglement, qui passe de la puissance de calcul aux mouvements de mémoire. Il présente le rôle du traitement fondé sur les paquets dans la réduction des transferts de données externes et l’amélioration de l’exécution des modèles dans les voitures et les appareils embarqués.