Suivez les dernières actualités, explications et histoires technologiques associées.
Un article de l’UC Berkeley et de FuriosaAI étudie l’utilisation de la mémoire flash à haute bande passante pour étendre la mémoire des accélérateurs d’intelligence artificielle lors de l’exécution de grands modèles de langage. Les simulations indiquent une réduction du temps d’achèvement pouvant atteindre 87 %, ainsi que des améliorations potentielles de la consommation d’énergie et de la durée de vie en écriture grâce à une planification tenant compte de la mémoire cache.