L’augmentation des capacités d’intelligence artificielle dans les centres de données ne dépend plus seulement du nombre de processeurs et d’accélérateurs, mais aussi de la manière dont ces ressources sont distribuées et reliées au reste des composants du système. L’article propose une conception hybride combinant le maintien de certaines ressources à proximité du processeur, l’extension d’autres ressources sur plusieurs serveurs et le partage de ressources coûteuses, telles que les unités de traitement graphique et le stockage NVMe, au moyen d’une infrastructure commune.
Le PCI Express, ou PCIe, joue un rôle essentiel dans cette conception, car il fournit un vaste écosystème matériel et logiciel permettant de relier les processeurs, les unités de traitement graphique, les accélérateurs, les unités SmartNIC ou DPU ainsi que les unités de stockage. Toutefois, l’augmentation des vitesses de transmission et du nombre d’appareils connectés impose des défis qui vont au-delà de la simple fourniture de ports supplémentaires. C’est là qu’interviennent les fonctions complémentaires des commutateurs PCIe et des répéteurs de synchronisation.
Trois modes de distribution des ressources
Le mode d’extension au sein du système, ou Scale-up, offre le plus haut degré de proximité entre le processeur et les accélérateurs ; il convient donc aux charges de travail d’intelligence artificielle sensibles à la latence. Toutefois, ce mode se heurte aux limites du nombre de voies du processeur, de l’espace disponible dans le châssis, des exigences en matière d’alimentation et de refroidissement, ainsi que du nombre d’appareils que le serveur peut accueillir.
La mise à l’échelle entre serveurs, ou Scale-out, distribue quant à elle les performances sur plusieurs nœuds à l’aide d’Ethernet ou d’InfiniBand. Elle permet ainsi la croissance des clusters, mais ajoute de la latence et exige des logiciels capables de coordonner les données et les charges de travail entre les nœuds.
En revanche, l’infrastructure désagrégée sépare certaines ressources, telles que les unités de traitement graphique, le stockage ou les unités SmartNIC et DPU, de la propriété d’un seul serveur, afin de les rendre accessibles via un fabric partagé. Cela peut améliorer l’utilisation des ressources et permettre d’étendre indépendamment le calcul et les points d’extrémité, mais ajoute des problématiques de concurrence pour les ressources, d’isolation, de gestion et de latence.
L’article ne présente donc aucun de ces modes comme un remplacement universel des autres. La décision pratique consiste à déterminer quelles ressources doivent rester locales, lesquelles doivent être distribuées entre les serveurs et lesquelles justifient, au regard de leur coût, d’être partagées entre plusieurs systèmes.
Qu’apporte le PCIe 7.0 ?
Le PCIe 7.0 double le débit brut par voie par rapport au PCIe 6.x pour atteindre 128 GT/s, et fournit jusqu’à 512 gigaoctets par seconde de bande passante bidirectionnelle avec une configuration x16. Cette augmentation offre davantage de marge pour prendre en charge un nombre croissant d’accélérateurs et de plateformes à fort débit de données, tout en préservant la rétrocompatibilité avec l’écosystème PCIe plus large.
Néanmoins, une vitesse supérieure ne suffit pas à elle seule à construire un système évolutif. L’augmentation du débit de signal rend plus difficiles à traiter la perte du canal, les réflexions, les interférences mutuelles, le bruit et la gigue. Le PCIe 5.0 et le PCIe 6.x restent également des composants importants des infrastructures actuelles, ce qui fait de la compatibilité entre générations un facteur pratique lors de la conception des systèmes.
Le commutateur PCIe pour l’extension et la gestion du trafic
Le commutateur PCIe reçoit les transactions, en détermine la destination, puis les achemine entre les ports montants et descendants. Il peut ainsi augmenter le nombre de points de connexion, prendre en charge des infrastructures plus flexibles et fournir des voies de communication directes entre les appareils connectés.
Toutefois, le nombre de ports et la vitesse maximale ne déterminent pas à eux seuls les performances réelles. Lorsque les unités de traitement graphique, le stockage et le trafic de contrôle se disputent la même bande passante, les mécanismes d’arbitrage, la mise en mémoire tampon, la gestion des crédits, les politiques de sursouscription et la prévention du blocage en tête de file deviennent des facteurs déterminants des performances utilisables. De plus, chaque saut supplémentaire à travers le commutateur peut accroître la latence et créer un nouveau point de concurrence.
La configurabilité revêt une importance particulière pour les équipes de conception de puces, car elle permet de prendre en charge différentes configurations de ports, des options de ports montants, un nombre varié de points d’extrémité et plusieurs modes de trafic au sein d’une même architecture de commutateur.
Les répéteurs de synchronisation pour traiter la distance et la qualité du signal
Lorsque les ressources sont éloignées du processeur, au moyen de tracés plus longs sur la carte, de connecteurs, de câbles ou de châssis d’extension, le canal électrique devient plus difficile à gérer. Un répéteur de synchronisation récupère l’horloge et les données, termine un segment électrique, puis retransmet un signal propre vers le segment suivant.
Ces composants offrent aux concepteurs une plus grande flexibilité dans la distribution des appareils, mais ne rendent pas la distance illimitée. Chaque segment resynchronisé nécessite une conception et des tests, en tenant compte de la latence, de la consommation énergétique, de la chaleur, de l’égalisation, du diagnostic et de la compatibilité entre les processeurs, les points d’extrémité, les interfaces PHY, les connecteurs, les câbles et les micrologiciels.
Que faut-il mesurer avant de choisir une solution ?
L’article recommande de commencer l’évaluation par une charge de travail et une topologie représentatives de l’utilisation réelle, plutôt que par une liste générale de spécifications. Les équipes devraient déterminer la bande passante et la latence requises, le nombre de connexions entrantes et sortantes, le niveau de sursouscription, le profil du trafic, la perte du canal, la consommation énergétique, la facilité de gestion et les objectifs d’interopérabilité.
Dans cette perspective, les commutateurs PCIe offrent l’évolutivité et le routage du trafic, tandis que les répéteurs de synchronisation étendent la distance utilisable et préservent l’intégrité du signal. L’article cite les solutions de Rambus dédiées aux commutateurs PCIe et aux contrôleurs de répéteurs de synchronisation comme des briques de conception pour les implémentations ASIC et FPGA, mais la valeur pratique ne se mesure pas tant au nom du composant qu’à son adéquation avec la charge de travail, la topologie et les contraintes électriques du système.
Lecture éditoriale : le changement réel ne réside pas ici dans le lancement d’une nouvelle norme ou d’un nouveau produit, mais dans le passage, pour la décision de conception de l’infrastructure d’IA, d’une question portant sur la vitesse maximale à un arbitrage entre proximité, évolutivité, utilisation des ressources et qualité du signal. Les contraintes fondamentales restent claires : plus le nombre de sauts et de composants partagés augmente, plus la gestion, la concurrence et la latence se complexifient ; en outre, l’article, qui est un billet sponsorisé par Rambus, présente ce cadre sous un angle marketing et ne fournit ni résultats de mesure indépendants ni comparaison entre fournisseurs.