O aumento das capacidades de inteligência artificial nos data centers já não está relacionado apenas ao número de processadores e aceleradores, mas também à forma como esses recursos são distribuídos e conectados aos demais componentes do sistema. O artigo propõe uma visão híbrida que combina a manutenção de alguns recursos próximos ao processador, a expansão de outros recursos por vários servidores e o compartilhamento de recursos de alto custo, como unidades de processamento gráfico e armazenamento NVMe, por meio de uma infraestrutura compartilhada.
O PCI Express, ou PCIe, desempenha um papel fundamental nessa visão porque oferece um amplo ecossistema de hardware e software para conectar processadores, unidades de processamento gráfico, aceleradores, unidades SmartNIC ou DPU e unidades de armazenamento. No entanto, o aumento das velocidades de transmissão e do número de dispositivos conectados impõe desafios que vão além da simples disponibilização de portas adicionais; é nesse contexto que surgem as funções integradas dos switches PCIe e dos repetidores de clock.
Três modelos de distribuição de recursos
O modelo de expansão dentro do sistema, ou Scale-up, oferece o maior grau de proximidade entre o processador e os aceleradores e, por isso, é adequado para cargas de trabalho de inteligência artificial sensíveis à latência. No entanto, esse modelo esbarra nos limites do número de pistas do processador, do espaço do chassi, dos requisitos de energia e resfriamento e do número de dispositivos que o servidor consegue acomodar.
Já a expansão entre servidores, ou Scale-out, distribui o desempenho por vários nós usando Ethernet ou InfiniBand. Isso permite o crescimento dos clusters, mas acrescenta latência e exige software capaz de coordenar dados e cargas de trabalho entre os nós.
Por outro lado, a infraestrutura desagregada separa recursos específicos, como unidades de processamento gráfico, armazenamento ou unidades SmartNIC e DPU, da propriedade de um único servidor, tornando-os disponíveis por meio de uma malha compartilhada. Isso pode melhorar a utilização dos recursos e expandir de forma independente a computação e os endpoints, mas acrescenta questões de disputa por recursos, isolamento, gerenciamento e latência.
Por isso, o artigo não apresenta nenhum desses modelos como substituto abrangente dos demais. A decisão prática consiste em determinar quais recursos devem permanecer locais, quais devem ser distribuídos entre os servidores e quais justificam, devido ao seu custo, o compartilhamento entre vários sistemas.
O que o PCIe 7.0 acrescenta?
O PCIe 7.0 dobra a taxa de transmissão bruta por pista em comparação com o PCIe 6.x, alcançando 128 GT/s, e oferece até 512 gigabytes por segundo de largura de banda bidirecional ao usar uma configuração x16. Esse aumento proporciona mais espaço para acomodar um número crescente de aceleradores e plataformas com alta transferência de dados, mantendo a compatibilidade retroativa com o ecossistema PCIe mais amplo.
Mesmo assim, uma velocidade maior, por si só, não é suficiente para construir um sistema escalável. A elevação da taxa de sinal torna mais difícil lidar com a perda do canal, reflexões, interferência cruzada, ruído e jitter. Além disso, PCIe 5.0 e PCIe 6.x continuam sendo componentes importantes das infraestruturas atuais, o que torna a compatibilidade entre gerações um fator prático no projeto dos sistemas.
Switch PCIe para expansão e gerenciamento do tráfego
O switch PCIe recebe as transações, determina seu destino e as encaminha entre as portas upstream e downstream. Dessa forma, ele pode aumentar o número de pontos de conexão, viabilizar infraestruturas mais flexíveis e fornecer caminhos de comunicação direta entre os dispositivos conectados.
No entanto, o número de portas e a velocidade máxima não determinam sozinhos o desempenho efetivo. Quando unidades de processamento gráfico, armazenamento e tráfego de controle disputam a mesma largura de banda, mecanismos de arbitragem, buffers, gerenciamento de créditos, políticas de oversubscription e prevenção de bloqueio de cabeça de fila tornam-se fatores que influenciam o desempenho utilizável. Além disso, cada salto adicional pelo switch pode aumentar a latência e criar um novo ponto de disputa.
A configurabilidade assume importância especial para as equipes de projeto de chips, pois permite oferecer diferentes configurações de portas, opções de portas upstream, quantidades variadas de endpoints e múltiplos padrões de tráfego dentro de uma única arquitetura de switch.
Repetidores de clock para lidar com distância e qualidade do sinal
Quando os recursos são afastados do processador, por meio de trilhas mais longas na placa, conectores, cabos ou chassis de expansão, o canal elétrico se torna mais difícil de administrar. O repetidor de clock recupera o clock e os dados, termina um segmento elétrico e, em seguida, retransmite um sinal limpo para o segmento seguinte.
Esses componentes oferecem aos projetistas mais flexibilidade na distribuição dos dispositivos, mas não tornam a distância ilimitada. Cada segmento submetido à repetição de clock exige projeto e testes, considerando latência, consumo de energia, calor, equalização, diagnóstico e compatibilidade entre processadores, endpoints, interfaces PHY, conectores, cabos e firmware.
O que deve ser medido antes de escolher a solução?
O artigo recomenda iniciar a avaliação com uma carga de trabalho e uma topologia que representem o uso real, e não com uma lista de especificações gerais. As equipes devem determinar a largura de banda e a latência necessárias, o número de conexões de entrada e saída, o nível de oversubscription, a combinação de tráfego, a perda do canal, o consumo de energia, a capacidade de gerenciamento e os objetivos de interoperabilidade.
Sob essa perspectiva, os switches PCIe oferecem escalabilidade e roteamento de tráfego, enquanto os repetidores de clock ampliam a distância utilizável e preservam a integridade do sinal. O artigo menciona as soluções da Rambus para switches PCIe e controladores de repetidores de clock como blocos de construção para implementações em ASIC e FPGA, mas o valor prático não é medido pelo nome do componente, e sim pelo grau de adequação à carga de trabalho, à topologia e às restrições elétricas do sistema.
Leitura editorial: a mudança efetiva aqui não é o lançamento de um novo padrão ou produto, mas a transferência da decisão de projeto da infraestrutura de inteligência artificial — da pergunta sobre a velocidade máxima para o equilíbrio entre proximidade, escalabilidade, utilização dos recursos e qualidade do sinal. As limitações fundamentais permanecem claras: quanto maior o número de saltos e componentes compartilhados, maiores serão as complexidades de gerenciamento, a disputa e a latência. Além disso, por ser um artigo patrocinado pela Rambus, o material apresenta a estrutura sob uma perspectiva de marketing e não oferece resultados de medição independentes nem uma comparação entre fornecedores.