Comment valider un système de transport basé sur l'IA haute performance

Réseau Ix
+ IxNetwork

Valider les réseaux de transport basés sur l'IA, de la mise à l'échelle verticale à la mise à l'échelle horizontale

Les centres de données d’IA modernes s’appuient sur des réseaux interconnectés de type « scale-up », « scale-out » et « scale-across » pour offrir les performances nécessaires à l’entraînement et à l’inférence de l’IA à grande échelle. Les structures « scale-up » relient les GPU et les accélérateurs au sein d’un pod à l’aide d’interconnexions à très faible latence et à large bande passante, tandis que les réseaux « scale-out » relient les racks et les clusters via des structures Ethernet sans perte. À mesure que les déploiements d’IA continuent de se développer, les architectures « scale-across » étendent la connectivité entre plusieurs campus et usines d’IA, permettant ainsi aux organisations de mettre en place une infrastructure d’IA distribuée qui fonctionne comme un système unique.

Ces architectures en constante évolution posent de nouveaux défis en matière de débit, de latence, de gestion de la congestion, de routage multiplan et multipath, ainsi que d’interopérabilité, qui doivent être validés avant le déploiement. Pour les réseaux à évolutivité verticale, horizontale et transversale, les solutions de test de réseaux de centres de données IA de Keysight simulent à grande échelle des modèles de trafic réalistes liés aux charges de travail IA. Le KAI Data Center Builder avancé de Keysight simule des communications collectives et des combinaisons de charges de travail collectives, tout en mesurant le débit, la latence, le temps d’exécution des tâches et l’utilisation de la bande passante. Cela permet une validation complète des commutateurs, des cartes réseau, des xPU et des structures de réseau de bout en bout, aidant ainsi les clients à déployer en toute confiance une infrastructure d’IA hautement performante.

Validation de bout en bout pour les réseaux de transport basés sur l'IA

Déploiement à grande échelle

Au sein d’un pod, les GPU et les xPU partagent la mémoire via des liaisons à très faible latence et à large bande passante. NVLink / NVSwitch reste la solution dominante, tandis que des alternatives basées sur Ethernet, telles que ESUN et SUE, gagnent du terrain, et qu’UALink offre une autre voie grâce à une interconnexion dédiée aux accélérateurs. La validation doit porter sur le débit et la latence entre accélérateurs, le contrôle de flux sans perte, ainsi que l'interopérabilité entre un ensemble de plus en plus varié d'interconnexions.

Extension horizontale

Les racks et les pods se connectent pour former un cluster de formation via des structures sans perte et à contrôle de congestion. Ethernet / RoCEv2 reste le choix privilégié, tandis que des protocoles de transport plus récents, notamment Multipath Reliable Connection (MRC), MetaRoCE et UE Transport (UET), offrent une répartition multipath et une récupération plus rapide en cas de perte, améliorant ainsi l’utilisation à grande échelle. La validation doit porter sur le réglage du contrôle de congestion, la résilience multipath, ainsi que le débit de bout en bout, la latence et le temps d’exécution des tâches.

Scale-Across

Plusieurs sites sont fédérés au sein d'un même système via des liaisons optiques et Ethernet longue distance. Cette catégorie récente, encore en pleine évolution, est influencée par la congestion du réseau étendu (WAN), la latence liée à la distance, l'affectation des tâches par l'IA et la mise en place de points de contrôle distribués. La validation doit porter sur la stabilité des liaisons optiques, l'impact de la latence entre les sites et le comportement du trafic dans des conditions réelles d'entraînement distribué.

Découvrez nos produits dans notre gamme de solutions d'infrastructure d'IA

Cas d'utilisation connexes

contactez-nous logo

Contactez l'un de nos experts

Besoin d'aide pour trouver la solution qui vous convient ?