Wie man Hochleistungs-KI-Transport validiert

IxNetwork
+ IxNetwork

Validierung von KI-Transportnetzwerken von Scale-Up bis Scale-Across

Moderne KI-Rechenzentren nutzen vernetzte Scale-up-, Scale-out- und Scale-across-Netzwerke, um die für umfangreiches KI-Training und -Inferenz erforderliche Leistung bereitzustellen. Scale-up-Fabrics verbinden GPUs und Beschleuniger innerhalb eines Pods über Verbindungen mit extrem niedriger Latenz und hoher Bandbreite, während Scale-out-Netzwerke Racks und Cluster über verlustfreie Ethernet-basierte Fabrics verbinden. Mit dem stetigen Wachstum von KI-Implementierungen erweitern Scale-across-Architekturen die Konnektivität zwischen mehreren Standorten und KI-Fabriken und ermöglichen es Unternehmen so, eine verteilte KI-Infrastruktur aufzubauen, die als einheitliches System fungiert.

Diese sich weiterentwickelnden Architekturen bringen neue Herausforderungen hinsichtlich Durchsatz, Latenz, Stauvermeidung, Multiplane- und Multipath-Weiterleitung sowie Interoperabilität mit sich, die vor der Implementierung validiert werden müssen. Für Scale-up-, Scale-out- und Scale-across-Netzwerke simulieren die KI-basierten Netzwerktestlösungen von Keysight realistische KI-Workload-Verkehrsmuster in großem Umfang. Der fortschrittliche KAI Data Center Builder von Keysight simuliert kollektive Kommunikation und Mischungen kollektiver Workloads und misst dabei Durchsatz, Latenz, Job-Abschlusszeit und Bandbreitennutzung. Dies ermöglicht eine umfassende Validierung von Switches, NICs, xPUs und End-to-End-Fabrics und unterstützt Kunden bei der sicheren Implementierung leistungsstarker KI-Infrastrukturen.

End-to-End-Validierung für KI-Transportnetze

Skalierung

Innerhalb eines Pods teilen sich GPUs und xPUs den Speicher über Verbindungen mit extrem niedriger Latenz und hoher Bandbreite. NVLink/NVSwitch ist weiterhin führend, während Ethernet-basierte Alternativen wie ESUN und SUE an Bedeutung gewinnen und UALink über eine dedizierte Beschleunigerverbindung einen weiteren Weg bietet. Die Validierung muss Durchsatz und Latenz zwischen den Beschleunigern, verlustfreie Flusssteuerung und Interoperabilität über eine wachsende Vielfalt an Verbindungen hinweg umfassen.

Scale-Out

Racks und Pods verbinden sich über verlustfreie, staukontrollierte Verbindungen zu einem Trainingscluster. Ethernet/RoCEv2 ist die führende Wahl, während neuere Transportprotokolle wie Multipath Reliable Connection (MRC), MetaRoCE und UE Transport (UET) Multipath-Spraying und eine schnellere Wiederherstellung nach Paketverlusten ermöglichen und so die Auslastung im großen Maßstab verbessern. Die Validierung muss die Optimierung der Staukontrolle, die Ausfallsicherheit durch Multipath-Verarbeitung sowie den End-to-End-Durchsatz, die Latenz und die Job-Abschlusszeit umfassen.

Maßstab-Über

Mehrere Standorte werden über optische und Ethernet-Verbindungen mit großer Reichweite zu einem System zusammengeführt. Diese neue, sich noch entwickelnde Kategorie wird durch WAN-Überlastung, Latenzzeiten über große Entfernungen, die Verteilung von KI-Aufgaben und verteilte Checkpoints geprägt. Die Validierung muss die Stabilität der optischen Verbindungen, die Auswirkungen standortübergreifender Latenzzeiten und das Verkehrsverhalten unter realen Bedingungen des verteilten Trainings umfassen.

Entdecken Sie Produkte in unseren KI-Infrastrukturlösungen

Verwandte Anwendungsfälle

Kontakt Logo

Kontaktieren Sie einen unserer Experten

Benötigen Sie Hilfe bei der Suche nach der richtigen Lösung für Sie?