Come verificare l'efficacia dei sistemi di trasporto basati sull'intelligenza artificiale ad alte prestazioni

Rete Ix
+ IxNetwork

Convalidare le reti di trasporto basate sull’intelligenza artificiale, dallo scale-up allo scale-across

I moderni data center dedicati all’IA si basano su reti interconnesse di tipo scale-up, scale-out e scale-across per garantire le prestazioni necessarie per l’addestramento e l’inferenza dell’IA su larga scala. Le architetture scale-up collegano GPU e acceleratori all’interno di un pod tramite interconnessioni a bassissima latenza e elevata larghezza di banda, mentre le reti scale-out collegano rack e cluster attraverso architetture basate su Ethernet senza perdita di dati. Con la continua crescita delle implementazioni di IA, le architetture "scale-across" estendono la connettività tra più campus e "fabbriche di IA", consentendo alle organizzazioni di costruire un'infrastruttura IA distribuita che opera come un unico sistema.

Queste architetture in continua evoluzione introducono nuove sfide in termini di throughput, latenza, gestione della congestione, inoltro multipiano e multipath e interoperabilità, che devono essere validate prima dell’implementazione. Per le reti scale-up, scale-out e scale-across, le soluzioni Keysight per il test delle reti dei data center basate sull’intelligenza artificiale emulano modelli realistici di traffico dei carichi di lavoro AI su larga scala. L’avanzato KAI Data Center Builder di Keysight emula comunicazioni collettive e combinazioni di carichi di lavoro collettivi, misurando al contempo la velocità di trasmissione, la latenza, il tempo di completamento dei lavori e l’utilizzo della larghezza di banda. Ciò consente una validazione completa di switch, schede di rete (NIC), xPU e fabric end-to-end, aiutando i clienti a implementare con fiducia infrastrutture di IA ad alte prestazioni.

Convalida end-to-end per le reti di trasporto basate sull’intelligenza artificiale

Scale-up

All’interno di un pod, le GPU e le xPU condividono la memoria tramite collegamenti a bassissima latenza e elevata larghezza di banda. NVLink / NVSwitch continua a dominare il mercato, mentre le alternative basate su Ethernet, come ESUN e SUE, stanno guadagnando terreno e UALink offre un’ulteriore opzione grazie a un’interconnessione dedicata per gli acceleratori. La validazione deve coprire il throughput e la latenza da acceleratore ad acceleratore, il controllo di flusso senza perdite e l’interoperabilità tra una combinazione sempre più ampia di interconnessioni.

Scale-out

I rack e i pod si collegano in un cluster di addestramento tramite fabric senza perdita di dati e con controllo della congestione. Ethernet / RoCEv2 rappresenta la scelta principale, mentre i protocolli di trasporto più recenti, tra cui Multipath Reliable Connection (MRC), MetaRoCE e UE Transport (UET), aggiungono la distribuzione multipath e un recupero più rapido in caso di perdita, migliorando l’utilizzo su larga scala. La validazione deve coprire la messa a punto del controllo della congestione, la resilienza multipath, nonché il throughput end-to-end, la latenza e il tempo di completamento dei lavori.

Scale-Across

Diversi siti si federano in un unico sistema tramite collegamenti ottici ed Ethernet a lunga distanza. Questa categoria più recente, ancora in fase di definizione, è caratterizzata da congestione della WAN, latenza dovuta alla distanza, assegnazione dei compiti tramite IA e checkpoint distribuiti. La validazione deve riguardare la stabilità dei collegamenti ottici, l’impatto della latenza tra i siti e il comportamento del traffico in condizioni reali di addestramento distribuito.

Scopri i prodotti delle nostre soluzioni per l'infrastruttura di intelligenza artificiale

Casi d'uso correlati

contattaci logo

Mettetevi in contatto con uno dei nostri esperti

Avete bisogno di aiuto per trovare la soluzione giusta per voi?