Cómo validar un sistema de transporte basado en IA de alto rendimiento

IxNetwork
+ IxNetwork

Validar las redes de transporte basadas en IA, desde la ampliación vertical hasta la ampliación horizontal

Los centros de datos modernos de IA se basan en redes interconectadas de tipo «scale-up», «scale-out» y «scale-across» para ofrecer el rendimiento necesario para el entrenamiento y la inferencia de IA a gran escala. Las estructuras «scale-up» conectan las GPU y los aceleradores dentro de un pod mediante interconexiones de latencia ultrabaja y gran ancho de banda, mientras que las redes «scale-out» conectan racks y clústeres a través de estructuras basadas en Ethernet sin pérdidas. A medida que las implementaciones de IA siguen creciendo, las arquitecturas de «scale-across» amplían la conectividad entre múltiples campus y «fábricas de IA», lo que permite a las organizaciones crear una infraestructura de IA distribuida que funciona como un único sistema.

Estas arquitecturas en constante evolución plantean nuevos retos en materia de rendimiento, latencia, gestión de la congestión, reenvío multiplano y multipath, e interoperabilidad, que deben validarse antes de su implementación. Para redes de escalabilidad vertical, horizontal y transversal, las soluciones de Keysight para pruebas de redes de centros de datos con IA emulan patrones realistas de tráfico de cargas de trabajo de IA a gran escala. El avanzado KAI Data Center Builder de Keysight emula comunicaciones colectivas y combinaciones de cargas de trabajo colectivas, al tiempo que mide el rendimiento, la latencia, el tiempo de finalización de los trabajos y el uso del ancho de banda. Esto permite una validación exhaustiva de conmutadores, tarjetas de red (NIC), xPU y estructuras de red de extremo a extremo, lo que ayuda a los clientes a implementar con confianza una infraestructura de IA de alto rendimiento.

Validación integral de redes de transporte basadas en IA

Ampliación

Dentro de un pod, las GPU y las xPU comparten memoria a través de enlaces de latencia ultrabaja y gran ancho de banda. NVLink / NVSwitch sigue siendo la tecnología dominante, mientras que las alternativas basadas en Ethernet, como ESUN y SUE, ganan terreno, y UALink ofrece otra vía mediante una interconexión dedicada para aceleradores. La validación debe abarcar el rendimiento y la latencia entre aceleradores, el control de flujo sin pérdidas y la interoperabilidad entre una combinación cada vez mayor de interconexiones.

Escalabilidad horizontal

Los racks y los pods se conectan en un clúster de entrenamiento a través de estructuras sin pérdidas y con control de congestión. Ethernet/RoCEv2 es la opción predominante, mientras que los protocolos de transporte más recientes, como Multipath Reliable Connection (MRC), MetaRoCE y UE Transport (UET), incorporan la distribución multipath y una recuperación más rápida de las pérdidas, lo que mejora la utilización a gran escala. La validación debe abarcar el ajuste del control de congestión, la resiliencia multipath, así como el rendimiento de extremo a extremo, la latencia y el tiempo de finalización de los trabajos.

Scale-Across

Varias sedes se unen en un único sistema a través de enlaces ópticos y de Ethernet de larga distancia. Esta categoría más reciente, aún en fase de desarrollo, se ve condicionada por la congestión de la red de área amplia (WAN), la latencia debida a la distancia, la asignación de tareas mediante IA y la creación distribuida de puntos de control. La validación debe abarcar la estabilidad de los enlaces ópticos, el impacto de la latencia entre sedes y el comportamiento del tráfico en condiciones reales de entrenamiento distribuido.

Descubre los productos de nuestras soluciones de infraestructura de IA

Casos prácticos relacionados

contacto logotipo

Póngase en contacto con uno de nuestros expertos

¿Necesita ayuda para encontrar la solución adecuada para usted?