高性能AIトランスポートの検証方法

IxNetwork
+ IxNetwork

スケールアップからスケールアクロスに至るAI輸送ネットワークの検証

最新のAIデータセンターでは、大規模なAIトレーニングや推論に必要なパフォーマンスを実現するために、相互接続されたスケールアップ、スケールアウト、およびスケールアクロスネットワークが活用されています。スケールアップファブリックは、超低遅延・高帯域幅の相互接続を用いてポッド内のGPUやアクセラレータを接続する一方、スケールアウトネットワークは、ロスレスなイーサネットベースのファブリックを通じてラックやクラスターを接続します。 AIの導入が拡大し続ける中、スケール・アクロス・アーキテクチャは複数のキャンパスやAIファクトリー間の接続性を拡張し、組織が単一のシステムとして動作する分散型AIインフラを構築することを可能にします。

こうした進化を続けるアーキテクチャは、スループット、レイテンシ、輻輳管理、マルチプレーンおよびマルチパス転送、相互運用性といった面で新たな課題をもたらしており、導入前にこれらの検証を行う必要があります。スケールアップ、スケールアウト、およびネットワーク横断型の拡張において、キーサイトのAIデータセンターネットワークテストソリューションは、現実的なAIワークロードのトラフィックパターンを大規模にエミュレートします。 キーサイトの先進的な「KAI Data Center Builder」は、集合的な通信や集合的なワークロードの組み合わせをエミュレートすると同時に、スループット、レイテンシ、ジョブ完了時間、帯域幅使用量を測定します。これにより、スイッチ、NIC、xPU、およびエンドツーエンドのファブリックの包括的な検証が可能となり、お客様が自信を持って高性能なAIインフラストラクチャを導入できるよう支援します。

AI輸送ネットワークのエンドツーエンド検証

スケールアップ

ポッド内では、GPUとxPUが、超低遅延・高帯域幅のリンクを介してメモリを共有しています。NVLink / NVSwitchが依然として主流である一方、ESUNやSUEといったイーサネットベースの代替技術も普及しつつあり、UALinkは専用のアクセラレータ相互接続を通じて別の選択肢を提供しています。 検証では、アクセラレータ間のスループットとレイテンシ、ロスレスなフロー制御、そしてますます多様化する相互接続方式間の相互運用性を網羅する必要があります。

スケールアウト

ラックとポッドは、ロスレスで輻輳制御機能を備えたファブリックを介してトレーニングクラスターに接続されます。 イーサネット/RoCEv2が主流の選択肢ですが、マルチパス・リライアブル・コネクション(MRC)、MetaRoCE、UEトランスポート(UET)などの新しいトランスポート方式では、マルチパス・スプレイやより高速な損失回復機能が追加され、大規模環境での利用率が向上します。検証では、輻輳制御のチューニング、マルチパスの耐障害性、およびエンドツーエンドのスループット、レイテンシ、ジョブ完了時間を網羅する必要があります。

スケール・アクロス

複数のサイトが、長距離の光回線およびイーサネット回線を介して1つのシステムに統合されます。この比較的新しく、まだ形成途上にあるカテゴリーは、WANの輻輳、距離による遅延、AIジョブの配置、および分散型チェックポイントによって形作られています。検証では、実際の分散トレーニング環境下における光回線の安定性、サイト間の遅延の影響、およびトラフィックの挙動を網羅する必要があります。

当社のAIインフラストラクチャソリューションの製品をご覧ください

関連するユースケース

お問い合わせ ロゴ

当社のエキスパートにお問い合わせください。

所望のソリューションを見つけるのにお困りですか?