如何驗證高效能 AI 傳輸機制

IxNetwork
+ IxNetwork

從「規模擴展」到「跨域擴展」驗證 AI 運輸網路

現代人工智慧資料中心仰賴相互連接的垂直擴展、水平擴展及跨域擴展網路,以提供大規模人工智慧訓練與推論所需的效能。垂直擴展互連架構透過超低延遲、高頻寬的互連技術,將 pod 內的 GPU 與加速器相互連接;而水平擴展網路則透過基於無損乙太網路的互連架構,將機架與叢集相互連接。 隨著 AI 部署規模持續擴大,「跨域擴展」架構延伸了多個園區與 AI 工廠之間的連通性,使組織能夠建構出能作為單一系統運作的分散式 AI 基礎架構。

這些不斷演進的架構在吞吐量、延遲、擁塞管理、多平面與多路徑轉發,以及互通性等方面帶來了新的挑戰,這些挑戰必須在部署前進行驗證。針對垂直擴展、水平擴展及跨網路擴展,是德科技的 AI 資料中心網路測試解決方案能大規模模擬真實的 AI 工作負載流量模式。 是德科技先進的 KAI 資料中心建構器(KAI Data Center Builder)可模擬集體通訊及各種集體工作負載組合,同時測量吞吐量、延遲、工作完成時間及頻寬使用率。這使得交換器、網路介面卡(NIC)、xPU 及端對端結構能進行全面驗證,協助客戶自信地部署高效能的 AI 基礎架構。

人工智慧運輸網路的端到端驗證

擴大規模

在單個 Pod 內,GPU 與 xPU 透過超低延遲、高頻寬的連結共享記憶體。NVLink/NVSwitch 仍佔主導地位,而基於乙太網路的替代方案(如 ESUN 和 SUE)正逐漸受到關注,UALink 則透過專用的加速器互連技術提供了另一種解決方案。 驗證工作必須涵蓋加速器間的吞吐量與延遲、無損流量控制,以及在日益多元化的互連技術組合間的互通性。

水平擴展

機架與模組透過無損且具備擁塞控制功能的有線結構,相互連接形成訓練叢集。 乙太網路/RoCEv2 是首選方案,而較新的傳輸協議(包括多路徑可靠連線 (MRC)、MetaRoCE 以及 UE Transport (UET))則新增了多路徑分發與更快的丟包恢復能力,從而提升大規模運作時的資源利用率。驗證範圍必須涵蓋擁塞控制調校、多路徑韌性,以及端到端吞吐量、延遲與工作完成時間。

Scale-Across

多個站點透過長距離光纖與乙太網路鏈路整合為單一系統。這個較新且仍在成形中的類別,其發展受廣域網(WAN)擁塞、距離延遲、AI 任務調度以及分散式檢查點等因素所形塑。驗證工作必須涵蓋光纖鏈路穩定性、跨站點延遲的影響,以及在真實分散式訓練條件下的流量行為。

探索我們的人工智慧基礎架構解決方案中的產品

相關應用案例

聯絡我們標誌

聯絡我們的一位專家

需要協助尋找適合您的解決方案嗎?