NVIDIA Mellanox MCX653105A-HDAT アクション:RDMA/RoCE低遅延輸送とサーバーのスループット最適化

July 29, 2026

最新の会社ニュース NVIDIA Mellanox MCX653105A-HDAT アクション:RDMA/RoCE低遅延輸送とサーバーのスループット最適化

NVIDIA Mellanox MCX653105A-HDAT アクション:RDMA/RoCE低遅延輸送とサーバーのスループット最適化

背景と課題:AI/HPCクラスターにおけるネットワークのボトルネック

大規模なテクノロジー企業が最近 128ノードGPU加速クラスタを 大規模な言語モデル (LLM) 訓練に導入しました各ノードに8つのNVIDIA H100 GPUと高性能NVMeストレージが搭載されているしかし32ノードを超えると クラスタの性能が劇的に低下しましたTCP/IPネットワークスタックがノード1つあたりCPUリソースの45%以上を消費している間に複数の25GbEリンクに構築されたネットワークは 主要なボトルネックとなり, GPUの利用を大幅に制限し,受容可能な時間枠を超えた訓練サイクルを延長しました.チームには緊急に 超低レイテンシーと膨大な帯域幅の両方を 提供できるソリューションが必要でした 同時にCPU密集型ネットワーク処理をオフロードしました.

MCX653105A-HDAT で 繊維 を 変形 する

徹底的な技術評価の後,チームはNVIDIA メラノックス MCX653105A-HDAT各GPUノードにはMCX653105A-HDAT ConnectX アダプター PCIe ネットワーク カード, サーバーあたり200Gb/sの総帯域幅を提供するために100GbE接続性を持つデュアルポートで構成されています.

配備は4つの構造的な段階で行われました.

  • ステージ1 ハードウェアの設置 (128ノード)各サーバーはMCX653105A-HDAT イーサネット アダプター カードQSFP28ポートの両方が二重冗長なNVIDIA Spectrum-4葉スイッチに接続されている.アダプターは最新のファームウェアとNVIDIA OFEDドライバースタックでインストールされた.
  • ステージ2 RoCEv2 構成:RoCEv2を全組織で有効にし,優先流量制御 (PFC) と明示的な混雑通知 (ECN) パラメータを注意深く調整して,損失のないイーサネット環境を確立しました.交通渋滞管理の機能は,MCX653105A-HDATデータシート最適なバッファの割り当てを達成するのに重要な役割を果たしました.
  • ステージ3 NCCLの最適化NVIDIA コレクティブ・コミュニケーション・ライブラリ (NCCL) は,アダプターの RDMA 機能を活用するために再構成されました.LLM ワークロードの特定の全減量と全集パターンに最適化するためにアダプターの埋め込み処理エンジンにプログラムされたカスタムトラフィックステアリングルール.
  • 第4段階 検証と精細調整電気通信のデータを使ってMCX653105A-HDATの仕様,チームは構成を検証し,中断調節設定を微調整し,継続的なモニタリングのためのベースラインパフォーマンスメトリックを確立しました.

このアダプターはMCX653105A-HDAT対応QSFP28ポートが 100GbEと25GbEの両方の光学をサポートし,ケーブル交換を妨害することなく優雅な移行を可能にします.コンピュータとストレージの両方の機能を同じ物理ポートでサポートする.

結果と利益: 訓練実績の測定可能な向上

改善された業績はNVIDIA メラノックス MCX653105A-HDATすべての初期予測を上回った.アップグレード前と後の主要なパフォーマンス指標は,以下に要約されています:

メトリック プレアップグレード (25GbE TCP/IP) 更新後 (MCX653105A-HDATとRoCE) 改善
全減速遅延 (128ノード) 9.2 ms 0.28ms 32.8×減量
ネットワークCPU利用量 (ノードあたり) 47% 6% 41 pp 再利用
GPU利用 (トレーニング段階) 58% 94% +36%増加
クラスター訓練の成果 1.9x ベースライン 5.7x ベースライン 3倍増

この数学的成果に加えて,チームは重要な運用上の利益を見ました.以前は12日かかったトレーニングはわずか4日で完了しました.劇的にモデル繰り返しのサイクルを加速させるアダプターのプログラム可能なデータパスは,優先順位の流れのためにトラフィックをカスタムにデザインし,重要な集団通信トラフィックが決して争いを経験しないことを保証しました.投資収益を評価する組織についてについてMCX653105A-HDAT価格3×のスループット増幅と,少なくとも12ヶ月で追加のGPUサーバーの買収を延期する能力によって完全に正当化された.MCX653105A-HDATを販売するNVIDIA Spectrum-4 スイッチを搭載したバンドは,フルクラスタ展開に最も有利な経済性を提供しました.

概要と展望:次世代AIインフラストラクチャの基盤

この生産規模での導入は,NVIDIA メラノックス MCX653105A-HDAT現代のAIとHPCクラスターの 変容的コンポーネントです 200Gb/sの総帯域幅と 0.3ミリ秒未満の集合通信遅延の組み合わせ組織がGPU加速ワークロードのほぼ線形的なスケーリングを達成できるようにします.端から端までMCX653105A-HDAT イーサネット アダプタカードソリューションネットワークのボトルネックを取り除くことで,分散型トレーニングの効率が歴史的に制限されています.

今後は,企業では NVIDIA DOCA との統合を検討し,ワークロード特有の最適化のために追加のデータパスプログラミングを導入しています.アダプターの高度なテレメトリを活用していますMCX653105A-HDATデータシート交通渋滞緩和戦略を自動化する.NVIDIA メラノックス MCX653105A-HDATAIインフラストラクチャのロードマップの礎となり 次世代の基盤モデルの開発と展開に 堅牢でスケーラブルな基盤を提供します