NVIDIA Mellanox 920-9B210-00FN-0D0の実践:テラパラメータAIクラスター向けのNDR低遅延ファブリック構築

August 26, 2026

最新の会社ニュース NVIDIA Mellanox 920-9B210-00FN-0D0の実践:テラパラメータAIクラスター向けのNDR低遅延ファブリック構築

NVIDIA Mellanox 920-9B210-00FN-0D0の実践:テラパラメータAIクラスター向けのNDR低遅延ファブリック構築

背景と課題:HDRとテラパラメータモデルの出会い

ある大手AI研究組織は最近、大規模言語モデルのトレーニングクラスターを1,024基のNVIDIA H100 GPUから4,096基にスケールアップしました。その目標は、1.8兆パラメータのスパースMoE(Mixture of Experts)モデルのトレーニング期間を数ヶ月から2週間未満に短縮することでした。しかし、初期検証中に、チームは既存の200Gb/s HDRファブリックでのオール・ツー・オール通信フェーズで深刻な輻輳を観測し、GPU使用率が予想の85%からわずか52%に低下しました。これは、野心的なトレーニング締め切りを満たすために必要な閾値をはるかに下回っていました。

ネットワーク分析により、MoEアーキテクチャに固有のオール・ツー・オール集団演算がHDRリンクを飽和させ、遅延をさらに増幅させる輻輳制御メカニズムをトリガーしていることが明らかになりました。この組織は、数千のエンドポイント全体で決定論的なサブマイクロ秒の遅延を提供し、パフォーマンスの崩壊なしにトラフィックバーストを吸収するための帯域幅ヘッドルームを提供するファブリックを必要としていました。これはまさに、NVIDIA Mellanox 920-9B210-00FN-0D0が解決するために設計された課題です。

ソリューションと展開:エクサスケールAI向けの400Gb/s NDRファブリック

この組織は、新しい2層リーフ・スパインファブリックの基盤として、920-9B210-00FN-0D0 InfiniBandスイッチOPN(注文部品番号)を展開しました。リーフ層では、各ラックに2台の920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRスイッチが配置され、OSFP-to-OSFPアクティブ光ケーブルを介して、ラックあたり64台のデュアルポートH100サーバーに128ポートの400Gb/s接続を提供しました。スパイン層では、さらに16台の920-9B210-00FN-0D0スイッチがすべてのリーフスイッチを相互接続し、スパイン層あたり51.2 Tb/sの完全なバイセクション帯域幅を持つノンブロッキングファットツリーを構築しました。

このソリューションを特に魅力的なものにしたのは、スイッチに統合されたSHARPv3(Scalable Hierarchical Aggregation and Reduction Protocol)テクノロジーでした。MoEワークロードの場合、オール・ツー・オール通信はスイッチファブリックに直接オフロードされ、スイッチがインネットワークでのデータ削減と再配布を実行しました。これにより、複数のホストサイドパスの必要がなくなり、以前のHDR展開を悩ませていた通信オーバーヘッドが劇的に削減されました。

によると920-9B210-00FN-0D0データシート、このスイッチはサブ100nsのカットスルー遅延を提供し、これは概念実証フェーズ中に検証されました。エンジニアリングチームはまた、920-9B210-00FN-0D0互換エコシステムには、すでに認定済みのOSFPオプティクスとケーブルがすべて含まれており、調達の遅延を解消したことも確認しました。この920-9B210-00FN-0D0仕様(デュアル冗長電源とホットスワップ可能なファンを含む)は、本番クラスターの99.999%の可用性目標を達成できるというチームの信頼を確固たるものにしました。

結果と測定可能な成果:ボトルネックからイネーブラーへ

完全なNDRファブリックが展開され、MoEトレーニングジョブが再開された後、組織は複数の側面で変革的な改善を測定しました:

  • GPU使用率の回復:ネットワークに起因する停止が解消された直接の結果として、平均GPU使用率は52%から89%に急増し、ピーク使用率は計算集約的なフェーズ中に94%に達しました。
  • オール・ツー・オール遅延の削減:4,096基のGPU全体での完全なオール・ツー・オール交換に必要な時間が180msから45ms未満に短縮され、75%の改善はトレーニングイテレーションの高速化に直接つながりました。
  • ジョブ完了時間:1.8T MoEモデルの予測トレーニング期間は14日からわずか9日に短縮され、36%の加速により市場投入までの時間とクラウドコンピューティングコストの両方が大幅に削減されました。
  • 運用効率:スイッチあたり64ポートであるため、40ポートのHDR設計と比較して必要なスパインスイッチの数が37%削減され、ケーブリングが簡素化され、ラックあたりの消費電力が28%削減されました。

総所有コストの観点から、組織の財務チームは、920-9B210-00FN-0D0価格はHDR代替品よりも高かったものの、高いラディックスと削減されたスイッチ層数により、GPUあたりのネットワークコストは実際に減少したと指摘しました。この経済的利点は、劇的なパフォーマンス向上と相まって、NDRアップグレードを明確なビジネス上の勝利としました。この920-9B210-00FN-0D0 InfiniBandスイッチOPNソリューションは、既存のNVIDIA UFM展開ともシームレスに統合され、集中化された可視性と自動化されたアラートを提供し、運用オーバーヘッドを40%削減しました。

概要と展望:次世代AIのNDR基盤

このNVIDIA Mellanox 920-9B210-00FN-0D0は、このAI研究組織が4,096基のGPU H100クラスターの可能性を最大限に引き出すために必要としていた変革的なソリューションであることが証明されました。400Gb/s NDR帯域幅、64ポート密度、およびSHARPv3インネットワークコンピューティングを提供することにより、このスイッチは、以前のHDRインフラストラクチャでは不可能だったパフォーマンスや管理性を損なうことなく、1,024基から4,096基のGPUへのスケーリングを可能にしました。

今後、この組織は、NVIDIAのチャネルパートナーを通じて販売中の920-9B210-00FN-0D0を活用して、さらに大規模な3層フォールドクロースファブリックを構築し、今後18ヶ月以内に8,192基のGPUに拡張する計画です。次世代AIおよびHPCネットワーキング投資を評価している組織にとって、920-9B210-00FN-0D0は、エクサスケールでの低遅延RDMAインターコネクト最適化の約束を果たす、実績のある本番対応ソリューションを提供します。