NVIDIA Mellanox 920-9B210-00FN-0D0 in Practice: トリリオンパラメータ MoEモデルのためのNDR低遅延ファブリックを構築する

August 27, 2026

最新の会社ニュース NVIDIA Mellanox 920-9B210-00FN-0D0 in Practice: トリリオンパラメータ MoEモデルのためのNDR低遅延ファブリックを構築する

NVIDIA Mellanox 920-9B210-00FN-0D0の実践:テラパラメータMoEモデル向けNDR低遅延ファブリックの構築

背景と課題:All-to-Allがトレーニングのボトルネックになる時

大手AI研究機関は最近、1.8兆パラメータのスパースMoE(Mixture of Experts)モデルのトレーニング時間を数ヶ月から2週間未満に短縮するという野心的な目標を掲げ、大規模言語モデルトレーニングクラスターを1,024基のNVIDIA H100 GPUから4,096基にスケールアップしました。しかし、初期検証中に、チームは既存の200Gb/s HDRネットワークが、MoEアーキテクチャの典型的なパターンであるAll-to-All通信フェーズ中に深刻な輻輳を経験していることを発見しました。これにより、GPU使用率は予想の85%からわずか52%に低下し、トレーニング締め切りを満たすために必要な閾値をはるかに下回りました。

ネットワーク分析により、All-to-Allコレクティブ通信がMoEモデルの通信フットプリントの40%以上を占め、エキスパート数が増加するにつれてトラフィックパターンがますます断片的かつバースト的になることが明らかになりました。既存のHDRネットワークは、輻輳制御メカニズムをトリガーした後、劇的なテール遅延の増加を経験し、GPUの大部分がアイドル状態のまま待機していました。同組織は、決定論的なサブマイクロ秒遅延、ロスレス転送、および大規模なノンブロッキングスケーラビリティを提供するネットワークファブリックを緊急に必要としていました。そして、NVIDIA Mellanox 920-9B210-00FN-0D0は、まさにこの課題のために特別に構築されました。

ソリューションと展開:MoE最適化NDRリーフ・スパインアーキテクチャ

同組織は、920-9B210-00FN-0D0 InfiniBandスイッチOPNを中心に構築された2層リーフ・スパインファブリックを展開しました。各コンピューティングラックには、リーフ層に2基の920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRスイッチが展開され、OSFP-to-OSFPアクティブ光ケーブルを介して64基のデュアルポートH100サーバーに400Gb/s接続を提供しました。スパイン層では、さらに16基の920-9B210-00FN-0D0スイッチがすべてのリーフスイッチを相互接続し、51.2 Tb/sの集約バイセクション帯域幅を持つ完全にノンブロッキングなファットツリーファブリックを構築しました。

このソリューションの中心は、スイッチに統合されたSHARPv3(Scalable Hierarchical Aggregation and Reduction Protocol)テクノロジーです。MoEワークロードでは、All-to-All通信はスイッチファブリックに直接オフロードされ、スイッチがインネットワークでのデータ削減と再配布を実行しました。これにより、複数のホストサイドパスの必要性がなくなり、以前のHDR展開を悩ませていた通信オーバーヘッドが劇的に削減されました。 920-9B210-00FN-0D0データシートは、サブ100nsのカットスルー遅延を強調しており、これは概念実証フェーズ中に検証され、MoEワークロードの厳格な遅延要件にとって極めて重要であることが証明されました。

920-9B210-00FN-0D0の仕様(デュアル冗長電源とホットスワップ可能なファンを含む)は、チームが99.999%の可用性目標を達成できるという自信を与えました。エンジニアリングチームはまた、920-9B210-00FN-0D0互換エコシステムには、すでに認定済みのOSFPオプティクスとケーブルがすべて含まれており、調達の遅延をなくし、展開タイムラインを簡素化することも確認しました。

結果と測定可能な成果:ボトルネックからイネーブラーへ

NDRファブリックが完全に展開され、MoEトレーニングジョブが再開された後、同組織は複数の側面で変革的な改善を測定しました:

  • GPU使用率の回復:ネットワークによる遅延が解消された直接的な結果として、平均GPU使用率は52%から89%に急増し、ピーク使用率は計算集約的なフェーズ中に94%に達しました。
  • All-to-All遅延の削減:4,096基のGPU全体での完全なAll-to-All交換に必要な時間が180msから45ms未満に短縮され、75%の改善はトレーニングイテレーションの高速化に直接つながりました。
  • ジョブ完了時間:1.8T MoEモデルの予測トレーニングタイムラインは14日からわずか9日に短縮され、36%の加速により市場投入までの時間とクラウドコンピューティングコストの両方が大幅に削減されました。
  • 運用効率:スイッチあたり64ポートであるため、40ポートのHDR設計と比較して必要なスパインスイッチの数が37%削減され、ケーブリングが簡素化され、ラックあたりの消費電力が28%削減されました。

総所有コストの観点から、同組織の財務チームは、920-9B210-00FN-0D0の価格はHDR代替品よりも高かったものの、高いラディックスと削減されたスイッチ層数により、GPUあたりのネットワークコストは実際に減少したと指摘しました。この経済的な利点は、劇的なパフォーマンス向上と相まって、NDRアップグレードを明確なビジネス上の勝利としました。 920-9B210-00FN-0D0 InfiniBandスイッチOPNソリューションは、既存のNVIDIA UFM展開ともシームレスに統合され、集中化された可視性と自動化されたアラートを提供し、運用オーバーヘッドを40%削減しました。

概要と展望:次世代MoEワークロードのためのNDR基盤

NVIDIA Mellanox 920-9B210-00FN-0D0は、このAI研究組織が4,096基のH100 GPUクラスターの可能性を最大限に引き出すために必要としていた変革的なソリューションであることが証明されました。400Gb/s NDR帯域幅、64ポート密度、およびSHARPv3インネットワークコンピューティングを提供することにより、このスイッチは、パフォーマンスや管理性を損なうことなく、1,024基から4,096基のGPUへのスケーリングを可能にしました。これは、以前のHDRインフラストラクチャでは不可能だった偉業でした。

今後、同組織は、NVIDIAのチャネルパートナーを通じて販売される920-9B210-00FN-0D0の販売を活用して、さらに大規模な3層フォールドクロースファブリックを構築し、今後18ヶ月以内に8,192基のGPUに拡張する計画です。次世代AIおよびHPCネットワーク投資を評価している組織にとって、920-9B210-00FN-0D0は、エクサスケールでの低遅延RDMAインターコネクト最適化の約束を果たす、実績のある本番稼働可能なソリューションを提供します。