NVIDIA Mellanox MQM8790-HS2F InfiniBandスイッチの実働:RDMA/HPC/AIクラスター向け低遅延インターコネクトの最適化

August 21, 2026

最新の会社ニュース NVIDIA Mellanox MQM8790-HS2F InfiniBandスイッチの実働:RDMA/HPC/AIクラスター向け低遅延インターコネクトの最適化

NVIDIA Mellanox MQM8790-HS2F InfiniBandスイッチの実働:RDMA/HPC/AIクラスター向けの低遅延インターコネクトの最適化

大規模AIモデルのトレーニングや高性能コンピューティング(HPC)の分野では、ネットワーク遅延がクラスターのスケーラビリティと効率を制限するクリティカルなボトルネックとなることがよくあります。ある国家レベルのスーパーコンピューティングセンターは最近、インフラストラクチャの大規模なアップグレードを完了し、100Gb/s EDR InfiniBandファブリックから、NVIDIA Mellanox MQM8790-HS2F InfiniBandスイッチを中心に構築された200Gb/s HDRソリューションに移行しました。このケーススタディでは、彼らが直面した課題、展開戦略、そしてこの次世代インターコネクトによって達成された測定可能なパフォーマンス向上について検証します。

背景と課題:パフォーマンスの天井となる遅延

このスーパーコンピューティングセンターは、2,000以上のGPUノードからなる異種クラスターを運用しており、気象シミュレーション、ゲノム研究、大規模言語モデルのトレーニングを含む多様なワークロードミックスをサポートしています。以前の100Gb/s EDRネットワークでは、運用チームは、ノード数が増加するにつれて、all-reduceやall-gatherなどの集団通信操作がジョブ実行時間全体に占める割合が増加していることに気づきました。一部の分散トレーニングジョブでは、ネットワーク関連のオーバーヘッドがエンドツーエンドの実行時間の約40%を占め、GPUの利用率を著しく制限し、モデル収束サイクルを延長していました。

その他の課題には以下が含まれます:

  • 輻輳ホットスポット: AIトレーニングのトラフィックパターンはしばしばバースト的で予測不可能であり、ヘッドオブラインブロッキングやテール遅延のスパイクを引き起こし、ジョブスケジューリングを妨げました。
  • ネットワーク内アクセラレーションの不足: レガシーファブリックは高度な集団オフロード機能をサポートしていなかったため、すべての削減操作がホストCPUとメモリ階層を通過する必要がありました。
  • 管理の複雑さ: パフォーマンスの問題のトラブルシューティングには、複数の監視ツールの手動分析が必要であり、大規模展開での根本原因の特定が困難でした。

複数のインターコネクトオプションを評価した後、センターは新しいファブリックの基盤としてMQM8790-HS2Fを選択しました。 MQM8790-HS2Fデータシートによると、このスイッチは、40ポートの200Gb/s HDRノンブロッキングスループット、130ns未満のカットスルー遅延、およびSHARP v3.0集団オフロードのサポートを提供しており、これらの機能は彼らの主要なペインポイントに直接対応していました。

ソリューションと展開:AI/HPC向けの低遅延ファブリックの構築

展開では、2層のファットツリートポロジーを採用し、24台のMQM8790-HS2F 200Gb/s HDR 40ポートQSFP56スイッチをリーフノードとして、8台をスパインスイッチとして展開しました。この構成は、クラスター全体で2:1のオーバーサブスクリプションを提供し、現在のワークロードには十分でありながら、将来の拡張のためのヘッドルームも確保しました。

展開レイヤー スイッチ数 使用ポート数 接続性
リーフ(ラックあたり) 24 各32ポート ToRサーバー + スパインアップリンク
スパイン 8 各36ポート すべてのリーフスイッチへのフルメッシュ

各リーフスイッチは、NVIDIA ConnectX-6 HDRホストチャネルアダプターを介してコンピューティングノードに接続されます。 MQM8790-HS2F互換のオプティクスおよびケーブルエコシステムにより、チームは既存のQSFP56ケーブルを再利用でき、展開を加速し、調達コストを削減できました。物理的な設置全体は2週間以内に完了し、コントロールプレーンはNVIDIAのUnified Fabric Manager(UFM)を活用してトポロジーの自動検出とプロビジョニングを行いました。

スイッチの適応ルーティングと輻輳制御のサポートは、AIワークロードに特徴的なバースト的なトラフィックを処理する上で極めて重要であることが証明されました。利用可能なパス全体にフローを動的に再分散することにより、MQM8790-HS2F InfiniBandスイッチはホットスポットの形成を最小限に抑え、ピークジョブスケジューリング期間中でも一貫したパフォーマンスを維持しました。

結果と成果:ジョブスループットとGPU利用率の測定可能な改善

3ヶ月の運用後、スーパーコンピューティングセンターは複数の側面で大幅なパフォーマンス向上を報告しました:

  • 遅延の削減: 平均MPIピンポン遅延は、以前のEDRファブリックの680 nsから、NVIDIA Mellanox MQM8790-HS2Fでは130 ns未満に減少し、メッセージ交換効率で5倍の改善を達成しました。
  • 集団操作の高速化: SHARP v3.0オフロードにより、スイッチファブリック内で直接削減操作を実行できるようになったため、1024ノードジョブのall-reduce遅延が62%削減されました。
  • GPU利用率: 低遅延と高帯域幅の組み合わせにより、平均GPU利用率は72%から91%に向上し、大規模言語モデルのトレーニング実行におけるソリューションまでの時間が26%短縮されました。
  • ジョブスケジューリング効率: テール遅延のばらつきが減少したことにより、SLURMスケジューラはパフォーマンス干渉なしに同じノードセットにさらに多くのジョブをパックできるようになり、クラスター全体の全体的なスループットが約18%向上しました。

その後、チームがMQM8790-HS2F価格を他のベンダーの代替スイッチと比較してベンチマークしたところ、提供されるGb/sあたりの総コストは非常に競争力があることがわかりました。特に、管理オーバーヘッドの削減と、HDRおよびHDR100の両方のリンク速度をサポートするスイッチの能力を考慮すると、混合速度環境への投資を保護できます。

運用上の観点からは、統合されたUFMプラットフォームは、ファブリックの健全性、トラフィックパターン、およびリンクレベルのエラーを監視するための単一のビューを提供しました。この可視性により、チームは劣化しているケーブルを事前に特定し、計画メンテナンス中に交換することができ、予期せぬダウンタイムを回避できました。

概要と展望:次世代低遅延ファブリックのブループリント

このケーススタディは、MQM8790-HS2F InfiniBandスイッチソリューションが単なる速度アップグレード以上のもの、つまりAIおよびHPCインフラストラクチャのパフォーマンスポテンシャルを最大限に引き出したい組織にとって変革的なコンポーネントであることを示しています。高ポート密度、超低遅延、およびネットワーク内コンピューティング機能を組み合わせることで、このスイッチは、クラスターのスケーラビリティを歴史的に制限してきた通信ボトルネックに直接対処します。

今後、スーパーコンピューティングセンターは、来年度に同じMQM8790-HS2Fアーキテクチャを追加のスパインスイッチで活用して、ファブリックを2,400ノードに拡張する予定です。チームはまた、SHARP v3.0の強化された削減アルゴリズムのサポートも検討しており、これはグラフニューラルネットワークや強化学習などの新しいワークロードをさらに加速することが期待されています。

独自のクラスター構築のためのインターコネクトオプションを評価しているITマネージャー、ネットワークアーキテクト、およびエンジニアにとって、NVIDIA Mellanox MQM8790-HS2Fは、サブマイクロ秒の遅延、GPU利用率の最大化、および簡素化されたファブリック管理を実現するための、実証済みのフィールド検証済みパスを提供します。詳細なMQM8790-HS2F仕様とリファレンスデザインは、NVIDIAのテクニカルドキュメンテーションポータルから入手可能であり、このスイッチは現在広く入手可能です。 MQM8790-HS2F 販売で検索して、地域のパートナーを見つけてください。