NVIDIA Mellanox 920-9B110-00FH-0D0 in Practice: HPCとAIクラスターのための低遅延RDMAファブリックを最適化する
August 25, 2026
NVIDIA Mellanox 920-9B110-00FH-0D0の実践:HPCおよびAIクラスター向けの低遅延RDMAファブリックの最適化
背景と課題:HDRパフォーマンスが予算の現実と出会うとき
中規模のAI研究ラボは最近、よくある課題に直面していました。既存の100Gb/s EDR InfiniBandファブリックが、128ノードから512ノードのNVIDIA A100に拡大したGPUクラスターのボトルネックになりつつあったのです。大規模トランスフォーマーモデルのトレーニング時間は、オールリデュース操作中のネットワーク輻輳により40%以上増加し、チームは400Gb/s NDRへの全面的な展開に必要な資本支出なしに、大幅なパフォーマンス向上をもたらすアップグレードを必要としていました。
ラボはいくつかの選択肢を評価し、パフォーマンスとコストの理想的なバランスとして200Gb/s HDRを特定しました。しかし、高ポート密度、高度な輻輳制御、そして既存のHDR互換ケーブルおよびトランシーバーとのシームレスな統合を提供できるスイッチが必要でした。まさにここで、NVIDIA Mellanox 920-9B110-00FH-0D0が登場しました。これは、HDRが過剰なプロビジョニングなしに十分な帯域幅を提供する環境向けに特別に構築されたスイッチです。
ソリューションと展開:コスト最適化されたHDRファブリック
ラボは、新しいリーフ・スパインアーキテクチャの基盤として、920-9B110-00FH-0D0 InfiniBandスイッチOPN(注文部品番号)を展開しました。各コンピューティングラックには、920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDRの基盤となるシリコンプラットフォームであるMQM8790-HS2Fベースのスイッチが1台設置され、OSFP-OSFPダイレクトアタッチケーブルを介してGPUサーバーに200Gb/s接続を40ポート提供しました。スパイン層では、さらに4台の920-9B110-00FH-0D0スイッチがすべてのリーフスイッチを相互接続し、完全なバイセクション帯域幅を持つノンブロッキングファットツリーファブリックを構築しました。
この展開を特に効果的にしたのは、スイッチに統合されたSHARPv2(Scalable Hierarchical Aggregation and Reduction Protocol)テクノロジーであり、これによりコレクティブ通信操作がスイッチファブリックに直接オフロードされました。実際には、以前はかなりのホストCPUサイクルとネットワーク帯域幅を消費していたオールリデュース操作が、ファブリック全体で一度のパスで完了するようになり、ジョブ完了時間が劇的に短縮されました。
920-9B110-00FH-0D0データシートによると、このスイッチは200ns未満のカットスルー遅延を提供し、ラボのパフォーマンス要件に密接に合致していました。エンジニアリングチームはまた、920-9B110-00FH-0D0互換エコシステムには、すでに標準化していたすべてのケーブルタイプとオプティクスが含まれており、高価な再配線作業の必要がなくなったことを確認しました。
結果と測定可能な成果:ボトルネックからイネーブラーへ
展開後、ラボはいくつかの重要な側面で改善を測定しました:
- ジョブ完了時間の短縮:13Bパラメータモデルのトレーニングイテレーションは35%減少し、オールリデュース遅延は典型的なコレクティブサイズで12μsから5μs未満に低下しました。
- ネットワーク利用率:スイッチのアダプティブルーティングと輻輳制御メカニズムのおかげで、輻輳をトリガーすることなく、平均ファブリック利用率は58%から83%に増加しました。
- 電力と冷却効率:以前のEDRファブリックと比較して、新しいHDRインフラストラクチャはポートあたりの消費電力を30%削減し、ラボはデータセンターの電力予算を超えずに、より多くのコンピューティングノードを追加できるようになりました。
総所有コストの観点から、920-9B110-00FH-0D0の価格はポートあたりでNDRの代替品よりも大幅に低く、ラボは既存の予算内でファブリック全体をアップグレードすることができました。また、920-9B110-00FH-0D0の仕様は、スイッチのデュアル冗長電源とホットスワップ可能なファンモジュールを強調しており、ラボの目標である本番トレーニングジョブの99.999%の可用性に貢献しました。
ネットワークエンジニアは、920-9B110-00FH-0D0 InfiniBandスイッチOPNソリューションがNVIDIAのUnified Fabric Manager(UFM)とシームレスに統合され、ファブリックの状態の集中可視化と自動アラートを提供したと述べています。これにより、トラブルシューティングとプロアクティブなメンテナンスに費やす時間が大幅に削減され、チームはネットワーク管理ではなく、トレーニングパイプラインの最適化に集中できるようになりました。
概要と展望:適切なサイズのHDR基盤
NVIDIA Mellanox 920-9B110-00FH-0D0は、この研究ラボにとって正しい選択であることが証明され、ビジネス的に意味のあるコスト構造で200Gb/s HDRのパフォーマンスを提供しました。スイッチの40ポート密度、インネットワークコンピューティング機能、および堅牢な管理機能を活用することで、ラボはネットワークをパフォーマンスのボトルネックから将来の成長のためのスケーラブルな基盤へと変革しました。
今後、ラボは今後18ヶ月でクラスターを1,024ノードに拡張する計画です。920-9B110-00FH-0D0は複数のスパインティアを介した大規模トポロジーをサポートしているため、コンピューティング能力とともにネットワークも成長できると確信しています。HDRインフラストラクチャの選択肢を評価している組織にとって、NVIDIAのチャネルパートナーを通じて販売されている920-9B110-00FH-0D0は、パフォーマンス、密度、コストのバランスをとった、説得力のある本番環境で検証済みのソリューションを提供します。

