メラノックス (NVIDIA メラノックス) MQM9790-NS2F インフィニバンドスイッチ技術ソリューション

July 13, 2026

メラノックス (NVIDIA メラノックス) MQM9790-NS2F インフィニバンドスイッチ技術ソリューション

Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand スイッチ技術ソリューション – RDMA/HPC/AI クラスター向けの低遅延相互接続の最適化

このテクニカル ホワイト ペーパーでは、以下を中心とした包括的なソリューション アーキテクチャを紹介します。メラノックス (NVIDIA メラノックス) MQM9790-NS2Fインフィニバンドスイッチ。このドキュメントは、ネットワーク アーキテクト、プリセールス エンジニア、運用リーダーを対象としており、MQM9790-NS2F次世代の HPC および AI インフラストラクチャに、確定的な超低遅延、ロスレス RDMA、スケーラブルな帯域幅を提供します。設計原則、導入トポロジ、運用上のベスト プラクティス、およびパフォーマンスの検証について説明します。

1. プロジェクトの背景と要件の分析

最新の AI トレーニングと科学シミュレーションのワークロードには、マイクロ秒未満のジッターで大規模なオールリデュース、オールギャザー、ポイントツーポイントの通信パターンを維持できるネットワーク ファブリックが必要です。従来のイーサネットベースのソリューションは、たとえ RoCEv2 であっても、輻輳管理、PFC チューニング、テールレイテンシー制御に複雑さをもたらし、多くの場合、非効率的な GPU 使用率や予測不能なジョブ完了時間を引き起こします。

典型的な HPC/AI プロジェクト全体で特定されている主な要件は次のとおりです。

  • 全負荷時のエンドツーエンドの遅延は 1 μs 未満 (スイッチのポート間)
  • 輻輳によるパケットドロップがゼロのロスレスファブリック
  • アーキテクチャを変更せずに 64 GPU ノードから 2,000 以上の GPU ノードまでのスケーラビリティ
  • 豊富なテレメトリと自動障害回復によるシンプルな運用

NVIDIA Mellanox MQM9790-NS2Fは、NDR 400 Gb/s テクノロジー、アダプティブ ルーティング、およびネットワーク内コンピューティングを 1U、64 ポート OSFP プラットフォームに統合することで、これらの需要に直接対応します。

2.全体的なネットワーク/システムアーキテクチャの設計

推奨されるアーキテクチャでは、2 層リーフスパイン (またはファットツリー) トポロジを採用し、完全な二分帯域幅と高い復元力を提供します。各リーフ ブロックは複数のラックで構成され、各ラックには 2 つのラックが収容されます。MQM9790-NS2F インフィニバンド スイッチ冗長性のために。スパイン層はすべてのリーフ スイッチからのトラフィックを集約し、任意の 2 つのエンドポイント間のノンブロッキング通信を保証します。

MQM9790-NS2F 400Gb/秒 NDR 64 ポート OSFPスイッチはリーフとスパインの両方として機能し、ファブリック全体に均一なハードウェアを提供するため、スペアとメンテナンスが簡素化されます。 1,024 GPU クラスターの場合、一般的な設計では 16 個のリーフ スイッチ (それぞれ 64 個の GPU に接続) と 8 個のスパイン スイッチが使用され、すべて 400G 光ケーブルまたは DAC ケーブルで相互接続されます。このファブリックは、ファットツリー トポロジと Dragonfly+ トポロジの両方をサポートし、アダプティブ ルーティングにより複数のパス間でトラフィックの動的バランスをとります。

3. の役割と主な特徴メラノックス (NVIDIA メラノックス) MQM9790-NS2Fソリューションの中で

NVIDIA Mellanox MQM9790-NS2Fはこのソリューションの基礎であり、以下を提供します。

  • 64 OSFP ポートそれぞれ 400 Gb/s (NDR) で動作します。総スイッチング容量は 25.6 Tb/s、カットスルー遅延は 600 ns 未満です。
  • 適応型ルーティング– パケットごとに最も混雑の少ないパスを動的に選択し、ホットスポット リンクを回避し、非対称トラフィック パターン下でも一貫した遅延を維持します。
  • SHARPv3 (スケーラブルな階層型集約および削減プロトコル)– 集団通信 (all-reduce、ブロードキャスト) をホスト CPU からオフロードし、ネットワーク チャタリングを削減し、AI トレーニングを最大 20 ~ 30% 高速化します。
  • ネットワーク内コンピューティング– データ削減、セグメンテーション、さらには小規模な MPI 操作をスイッチ上で直接サポートし、貴重な GPU リソースを計算用に解放します。
  • テレメトリーと輻輳管理– フローごとのカウンタ、バッファ占有ヒストグラム、パスレベルの遅延メトリクスを含む組み込みの高度なモニタリング。すべて UFM または REST API 経由でエクスポート可能。

これらの機能により、MQM9790-NS2F InfiniBand スイッチ ソリューション内部ベンチマークと顧客の導入によって検証されたように、大規模な決定論的なパフォーマンスを実現します。のMQM9790-NS2Fの仕様また、パッシブ銅線 DAC とアクティブ光モジュールの両方のサポートも含まれており、最大 100 m (400G SR4 光モジュールを使用) 以降の距離まで柔軟に対応できます。

4. 導入とスケーリングの推奨事項 (一般的なトポロジ)

グリーンフィールド展開の場合は、次の段階的なアプローチをお勧めします。

  • フェーズ 1 – パイロット:2 つのリーフ スイッチを展開します (それぞれMQM9790-NS2F) と 2 つのスパイン スイッチ、128 個の GPU を接続します。に対するパフォーマンスを検証します。MQM9790-NS2F データシートパラメータ。
  • フェーズ 2 – スケールアウト:ラックごとに 2 つずつリーフ スイッチを追加し、オーバーサブスクリプション ≤ 1:1 を維持するために必要に応じてスパイン スイッチを追加します。 64 ポート密度により、1 つのスイッチで 64 GPU ノードのフルラックをホストできます (各ノードに 1 つの 400G アップリンクがある場合)。
  • フェーズ 3 – マルチプレーン:2,000 ノードを超えるクラスターの場合は、スイッチの仮想レーンとパーティション キーのサポートを活用して、ルートベースの負荷分散を備えた複数の独立したファブリック (2x または 4x プレーンなど) を実装します。

一般的なケーブル接続では、ラック内接続 (3 m 以下) には OSFP-to-OSFP DAC が使用され、スパイン-リーフ距離が最大 100 m の場合は OSFP-to-400G SR4 光モジュールが使用されます。のMQM9790-NS2F互換トランシーバーは NVIDIA の光学ベンダー エコシステムで検証されており、シームレスな相互運用性が保証されています。

5. 運用、監視、障害診断および最適化

実稼働環境での遅延を低く維持するには、効果的な運用が重要です。このソリューションは次のものと統合されますNVIDIA UFM (ユニファイド ファブリック マネージャー)、以下を提供します。

  • リアルタイムダッシュボード– ポートごとの帯域幅、エラー カウンタ、および輻輳ヒートマップ。
  • 自動パスの再最適化– リンクの劣化または障害が発生すると、UFM はオペレータの介入なしにルートを再計算し、適応ルーティング テーブルを再構成します。
  • 過去のテレメトリー– 事後分析と容量計画のためにレイテンシーとフローのデータを保存します。

推奨されるトラブルシューティングのワークフロー:

  1. ポートごとの一時停止フレームと廃棄を監視します。廃棄ゼロが期待されます。破棄された場合は、構成ミスまたは光学系の障害を示します。
  2. UFM の集合統計を介して SHARPv3 操作を検証します。削減操作がオフロードされていることを確認します。
  3. 組み込みの診断ツールを使用します (例:ibdiagnetibstatus) リンクの完全性と信号の完全性をチェックします。

最適化するには、ワークロード パターンに基づいて適応ルーティング アルゴリズムのしきい値 (負荷検知間隔など) を調整します。MQM9790-NS2F インフィニバンド スイッチ管理インターフェイス経由で微調整が可能です。定期的なファームウェア アップデート (NVIDIA のサポート ポータルから入手可能) には、パフォーマンスの強化とセキュリティ パッチが含まれます。

6. 概要と価値の評価

メラノックス (NVIDIA メラノックス) MQM9790-NS2Fは、RDMA/HPC/AI クラスターのための将来性のある高性能基盤を提供します。 400 Gb/秒の NDR 速度、64 ポート密度、インテリジェントなネットワーク内コンピューティングを組み合わせることで、従来のボトルネックを排除し、エクサスケール クラスまでの線形拡張性を提供します。このソリューションは、ポートあたりの電力の削減 (約 1.5 W)、ケーブル配線の簡素化、SHARP オフロードによる CPU オーバーヘッドの削減により、総所有コストを削減します。

を評価する組織にとって、MQM9790-NS2F 価格、RoCEv2 ファブリックと比較して、GPU 使用率が目に見えて向上し (本番環境では 90% を超えることがよくあります)、ジョブ完了時間が最大 40% 短縮されるため、この投資は正当化されます。のMQM9790-NS2F データシートそしてMQM9790-NS2Fの仕様包括的な詳細が提供され、ユニットはすぐに入手できます (MQM9790-NS2F 販売用認可されたチャネル経由)。さらに、このスイッチは既存の NVIDIA アダプターと互換性があるため、すでに Mellanox エコシステムに投資しているユーザーはスムーズな移行パスを確保できます。

要約すると、この技術的ソリューションは、MQM9790-NS2F インフィニバンド スイッチは、次世代 AI スーパーコンピューティングの基礎となる、最も要求の厳しい低遅延の相互接続要件を満たす、堅牢で運用効率の高いファブリックを提供します。