NVIDIA Mellanox MQM9790-NS2F 技術リファレンス:RDMA/HPC/AIクラスター向けの低遅延インターコネクト最適化
August 24, 2026
NVIDIA Mellanox MQM9790-NS2F 技術リファレンス:RDMA/HPC/AIクラスター向けの低遅延インターコネクト最適化
1. プロジェクト背景と要件分析
最新のAIトレーニングおよびHPCシミュレーションワークロードは、基盤となるネットワークファブリックに極端な負荷をかける、激しい全二重通信パターンを特徴としています。GPUクラスターが1,000ノードを超えてスケールアップすると、ソフトウェアベースの輻輳制御に依存する従来のイーサネットアプローチは不十分であることが証明されています。これらの環境から生じる主な要件は以下の通りです。
- 決定論的な超低遅延: MPIジョブ完了時間を最小限に抑えるためのサブマイクロ秒ポート間遅延。
- ロスレスファブリック:輻輳時のパケットドロップゼロにより、TCPインキャストとパフォーマンスの低下を防ぎます。
- インネットワークコンピューティングオフロード: コレクティブ操作(例:all-reduce、broadcast)のホストCPUオーバーヘッドの削減。
- スケーラブルなトポロジー: 数千のエンドポイントまでの完全なバイセクション帯域幅を持つファットツリーおよびドラゴンフライ+トポロジーのサポート。
提案するソリューションは、スケーラビリティ、オーバーサブスクリプション制御、およびケーブリングの簡素化のバランスを提供する2層のリーフ・スパイン・トポロジーを採用しています。リーフ層では、各コンピューティングラックに1つまたは2つのMQM9790-NS2F InfiniBandスイッチユニットが配置され、GPUサーバーに64ポートの400Gb/s接続を提供します。スパイン層では、MQM9790-NS2Fスイッチの第2層がすべてのリーフを相互接続し、ノンブロッキングファブリックを構築します。
2,000 GPUノードを超える大規模デプロイメントの場合、3層のフォールド・クロスアーキテクチャを採用でき、MQM9790-NS2F 400Gb/s NDR 64ポートOSFPは、すべてのレベルで一貫したパフォーマンスを維持するために、リーフとスパインの両方として機能します。この設計により、最大3回のスイッチホップで、どのサーバーも他のどのサーバーともラインレートで通信できます。
以下の表は、MQM9790-NS2Fを中心に構築された2層リーフ・スパインファブリックの一般的なスケーリングパラメータをまとめたものです。コンポーネント仕様
値リーフスイッチラックあたりのMQM9790-NS2F
1~2ユニット
| スパインスイッチ | MQM9790-NS2F | N/2(N = リーフスイッチの数) |
|---|---|---|
| 最大エンドポイント | ファブリックあたりのGPUサーバー | 最大4,096 |
| バイセクション帯域幅 | スパイン層あたり51.2 Tb/s | |
| 3. NVIDIA Mellanox MQM9790-NS2F の役割と主な機能 | このアーキテクチャ内では、NVIDIA Mellanox MQM9790-NS2F が基盤となるビルディングブロックとして機能し、いくつかの重要な機能を提供します。 | ポートあたり400Gb/s NDR: |
| 64個のOSFPポートすべてが双方向400Gb/sをサポートし、信頼性の高い長距離接続のために前方誤り訂正(FEC)を備えています。 | 統合SHARPv3(Scalable Hierarchical Aggregation and Reduction Protocol): | ホストCPUからコレクティブ通信操作をオフロードし、大規模ジョブでMPI all-reduce遅延を最大40%削減します。 |
適応ルーティングと輻輳制御:
トラフィックを動的に再ルーティングしてホットスポットを回避し、敵対的なトラフィックパターン下でも予測可能なパフォーマンスを保証します。 フローごとおよびポートごとのカウンターとバッファ占有率監視により、ファブリックの状態を深く可視化します。
- MQM9790-NS2F データシートによると、このスイッチは100ナノ秒未満のカットスルー遅延を提供し、最大51.2 Tb/sの集約スイッチング容量をサポートします。これらの仕様により、新規デプロイメントとHDR(200Gb/s)インフラストラクチャからの段階的なアップグレードの両方に理想的な選択肢となります。4. デプロイメントとスケーラビリティに関する推奨事項
- MQM9790-NS2F InfiniBandスイッチソリューションの導入を計画している組織には、以下のデプロイメントガイドラインを推奨します。ケーブリング戦略:
- ラック内接続(最大3m)にはOSFP-to-OSFPダイレクトアタッチ銅線(DAC)ケーブルを使用し、ラック間およびスパイン・リーフリンク(最大100m)にはアクティブ光ケーブル(AOC)または光トランシーバーを使用します。冗長性:
- デュアル電源とホットスワップ可能なファンモジュールをデプロイします。フォールトトレランスのために、各電源を個別のPDUに接続します。ファームウェアの一貫性:
機能の不一致を避けるために、すべてのスイッチが同じNVIDIAファームウェアバージョンを実行していることを確認します。ローリングアップデートにはUFMの自動ファームウェアアップグレード機能を使用します。 4,000ノードを超えるクラスターの場合は、3層フォールド・クロス・トポロジーまたはドラゴンフライ+を適応ルーティングを有効にして検討してください。MQM9790-NS2F互換エコシステムには、これらのトポロジーをサポートする幅広いオプティクスとケーブルが含まれています。
総所有コストを計算する際には、低ラディクス代替品と比較して、スイッチ層数の削減とケーブリングの簡素化を考慮してください。MQM9790-NS2Fの単価は旧世代スイッチよりも高いですが、大規模デプロイメントではポートあたりのコストとGPUあたりのネットワークコストが大幅に低くなるため、エクサスケールプロジェクトにとって費用対効果の高い選択肢となります。
5. 運用、監視、トラブルシューティングトポロジー可視化:
- すべてのスイッチ、リンク、エンドポイントの自動検出とグラフィカル表示。パフォーマンスダッシュボード:
- ポート使用率、エラー率、輻輳インジケーターのリアルタイムビュー。プロアクティブアラート:
- リンク劣化、温度異常、電源障害に対するしきい値ベースのアラーム。障害分離:
- 障害のあるケーブル、トランシーバー、またはスイッチポートを特定するガイド付きトラブルシューティングワークフロー。高度なトラブルシューティングのために、MQM9790-NS2Fの仕様には、カスタム監視スタックとの統合のためにREST API経由でエクスポートできる詳細なバッファ監視とフローレベル統計が含まれています。ネットワークエンジニアは、本番ワークロードをデプロイする前にリンクの整合性を検証するために、ループバックテストやBER(ビットエラー率)分析などのスイッチに組み込まれた診断ツールも活用する必要があります。初期デプロイメント中に遭遇する一般的な問題には、リンク速度の不均一性やケーブルタイプの不一致による最適でないルーティングが含まれます。適応ルーティングを有効にし、すべてのリンクが400Gb/sで動作していること(FEC有効)を確認することで、パフォーマンス異常の大部分が解決されます。MQM9790-NS2F InfiniBandスイッチソリューションには、サブネットマネージャーの冗長性サポートも含まれており、管理ノードの障害が発生した場合でも、手動介入なしでファブリック再構成が可能になります。6. まとめと価値評価
MQM9790-NS2Fは、400Gb/s NDR帯域幅、64ポート密度、およびインネットワークコンピューティングアクセラレーションを単一の管理可能な1Uプラットフォームで提供する、高性能ネットワーキングにおける大きな進歩を表しています。AIおよびHPCクラスターを設計するアーキテクトおよびエンジニアにとって、このスイッチはエクサスケールパフォーマンスへの実績あるパスを提供し、以下のことを可能にします。最大30%削減 SHARPv3オフロードによる大規模トレーニングワークロードのジョブ完了時間。
TCOの削減
高いラディクスとスイッチ層数の削減による、代替ソリューションとの比較。 UFM統合とプロアクティブな障害管理のための包括的なテレメトリによる。
- 将来性のあるスケーラビリティ 次世代GPUおよびアクセラレーターインターコネクトをサポートするため。
- NVIDIAのパートナーネットワークを通じてMQM9790-NS2Fの販売を評価している組織は、詳細なMQM9790-NS2Fデータシートを確認し、認定ソリューションアーキテクトと協力して、特定のワークロードとスケールの要件に合わせてデプロイメントを調整することを推奨します。NVIDIA Mellanox MQM9790-NS2Fは、今後10年間の科学的発見とAIイノベーションのための高性能インターコネクトバックボーンとして、すぐに利用可能です。

