NVIDIA Mellanox MQM8790-HS2F InfiniBand スイッチ テクニカルホワイトペーパー
August 21, 2026
NVIDIA Mellanox MQM8790-HS2F InfiniBandスイッチ技術ホワイトペーパー:RDMA/HPC/AIクラスター向け低遅延インターコネクトの最適化
この技術ホワイトペーパーは、ネットワークアーキテクト、プリセールスエンジニア、およびオペレーションマネージャーを対象としています。これは、NVIDIA Mellanox MQM8790-HS2F 200Gb/s HDR InfiniBandスイッチを中心に、RDMAアクセラレーテッド、ハイパフォーマンスコンピューティング(HPC)、および人工知能(AI)クラスターにおける低遅延インターコネクト最適化のための包括的なソリューション設計を提供します。本ドキュメントは、アーキテクチャ設計、主要技術、展開およびスケーリング戦略、運用監視、および価値評価を網羅しており、次世代のデータ集約型コンピューティングインフラストラクチャのための再現可能なブループリントを提供します。
1. プロジェクト背景と要件分析
AIモデルのパラメータが兆単位に達し、HPCシミュレーションがますます高解像度を要求するにつれて、基盤となるネットワークファブリックは、サポートコンポーネントから主要なパフォーマンス決定要因へと進化しました。例えば、分散トレーニングジョブは、インターコネクトが十分な帯域幅と遅延特性を備えていない場合、実行時間の40〜60%をコレクティブ通信操作に費やす可能性があります。エンタープライズITチームにとって、これはAIイニシアチブの市場投入までの時間の延長とGPU投資の未活用につながります。
広範な顧客エンゲージメントを通じて特定された主要な要件は以下の通りです。
- 超低遅延かつ予測可能な遅延: MPIおよびRDMAトラフィック向けの200ns未満のカットスルー・スイッチング、競合下でのジッターを最小限に抑えます。
- ノンブロッキングスループット: すべてのポートで同時にラインレートパフォーマンスを維持し、ホットスポットの形成とテール遅延の低下を排除します。
- インネットワークコンピューティング: コレクティブ操作(all-reduce、broadcast、barrier)のハードウェアアクセラレーションにより、ホストCPUの負荷を軽減し、データ移動を削減します。
- スケーラブルなトポロジサポート: 数百から数千ノードに及ぶファットツリー、トーラス、またはドラゴンフライ+トポロジを、過剰なスイッチレイヤーなしで構築する能力。
- シンプルな管理: 統合されたファブリック監視、自動化されたトポロジ検出、およびプロアクティブな障害検出により、運用オーバーヘッドを削減します。
MQM8790-HS2Fが選択され、その予備的なMQM8790-HS2Fデータシートは、40ポートの200Gb/s HDR、130ns未満のカットスルー遅延、およびSHARP v3.0インネットワークコンピューティングのサポートを確認しており、これらは上記の要件に直接対応する機能です。
2. 全体ネットワーク/システムアーキテクチャ設計
提案されたアーキテクチャは、最大1200ノードのクラスターに対して2層のリーフ-スパインファットツリートポロジを採用しており、より大規模な展開の場合は3層に拡張するオプションがあります。このトポロジは、パフォーマンス、コスト、および管理性をバランスさせ、ファブリック全体で完全なバイセクション帯域幅と決定論的な遅延を提供します。
| ティア | デバイスタイプ | ポート数(使用済み) | 接続ロール |
|---|---|---|---|
| リーフ | MQM8790-HS2F | 200Gb/s x 32(ノードへ16、スパインへ16) | コンピューティングノードトラフィックを集約 |
| スパイン | MQM8790-HS2F | 200Gb/s x 40(すべてリーフスイッチへ) | リーフ間のノンブロッキングクロス接続 |
各リーフスイッチは、NVIDIA ConnectX-6またはConnectX-7 HDRホストチャネルアダプターを介して最大16個のコンピューティングノードに接続され、MQM8790-HS2F互換のオプティクスエコシステムを使用します。これには、リンク距離に応じてアクティブ光ケーブル(AOC)とパッシブ銅DACの両方が含まれます。MQM8790-HS2F 200Gb/s HDR 40ポートQSFP56デザインは、ラックレベルの集約に十分な密度を提供しながら、効率的なラック空間利用のために1Uフォームファクターを維持します。
1200ノードを超えるクラスターの場合、追加のスーパー・スパイン・レイヤーを備えた3層トポロジが推奨されます。この構成では、MQM8790-HS2F InfiniBandスイッチソリューションはすべてのレイヤーでその役割を維持し、スペアパーツと構成管理を簡素化します。エッジからコアまで、単一のスイッチタイプがファブリック全体をサポートします。
3. NVIDIA Mellanox MQM8790-HS2Fの役割と主要機能
NVIDIA Mellanox MQM8790-HS2Fが機能し、低遅延インターコネクト最適化を直接推進する以下の差別化された機能を提供します。
- HDR 200Gb/sポート速度: 以前の世代のEDR(100Gb/s)の帯域幅を2倍にし、HDR100(100Gb/s)との下位互換性を維持して混合速度環境に対応し、以前の投資を保護します。
- 130ns未満のカットスルー・スイッチング遅延: スイッチ内のパケット滞留時間を最小限に抑え、遅延に敏感なRDMA操作およびコレクティブ通信パターンに不可欠です。
- SHARP v3.0インネットワークコンピューティング: ホストCPUからスイッチファブリックへの削減操作をオフロードし、データトラフィックを最大30%削減し、AIトレーニングのall-reduceパフォーマンスを最大2倍に加速します。
- 適応ルーティングと輻輳制御: 複数のパスにトラフィックを動的に分散してホットスポットを回避し、輻輳フラグとクレジットベースのフロー制御によりロスレス動作を保証します。これはRDMAパフォーマンスの前提条件です。
- 統合テレメトリと診断: ポートごとのバッファ占有率、リンクエラー率、およびトラフィックパターンの詳細な可視性を提供し、プロアクティブな最適化と迅速な障害分離を可能にします。
詳細なMQM8790-HS2F仕様によると、このスイッチはフォワードおよびリバースエアフローの両方のバリアントをサポートしており、多様なデータセンター冷却設計に対応します。デュアル冗長電源とホットスワップ可能なファンモジュールは、信頼性と保守性をさらに向上させます。
4. 展開と拡張の推奨事項(典型的なトポロジを含む)
バランスの取れたコスト効率の高い初期展開のために、以下のベストプラクティスを推奨します。
- ノードからリーフへの接続: MQM8790-HS2F互換QSFP56コネクタを使用して、200Gb/s HDRケーブル(3m以下の場合は銅DAC、30m以下の場合はAOC)を使用します。ホストチャネルアダプターがスイッチポートと同じリンク速度とFEC設定で構成されていることを確認してください。
- リーフからスパインへの接続: 100mまでの距離には、200Gb/s AOCまたはマルチモードファイバーオプティックトランシーバーを展開します。MQM8790-HS2Fはリンクパラメータを自動ネゴシエートし、展開を簡素化します。
- オーバーサブスクリプション計画: 一般的なAI/HPCワークロードの場合、2:1のオーバーサブスクリプション比率(200Gb/sアップリンクあたり2つのコンピューティングノード)は、コストパフォーマンスのスイートスポットを提供します。遅延最適化またはストレージ集約型のワークロードの場合は、1:1(フル)オーバーサブスクリプションを検討してください。
- 拡張パス: 新しいラックを追加する場合は、追加のリーフスイッチを展開し、既存のスパインスイッチに接続します。大幅な容量増加(ノード数を倍増)の場合は、スパインレイヤーをより高位のラディックスにアップグレードするか、スーパー・スパイン・ティアを追加します。
評価する際にMQM8790-HS2F価格と総所有コストを考慮すると、すべてのファブリックティアで同じスイッチタイプを使用する統合アーキテクチャにより、マルチSKUアプローチと比較してスペアパーツ在庫要件が約70%削減されることに留意してください。この簡素化により、インシデント対応が迅速化され、ハードウェア障害時のダウンタイムが最小限に抑えられます。
5. 運用監視、トラブルシューティング、および最適化
MQM8790-HS2F InfiniBandスイッチ環境の効果的な管理には、監視、診断、およびパフォーマンスチューニングに対する体系的なアプローチが必要です。
監視のベストプラクティス:
- NVIDIAのUnified Fabric Manager(UFM)を展開して、トポロジマップ、リンクごとの利用率ヒートマップ、およびリアルタイム遅延ヒストグラムを含む、統合されたファブリック可視性を実現します。
- ポートごとのエラーカウンター(特にCRCエラー、シンボルエラー、リンクダウンイベント)を監視して、光学部品やケーブルの劣化を早期に特定します。プロアクティブなメンテナンスを可能にするために、定義済みのしきい値に対してSNMPトラップを設定します。
- スイッチの統合パフォーマンスカウンターを介してSHARPコレクティブ操作の効率を追跡し、アプリケーションレベルでコレクティブ通信パターンの最適化機会を特定します。
一般的な問題のトラブルシューティング:
- 特定のポートでのリンクCRCエラー:ケーブルの接続と光コネクタの清掃を確認します。エラーが続く場合は、ケーブルまたはトランシーバーを交換します。MQM8790-HS2Fデータシートは、ポートごとの詳細な診断しきい値を提供します。
- 予期しない遅延スパイク:UFMのトラフィックフロー分析を使用して輻輳ホットスポットを確認します。適応ルーティングは、特定のトラフィックパターンに対して再構成が必要になる場合があります。異なるルーティングアルゴリズム(最小または非最小)を試してください。
- ファブリックパーティションの問題:適切なパーティションキー(PKey)およびIPoIBサブネットマネージャーの構成を確認します。スイッチの組み込みサブネットマネージャーは自動化されたファブリック検出を提供しますが、マルチテナント環境では手動調整が必要になる場合があります。
パフォーマンス最適化のヒント:
- AIトレーニングワークロードの場合、SHARP v3.0を有効にし、コレクティブ通信ライブラリ(NCCL、OpenMPI)を構成して、スイッチのオフロード機能を使用します。これにより、大規模なメッセージサイズの場合、all-reduce遅延を最大2倍に削減できます。
- 遅延に敏感なHPCアプリケーションの場合、適応ルーティングを無効にして決定論的なパス選択を強制することを検討してください。これにより、パスの多様性をある程度犠牲にして予測可能な遅延が得られます。
- スイッチファームウェアを定期的にレビューおよび更新してください。NVIDIAはパフォーマンス強化およびセキュリティパッチを定期的にリリースしています。バージョン互換性マトリックスについては、MQM8790-HS2Fデータシートを参照してください。
6. まとめと価値評価
NVIDIA Mellanox MQM8790-HS2Fは、RDMA/HPC/AIクラスターを構築またはアップグレードする組織にとって、魅力的な価値提案を提供します。1U、40ポートシャーシ内で、ポートあたり200Gb/s、130ns未満の遅延、およびインネットワークコンピューティングアクセラレーションを提供することにより、このスイッチは最新のデータ集約型ワークロードの最も厳しいインターコネクト要件に対応します。
主要な価値ドライバーは以下の通りです。
- パフォーマンススケーラビリティ: MQM8790-HS2F 200Gb/s HDR 40ポートQSFP56ノードを中心に構築されたノンブロッキングファットツリーアーキテクチャは、基本的なトポロジ変更なしで200ノードから10,000ノード以上にスケールします。
- 運用効率: すべてのファブリックティアで単一のスイッチタイプを使用することで、スペアパーツ在庫が削減され、トレーニングが簡素化され、トラブルシューティングが迅速化されます。
- 投資保護: HDR100およびEDRとの下位互換性により段階的なアップグレードが可能になり、スイッチのフォームファクターとポート密度は将来の400G(NDR)ロードマップに適合します。
- 実績のあるエコシステム: NVIDIAのConnectXアダプター、BlueField DPU、およびUFM管理プラットフォームとの深い統合により、エンドツーエンドのパフォーマンス予測可能性が保証されます。
展開の準備ができている組織の場合、MQM8790-HS2F販売は、NVIDIAの世界的な正規販売代理店ネットワークを通じて、オンサイトスペア、高度な交換、およびファームウェアアップデートサブスクリプションを含む包括的なサポートオプションを提供します。詳細なMQM8790-HS2F仕様およびリファレンスデザインは、NVIDIAの技術ドキュメントポータルから入手でき、大規模な既存または新規展開向けのカスタマイズされたトポロジコンサルティングも提供されます。

