NVIDIA Mellanox 920-9B110-00FH-0D0 技術参照: RDMA/HPC/AI用の最適化された低遅延インターコネクト

August 25, 2026

NVIDIA Mellanox 920-9B110-00FH-0D0 技術参照: RDMA/HPC/AI用の最適化された低遅延インターコネクト

NVIDIA Mellanox 920-9B110-00FH-0D0 技術参照: 200Gb/s HDRでRDMA/HPC/AIクラスターのための最適化された低遅延インターコネクト

1プロジェクト背景と要件分析

HPCとAIのクラスタが拡大し続けるにつれて,分散型トレーニングと科学シミュレーションのワークロードは,ますます厳格なネットワーク帯域幅,レイテンシー,スケーラビリティを必要としています. not every cluster requires 400Gb/s NDR infrastructure—a significant number of production environments are already standardized on 200Gb/s HDR and seek performance improvements within a controlled budget典型的な要求事項は以下のとおりである.

  • 決定的な低遅延:MPIの集団通信は,ポートからポートまでの遅延が微秒未満で,尾の遅延が訓練の収束に影響を及ぼすのを防ぐ必要があります.
  • 損失のない織物:RDMAの効率を確保し,パフォーマンス崩壊を回避するために,ゼロパケットが混雑下で落ちます.
  • ネットワーク内計算の負荷:All-Reduceなどの集合操作をネットワーク構造にオフロードし,ホストのCPU/GPUリソースを解放する.
  • 柔軟な拡張性:数百から数千のノードへのブロックしない拡張をサポートし,既存のHDRケーブルと光接受信機との互換性があります.

この解決策は,これらの要求に応えるために,NVIDIA メラノックス 920-9B110-00FH-0D0中小規模から大規模展開の性能,密度,コスト効率をバランスする 200Gb/s HDR InfiniBand スイッチの核心構成要素として

2ネットワークアーキテクチャの設計

提案されたソリューションは,スケーラブルでブロックしない組織を予測可能な遅延と簡素化されたケーブルで提供する2層葉の脊柱トポロジーを採用しています.各計算ラックには1つの920-9B110-00FH-0D0 インフィニバンドスイッチ OPN(オーダーパーツ番号) は,OSFPからOSFPの直接接続銅 (DAC) またはアクティブ光学ケーブル (AOC) を介してGPUサーバーへの200Gb/sのHDR接続の40ポートを提供しています.MQM8790-HS2Fスイッチの第2層は920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDR葉のスイッチを相互接続し,全帯域幅の脂肪木の組織を作り出します

1500ノードを超えるより大きなクラスタでは,3階層の折りたたみ式閉鎖アーキテクチャを実装できます.920-9B110-00FH-0D0は,すべてのレベルで一貫したパフォーマンスを維持するために,葉と脊柱の両方で機能しています次の表は,このスイッチの周りに構築された2層HDRファブリックの主要なスケーリングパラメータを要約しています.

構成要素 仕様 価値
葉のスイッチ 920-9B110-00FH-0D0 1 スタック
脊椎のスイッチ 920-9B110-00FH-0D0 N/2 (N = 葉のスイッチの数)
最小評価値 GPU サーバー 1,600まで (40ポート根)
バイセクション帯域幅 完全にブロックしない 8.0 Tb/s 脊髄層あたり

3. NVIDIA Mellanox 920-9B110-00FH-0D0の役割と主要な特徴

この建築の内部では,NVIDIA メラノックス 920-9B110-00FH-0D0基本的な切り替え要素として機能し,いくつかの重要な機能を提供します.

  • 200Gb/s HDR の 40 ポート:各OSFPポートは,信頼性の高い拡張接続のために,前方エラー訂正 (FEC) を備えた二方向200Gb/sをサポートする.
  • 統合された SHARPv2 (スケーラブル・ヒエラルキカル・アグリゲーション・アンド・リドクション・プロトコル):集団通信操作をオフロードし,典型的なHPCワークロードでMPI All-Reduceの遅延を最大30%削減します.
  • アダプティブルーティングと混雑制御:熱点を避けるために動的に交通をリルーティングし,敵対的な交通パターンの下で予測可能なパフォーマンスを保証します.
  • 先進的なテレメトリバッファーの占有率モニタリングとともに 流量単位とポート単位のカウンタは 繊維の健康状態を深く把握できます

報告書によると,920-9B110-00FH-0D0 データシートスイッチは200ns未満の切断遅延を提供し,合計スイッチ容量は8.0Tb/sまでサポートします.920-9B110-00FH-0D0 仕様また,二重冗余の電源と熱交換可能なファンモジュールも強調し,ミッション・クリティックワークロードの99.999%の可用性を保証します.

4展開と拡張性に関する勧告

採用を計画している組織は,920-9B110-00FH-0D0 インフィニバンドスイッチ OPN ソリューション,以下の配備ガイドラインが推奨されています:

  • キャベリング戦略:OSFPからOSFPDACケーブルをラック内接続 (3mまで) とAOCまたは光受信機をラック間および脊葉リンク (100mまで) に使用します.すべてのケーブルが920-9B110-00FH-0D0対応するNVIDIA互換性マトリックスで
  • 冗長性2つの電源を分離したPDUに接続し,単一の障害点を排除するために,少なくとも2つのスイッチを1枚の葉に使用します.
  • ファイアウェア管理:すべてのスイッチが NVIDIA 固件バージョンと同じであることを確認します. UFM の自動固件アップグレード機能を使用して,ダウンタイムなしで更新します.
  • スケーラビリティパス:1,600ノード以上のクラスターでは,3階層の折りたたみ閉じるトポロジーに移行するか,適応型ルーティングのレバレッジ・ドラゴンフライ+を使用します.920-9B110-00FH-0D0は,単一のサブネットマネージャの下で単一のファブリックで最大64スイッチをサポートします.

総所有コストを計算する際には,スイッチレベルと簡素化されたケーブルを低半径の代替品と比較して減少した数に考慮してください.920-9B110-00FH-0D0価格単位のコストはEDR (100Gb/s) スイッチより高く,ポート毎のコストはNDRより大幅に低くなっており,コストに配慮したHDR展開に最適な選択肢となっています.

5運用,監視,トラブルシューティング

HDRファブリックの効果的な管理には,包括的な監視とトラブルシューティングフレームワークが必要です. NVIDIAのユニファイデッドファブリックマネージャー (UFM) は,すべてのフラッシュファイブリックに単一のガラスパネルを提供します.NVIDIA メラノックス 920-9B110-00FH-0D0繊維を原料とする:

  • トポロジー視覚化:すべてのスイッチ,リンク,エンドポイントの自動発見とグラフィック表現
  • パフォーマンスダッシュボード:ポート利用率,誤差率,混雑指標のリアルタイムビュー
  • 予備警報:リンク崩壊,温度異常,電源故障に対する 限界値によるアラーム
  • 断片隔離:欠陥のあるケーブル,トランシーバー,またはスイッチポートを識別するガイドされたトラブルシューティングワークフロー.

先進的なトラブルシューティングのために,ループバックテストとBER (ビットエラーレート) 分析を含むスイッチの内蔵診断ツールを利用します.生産作業負荷を展開する前にリンクの整合性を検証する初期展開で遭遇する一般的な問題は,リンクの速度が等しくなく,ケーブルタイプが一致しないため,最適でないルーティングを含む.アダプティブルーティングを有効にし,すべてのリンクが200Gb/sで動作していることを確認すると (FECが有効) ほとんどのパフォーマンス異常が解決します.920-9B110-00FH-0D0 インフィニバンドスイッチ OPNまた,冗長なサブネットワーク管理者構成もサポートし,管理ノードが故障した場合に手動的な介入なしにファブリック再構成が実行されることを保証します.

6概要 価値評価

について920-9B110-00FH-0D0HDRベースのHPCおよびAIクラスターを構築または拡大する組織のための説得力のある価値提案を提供します. 200ns未満の遅延で200Gb/s HDRの40ポート,SHARPv2オフロード,費用対効果の高い1Uプラットフォームで主要な価値ポイントは以下の通りです.

  • 性能:SHARPv2のオフロードと適応型ルーティングにより,通信密度の高いワークロードの作業完了時間が最大35%短縮されます.
  • 費用効率:NDR 代替品と比較して TCO が低く,HDR 規模での展開に最適化されたポート毎のコストがあります.
  • 操作のシンプルさ統合管理,積極的なモニタリング,自動化障害切り替えのために UFM と深い統合.
  • 投資保護既存のHDRケーブル,光学,ソフトウェアスタックとの完全な互換性により,生産を中断することなく段階的なアップグレードが可能になります.

評価する組織は920-9B110-00FH-0D0 販売中NVIDIAのチャネルパートナーを通じて,詳細なレビューを推奨します920-9B110-00FH-0D0 データシート特定の作業負荷とスケール要件に設計を検証するために.NVIDIA メラノックス 920-9B110-00FH-0D0HPCとAIの次世代イノベーションのためのバランスのとれた高性能の相互接続基盤を提供します.