NVIDIA Mellanox 920-9B210-00FN-0D0 技術リファレンス: 400Gb/s NDR 低遅延インターコネクト最適化

August 26, 2026

NVIDIA Mellanox 920-9B210-00FN-0D0 技術リファレンス: 400Gb/s NDR 低遅延インターコネクト最適化

NVIDIA Mellanox 920-9B210-00FN-0D0 技術参照: 400Gb/s NDR RDMA/HPC/AIクラスターのための低遅延インターコネクト最適化

1プロジェクト背景と要件分析

AIトレーニングクラスタが 4,000 GPU を超えてスケールし,HPC シミュレーションがエクサスケールパフォーマンスに近づくにつれて,ネットワークファブリックは,帯域幅,レイテンシー,デターニズムに対する前例のない要求に直面します.200Gb/s HDRから400Gb/s NDRへの移行は,兆兆パラメータモデルやキロメートルのスケールでの天気シミュレーションをターゲットとする組織にとってもはやオプションではなく,戦略的必須事項です.主要な研究および企業展開で特定された主要な要件には,以下が含まれます.

  • 極低デターミニズム遅延:ポート対ポートの遅延は 100ns以下で MPIと通信コストを最小限に抑える
  • 損失のない織物:何千ものエンドポイントの混雑下でゼロパケットが落ちるので RDMAのパフォーマンスは予測可能になります
  • ネットワーク内計算の負荷:集合操作 (all-reduce, all-to-all, broadcast) をネットワーク構造にオフロードして GPU の利用を最大化します
  • 高基数拡張性:大規模なファットツリーとドラゴンフライ+トポロジーをサポートし,最大8000+ノードまでのフルバイセクション帯域幅.
  • 投資保護段階的なアップグレードを可能にする既存のHDRケーブル,光学,管理ツールとのシームレスな互換性.

この解決策は,これらの要求に応えるために,NVIDIA メラノックス 920-9B210-00FN-0D0エクサスケールクラスの展開に必要な密度,パフォーマンス,インテリジェンスを提供する400Gb/s NDR インフィニバンドスイッチを核心構成要素として

2ネットワークアーキテクチャの設計

提案された解決策は,スケーラブルでブロックしない組織を決定的遅延と簡素化されたケーブルで提供する2階層の葉の脊柱トポロジーを採用しています.各計算ラックには1つまたは2つ装備されています920-9B210-00FN-0D0 インフィニバンドスイッチ OPNOSFPからOSFP直結銅 (DAC) またはアクティブ光学ケーブル (AOC) を通してGPUサーバーへのNDR接続性400Gb/sの64ポートを提供する.920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRすべての葉のスイッチを相互接続し 完全な帯域幅の脂肪木の組織を作り出します

5,000ノードを超えるクラスターでは,3階層の折りたたみ式閉鎖アーキテクチャを実装できます.920-9B210-00FN-0D0は,すべてのレベルで一貫したパフォーマンスを維持するために,葉と脊柱の両方で機能します.このスイッチは,単一のサブネットマネージャーの下で単一のファブリックで最大64のスイッチをサポートし,大規模なトポロジーの統一制御が可能になります.

次の表は,NDR920-9B210-00FN-0D0の周りに構築された2層NDR布の主要なスケーリングパラメータを要約しています.

構成要素 仕様 価値
葉のスイッチ 920-9B210-00FN-0D0 棚1台あたり1円2セント
脊椎のスイッチ 920-9B210-00FN-0D0 N/2 (N = 葉のスイッチの数)
最小評価値 GPU サーバー 4,096まで (64ポート根)
バイセクション帯域幅 完全にブロックしない 51.2 Tb/s 脊髄層あたり

3. NVIDIA Mellanox 920-9B210-00FN-0D0の役割と主要な特徴

この建築の内部では,NVIDIA メラノックス 920-9B210-00FN-0D0基本の切り替え要素として機能し,第1節に規定する要件を直接に対応するいくつかの重要な機能を提供します.

  • 400Gb/s NDR の 64 ポート:各OSFPポートは,信頼性の高い拡張接続のために,前方エラー訂正 (FEC) と両方向 400Gb/s をサポートする.2 Tb/s は,最も通信密度の高いワークロードにさえも十分なスペースを提供します.
  • 超低切断遅延:ポートからポートへの遅延は100ns未満です920-9B210-00FN-0D0 データシートMPIとRDMAの運用に最小限のオーバーヘッドを保証します.
  • 統合された SHARPv3 (スケーラブル・ヒエラルキカル・アグリゲーション・アンド・リドクション・プロトコル):主機CPUから集合操作をオフロードし,全低レイテンシーを最大40%削減し,大規模作業では全低レイテンシーを最大35%削減します.
  • アダプティブルーティングと混雑制御:熱点を避けるために動的に交通をリルーティングし,敵対的な交通パターンの下で予測可能なパフォーマンスを保証します.先進的なテレメトリーは,積極的な管理のために,各流量および各港の可視性を提供します..
  • 総合的な管理性NVIDIAのUnified Fabric Manager (UFM) と完全に統合され,ゼロタッチプロビジョニング,健康モニタリング,自動化障害切り替えが可能です.

について920-9B210-00FN-0D0 仕様また,二重冗長電源,ホットスワップ可能なファンモジュール,冗長サブネットワーク管理者構成のサポートを強調し,ミッションクリティカルワークロードの99.999%の可用性を保証します.

4展開と拡張性に関する勧告

採用を計画している組織は,920-9B210-00FN-0D0 インフィニバンドスイッチ OPN ソリューション,以下の配備ガイドラインが推奨されています:

  • キャベリング戦略:OSFPからOSFPDACケーブルをラック内接続 (3mまで) とAOCまたは光受信機をラック間および脊葉リンク (100mまで) に使用します.すべてのケーブルが920-9B210-00FN-0D0対応するNVIDIA互換性マトリックスで信号の完整性問題を回避します
  • 冗長性異なるPDUに接続された二重電源を展開します. 単一の障害点を排除するために,少なくとも2つのスイッチを1枚の葉に使用します.脊椎層の N+1 の冗長性を考慮する.
  • ファイアウェア管理:すべてのスイッチが NVIDIA 固件バージョンと同じであることを確認します. UFM の自動固件アップグレード機能を使用して,ダウンタイムなしで更新します.導入前にホストアダプターとケーブルとのファームウェア互換性を検証する.
  • スケーラビリティパス:4,096ノードを超えるクラスターでは, 3 階の折り畳み式閉じるトポロジーまたは適応型ルーティングのレバレッジ・ドラゴンフライ+ に移行します. 920-9B210-00FN-0D0は,単一のファブリックで最大 64 スイッチをサポートします.複数の繊維がゲートウェイで相互接続され,より大きな展開が可能.
  • 性能検証:製造開始前には,OpenFabrics Enterprise Distribution (OFED) のパフォーマンスベンチマークのようなツールを使用して,繊維の性能を920-9B210-00FN-0D0 データシート仕様について

総所有コストを計算する際には,スイッチレベルと簡素化されたケーブルを低半径の代替品と比較して減少した数に考慮してください.920-9B210-00FN-0D0価格HDRスイッチよりも高額で,ポート1台あたりのコストとGPU1台あたりのネットワークコストは大規模展開では大幅に低くなっており,エクサスケールプロジェクトにとってコスト効率の良い選択肢となっています.

5運用,監視,トラブルシューティング

NDRファブリックの効果的な管理には,包括的な監視とトラブルシューティングフレームワークが必要です.NVIDIA メラノックス 920-9B210-00FN-0D0繊維を原料とする:

  • トポロジー視覚化:すべてのスイッチ,リンク,エンドポイントの自動発見とグラフィック表示,リアルタイム状態更新.
  • パフォーマンスダッシュボード:ポート利用率,誤差率,混雑指標,バッファーの利用率をリアルタイムで表示します.
  • 予備警報:リンク崩壊,温度異常,電源故障,ケーブル磨きに対する 限界値に基づくアラーム
  • 断片隔離:欠陥のあるケーブル,トランシーバー,またはスイッチポートを識別するガイドされたトラブルシューティングワークフロー,解消までの平均時間 (MTTR) を短縮する.
  • 歴史分析:過去のパフォーマンスデータに基づく動向分析と能力計画により,積極的にスケーリング決定が可能になります.

先進的なトラブルシューティングのために,ループバックテスト,BER (ビットエラーレート) 解析,光学モジュール診断モニタリング (DOM) を含むスイッチの内蔵診断ツールを活用します.初期NDR展開で遭遇した一般的な問題は,不平等なリンク速度によって引き起こされる不適正なルーティングを含む.適応型ルーティングを有効にし,FECが有効ですべてのリンクが400Gb/sで動作していることを確認します.そしてすべてのスイッチに一貫したファームウェアを確保することで ほとんどのパフォーマンス異常を解決します.

ネットワークエンジニアは,920-9B210-00FN-0D0 仕様この基準線からの偏差は,潜在的な問題の初期指標として使用できます.920-9B210-00FN-0D0 インフィニバンドスイッチ OPNまた,syslogとSNMP経由で包括的なイベントログをサポートし,既存のデータセンター監視スタックとの統合を可能にします.

6概要 価値評価

について920-9B210-00FN-0D0NDRベースの HPC と AI クラスタを構築したり拡張したりする組織にとって説得力のある価値提案を提供します.企業レベルの管理性1U プラットフォームのコンパクトで,既存の HDR エコシステムと完全に互換性があります.

  • 性能:SHARPv3のオフロードとNDR帯域幅によって,全対全通信の遅延を最大75%削減し,全減少遅延を最大40%削減します.
  • 費用効率:大規模な展開におけるHDR代替品と比較してGPU1台あたりネットワークコストが低くなっている.これは,より高いradixとスイッチ層数減少によって引き起こされる.
  • 操作のシンプルさ統一管理,自動プロビジョニング,積極的なモニタリング,迅速な故障解決のためのUFMと深い統合
  • 投資保護既存のHDRケーブル,光学,ソフトウェアスタックとの完全な互換性により,生産作業を中断することなく段階的なアップグレードが可能になります.
  • 将来のスケーラビリティ:3階層の折りたたみ-Closと龍蝶+トポロジーをサポートし,コンピューティング要求が増加するにつれてファブリックが8,000+ノードまでスケーリングできるようにします.

評価する組織は920-9B210-00FN-0D0 販売中NVIDIAのチャネルパートナーを通じて,詳細なレビューを推奨します920-9B210-00FN-0D0 データシート特定の作業負荷とスケール要件に設計を検証するために.NVIDIA メラノックス 920-9B210-00FN-0D0AIとHPCの次世代イノベーションのための 高性能でスケーラブルな相互接続基盤を提供しています