NVIDIA Mellanox MCX653106A-HDAT 技術ソリューション:RDMA/RoCEベースの低遅延トランスポートとサーバー

June 16, 2026

NVIDIA Mellanox MCX653106A-HDAT 技術ソリューション:RDMA/RoCEベースの低遅延トランスポートとサーバー

ネットワークアーキテクト,プレセールエンジニア,オペレーションマネージャー向けです.NVIDIA メラノックス MCX653106A-HDATサーバーアダプタで,マイクロ秒規模のRDMA/RoCE輸送と超高出力性能を備えたデータセンターネットワークインフラストラクチャの構築方法を概要します.

1背景と要求の分析

分散型ストレージの予測不可能な遅延 AIトレーニングクラスターの帯域幅不足伝統的なネットワークプロトコルスタックによる過剰なCPU消費従来のTCP/IPソリューションは,NVMe-oF,高周波取引,リアルタイム分析のマイクロ秒スケール遅延要求に応えることができません.業界は緊急にMCX653106A-HDAT イーサネット アダプタカードソリューション標準Ethernetインフラストラクチャを介してハードウェアから卸されたRDMAトランスポートを提供し,サーバーのスループットを200Gbpsレベルまで拡大します.

2ネットワーク/システムアーキテクチャの設計

このソリューションは,2層のLeaf-Spine CLOSアーキテクチャを採用しています.すべてのコンピューティングとストレージノードは,NVIDIA メラノックス MCX653106A-HDAT25G/100G ToR スイッチに変更する.主な設計原則は以下の通りである.

  • PFC (優先流量制御) とECN (明示的な混雑通知) によって有効なエンドツーエンド損失のないネットワーク
  • ストレージとHPCワークロードのための専用RDMA輸送ルート
  • 制御平面 (標準TCP/IP) とデータ平面 (RoCEv2) の分離
  • ハードウェアベースの仮想化オフロード (SR-IOV,VXLAN/NVGRE/ジュネーブ)

基準としてMCX653106A-HDATデータシート,アダプタは,ポートからポートへの遅延が600ns未満で,秒あたり最大2億5千万パケットをサポートし,東西ストレージトラフィックと北南アプリケーションフローの両方に理想的です.

3. このソリューションにおけるNVIDIA Mellanox MCX653106A-HDATの役割と主要な特徴

についてMCX653106A-HDAT ConnectX アダプター PCIe ネットワーク カード基礎的なデータ飛行機エンジンとして機能する.その主な役割には,以下が含まれます:

  • RDMA/RoCE 加速:RoCEv2の完全なハードウェアオフロード,混雑管理,オーダー外パケット処理,およびアプリケーションバッファーへの即時データ配置を含む.
  • ストレージプロトコル:NVMe-oF (TCPとRoCEの両方),iSER,SRPのネイティブサポート,ソフトウェアベースのターゲット処理を排除する.
  • 仮想化とマルチテナンシー:ポートごとに最大1000の仮想機能 (VF) を搭載し,上層トンネルオフロードでラインレートエンカプス/デカプスルを実現する.
  • セキュリティとテレメトリ200GbpsのインラインIPsec/TLS暗号化,ハードウェアベースのフロートラッキング (例:接続トラッキング,ヒストグラム).

統計によるとMCX653106A-HDATの仕様,アダプタはPCIe 4.0/5.0 x16インターフェースをサポートし,全200GbE線速度でもホスト側ボトルネックがないことを保証します.

4展開とスケーリングの推奨事項 (典型的なトポロジー)

検証された参照トポロジーは以下のとおりである.

  • 計算層:48つのドーパルソケットサーバー,それぞれに1つのソケットMCX653106A-HDAT(ダブルポート100GbE構成) ポートはアクティブ・アクティブLAGとして結合されます.
  • ストレージ層:12つのフルフラッシュ NVMe-oF ターゲットサーバー,それぞれが2つMCX653106A-HDAT イーサネット アダプター カード1つはフロントエンドのコンピューティングアクセス,1つはバックエンドの複製
  • ネットワーク層:4つの100GbE Spine スイッチと8つのLeaf スイッチ,DCBX,PFC (RoCEのクラス3) とECN 限界値で構成されている.

200ノードを超えたスケーリングでは,ハードウェアのオフロード (完全に) と EVPN-VXLAN を使用したマルチポッド設計をサポートします.MCX653106A-HDAT対応主要なベンダーのスイッチとMCX653106A-HDAT価格100GbEポートあたりは,Fibre ChannelやInfiniBandの比較可能なソリューションより約40%低くなっています.

5運用,監視,トラブルシューティング,最適化

RDMA/RoCE展開の効果的な運用には,専門的なツールが必要です.以下の実践が推奨されます.

アスペクト 推奨する行動とツール
テレメトリと可視性 ハードウェアカウンタを有効にするミル×5cmdPFCの休止,ECNマークのパケット,RoCEの再送信を監視する.
交通渋滞の検出 使用エスツール -SNVIDIAのDockerベースの混雑テレメトリキットを展開します
ファームウェアとドライバ Mgmt 維持するMCX653106A-HDAT対応ファイアウェアバージョン (≥ 26.35.x) DOCA 2.5+ ドライバースタックと並んで
最適化ガイドライン ジャンボフレームでは MTU=9000 を設定し, roce_rx_qos_policy を調整し,混合ワークロードでは動的中断モデレーションを有効にする.

障害解決のために, RoCEv2 特定メタデータをキャプチャします薬剤剤そしてibv_devinfo についてネットワークデバイスの一貫性を確保し,PCIeリンクの速度が一致していない (PFCの設定が間違っています.Ispci -vvv について) について

6概要 価値評価

についてNVIDIA メラノックス MCX653106A-HDAT標準Ethernetファブリックを高性能で損失のないネットワークに変換するための実証済み,生産に備えられたプラットフォームを提供しています.主要な価値評価には以下が含まれます.

  • 遅延:決定的な10μs以下のNVMe-oF読み込み遅延 (P99) で,リアルタイム分析とHPC収束が可能である.
  • トランスフット:ゼロパケット損失の付近線速200GbEMCX653106A-HDATの仕様.
  • CPU 効率:ネットワークやストレージスタックで消費された CPU コアの 30%まで解放します
  • TCO:独自のインターコネクトと比較するとMCX653106A-HDAT 販売中標準Ethernetスイッチングと組み合わせた価格設定により 3年間の運用コストは35~50%削減されます

建築家や運営責任者は,このソリューションをAIファブリック,分散型ストレージ,超低レイテンシー金融システムに自信を持って導入できます.役員に参照するMCX653106A-HDATデータシートNVIDIAの DOCAドキュメントライブラリです