メラノックス (NVIDIA メラノックス) MCX653105A-HDAT サーバーアダプタ 技術ソリューション

April 29, 2026

1背景と要求の分析

分散型ストレージ,AIトレーニングクラスター,ネットワークの遅延とサーバーのスループットに厳しい要求を課しています伝統的なTCP/IPスタックは,高帯域幅下では,CPUの重要な中断とコンテキストスイッチを生成し,ネットワークオーバーヘッドだけで,コンピューティングパワーの30%以上を消費します.NVMe-oFのような新興ストレージプロトコルは,性能の可能性を解放するためにマイクロ秒スケールのエンドツーエンドレイテンシーを必要とします.ネットワーク処理をオフロードし,メモリへの直接アクセスを可能にするNICが必要です.メラノックス (NVIDIA メラノックス) MCX653105A-HDAT配達する

典型的な展開シナリオで特定された主要な要件は,次のようなもの: 2μs 未満のアプリケーションレベルのレイテンシー,ポートあたり 100GbE のラインレートスループット,RoCE (RDMA over Converged Ethernet) のためのハードウェアオフロード既存のPCIe 4.0サーバーとシームレスな統合と,積極的な混雑管理のための包括的なテレメトリ.MCX653105A-HDATConnectX-6アーキテクチャで対応しています

2ネットワーク/システムアーキテクチャの設計

提案されたソリューションは,RoCEサポートの2層の脊葉組織を採用し,Ethernetの経済性を維持しながらTCP/IPのボトルネックを排除します.トップ・オブ・ラックスイッチ (NVIDIA SN4000シリーズまたは同等のPFC対応スイッチ) 相互接続コンピューティング・ストレージノード. 各コンピューティングノードは,MCX653105A-HDAT イーサネット アダプター カードストレージノードは同じアダプタを展開し,RDMA上で直接NVMe-oFターゲットにサービスを提供する.

建築的にはNVIDIA メラノックス MCX653105A-HDAT仮想マシン,コンテナ,そして裸の金属ワークロードからすべてのネットワークI/Oを処理する,主要なデータ平面加速器として位置します.制御平面はホストCPUに残りますが,データ移動タスクから解放されます.この分離は,RDMA対応設計の本質です.大規模な展開 (100+ノード) の場合,専用 RoCE 混雑制御ドメインは DCQCN (データセンター定量混雑通知) を使用して構成されます.コンピュータとストレージトラフィックのための別々のバッファプール.

3ソリューションにおけるMellanox (NVIDIA Mellanox) MCX653105A-HDATの役割と主要な特徴

についてMCX653105A-HDAT ConnectX アダプター PCIe ネットワーク カードこのアーキテクチャでは4つの重要な機能を果たします

  • ハードウェアのオフロード RoCE:RDMAを実装する.特殊なスイッチやファブリックを必要としない.データはアプリケーションバッファーとリモートメモリの間に直接移動し,カーネルを完全に回避する.
  • PCIe 4.0 x16 インターフェース:200Gb/s のバイダイレクトバンド幅まで提供し,ホストバスボトルネックを取り除き,ダブル 100GbE ポートを完全に利用します.
  • 加速スイッチングとパケット処理 (ASAP2):VXLAN/NVGREオフロード,VirtIO加速,プログラム可能なテレメトリのための柔軟なパイプラインカスタマイズをサポートする.
  • 貯蔵速度:NVMe-oF (TCPとRoCE) のハードウェアオフロード,T10-DIF署名生成/検証,削除コード加速

報告書によると,MCX653105A-HDATデータシート,アダプターはまた,安全な起動,信頼のハードウェアルーツ,および100GbEまでのインラインIPsec/TLS暗号化をサポートします.MCX653105A-HDATの仕様2つのスロット幅,受動冷却,広範囲の動作温度 (0°C~55°C) を備えており,密集したサーバー環境に適しています.

4展開とスケーリングの推奨事項 (典型的なトポロジーを含む)

典型的なトポロジー (1024ノードクラスター例):
- リーフ層: 16xリーフスイッチ,それぞれ48x100GbEダウンリンクポート + 8x400GbEアップリンク
- 脊椎層: 4x 脊椎スイッチ,ブロックしない400GbE 布
- 計算ノード: 2つMCX653105A-HDATノードごとに (オプションでアクティブ・アクティブまたはアクティブ・スタンバイ)
- ストレージノード: 1xMCX653105A-HDATRDMA による NVMe 名空をサービスするノードごとに

配備のステップ:確認するMCX653105A-HDAT対応公式の互換性マトリックスを使用するサーバー. MLNX_OFED または DOCA フレームワーク (最低バージョン 5.8) をインストールします. スイッチポート (PFC,ECN,DCQCN パラメータがワークロードに調整されています) で RoCE を有効にします.結合または多経路を二重ポート冗長化のために設定する. 最後に,perftest Suite (ib_write_bw, ib_read_lat) を使用して検証します.

スケーリングの考慮事項:組織レベルで適応型ルーティングと混雑制御を実装します.MCX653105A-HDAT イーサネット アダプタカードソリューション各アダプタが中心的なボトルネックなしで独立して動作するので,線形的にスケールされます.MCX653105A-HDAT価格サーバーの統合とCPUコア数の必要性の低下により,典型的な回収期間は6~12ヶ月です.MCX653105A-HDATを販売する量販価格とファームウェアのカスタマイズオプションについて地域ディストリビューターに連絡する必要があります.

配備規模 推奨トポロジー 期待される遅延 (P99) CPU 負荷減速率
最大256ノード 単葉または2葉 +2脊 ≤1.8 μs 85~90%
257〜1024ノード 4-16 葉 + 4 脊椎 ≤2.2 μs 88~92%
1024+ノード 適応型ルーティングを備えた多層 ≤2.8 μs 90~95%
5運用,監視,トラブルシューティング,最適化

監視とテレメトリについてNVIDIA メラノックス MCX653105A-HDATPCM (Performance Counter Monitor) とDOCAテレメトリを介してリアルタイムカウンタを輸出する.追跡する主要なメトリック:RoCE混雑マーク比,バッファドロップ数,PCIeリンクエラー,ポート停止フレーム.Prometheus+Grafanaとの統合は,NVIDIA管理ライブラリ (NVML) によりサポートされています..

最適化ガイドライン:DCQCN パラメータを設定 (cnp_802p_prio=3, rpg_time_reset=300,など) 作業負荷に基づいて ストレージのためにより攻撃的で,コンピューティングのために保守的です. ハードウェアのオフロードを選択的に有効にします:混合作業負荷のTSO/LRO遅延感のあるフローのための RoCE と NFV の ASAP2. 付属した mlxconfig ツールを使用して,PCIe の最大ペイロードサイズ (256B はほとんどのサーバーに最適) を調整します.

一般的なトラブルシューティング:ポートのフラッピングは通常,SFP/ケーブルの不一致を示しますMCX653105A-HDAT対応低RDMAスループットは,スイッチのECN構成が不十分であることを示している.内部アダプターレジスタを検査するために,ファブリックの検証とdump_emadのためにibdiagnetを使用持続的な問題については,MCX653105A-HDATデータシートレジスタレベルでの診断とエラーコードの表を提供します.

6概要 価値評価

についてMCX653105A-HDAT低レイテンシーで高速なデータセンターネットワークのための成熟した生産準備のビルディングブロックです. ネットワーク処理をCPUからハードウェアベースのエンジンに移すことで,標準Ethernetインフラストラクチャで RDMA/RoCEの展開を可能にしますネットワークタスクのCPU削減が50~70%になり,決定的なサブ-2μsのレイテンシー,シームレスなNVMe-oF統合,数千のノードへの線形スケーラビリティが挙げられる.MCX653105A-HDAT イーサネット アダプタカードソリューション既存の管理ツールとの互換性を保ちながら,200GbEファブリックへの将来性のある経路を提供します.MCX653105A-HDATの仕様概念証明やラック規模での導入を計画する場合は このアダプターはパフォーマンスと所有総コストの両方において 定量化可能な改善をもたらします