Mellanox (NVIDIA Mellanox) MCX556A-ECAT サーバー NIC テクニカル ソリューション

June 9, 2026

Mellanox (NVIDIA Mellanox) MCX556A-ECAT サーバー NIC テクニカル ソリューション

このホワイト ペーパーは、ネットワーク アーキテクト、プリセールス エンジニア、運用リーダーに、ネットワーク アーキテクト、プリセールス エンジニア、および運用リーダーに、メラノックス (NVIDIA メラノックス) MCX556A-ECATサーバーネットワークアダプター。このソリューションは、RDMA/RoCE を通じて TCP/IP ボトルネックを排除し、確定的な低遅延通信を実現しながら、データ集約型ワークロードのサーバー スループットを最大化することに重点を置いています。

1. プロジェクトの背景と要件の分析

AI トレーニング クラスター、分散データベース、ハイパーコンバージド インフラストラクチャ、高頻度取引プラットフォームなどの最新のデータセンター環境には、共通の制約があります。それは、従来のネットワーク スタックがメモリ コピー、コンテキスト スイッチ、プロトコル処理で CPU サイクルの 30 ~ 50% を消費するということです。リンク速度が 100Gbps 以上に上昇すると、ソフトウェア ベースのネットワーキングは持続不可能になります。次世代サーバー接続の主な要件には、ノード間遅延が 5 マイクロ秒未満、100Gbps リンクあたり 10% 未満の CPU オーバーヘッド、ストレージ プロトコルのロスレス トランスポート (NVMe-oF)、既存のイーサネット インフラストラクチャとのシームレスな統合が含まれます。のMCX556A-ECAT イーサネット アダプタ カード ソリューションこれらの要求に直接対応します。

2. 全体的なネットワーク/システム アーキテクチャの設計

推奨されるアーキテクチャでは、NVIDIA Mellanox MCX556A-ECAT各コンピューティング ノードまたはストレージ ノードのデュアル ポート 100GbE アダプターとして。このソリューションは、RoCE (RDMA over Converged Ethernet) サポートを備えた 2 層リーフ/スパイン トポロジを採用しています。主要なアーキテクチャ上の決定には次のものが含まれます。

  • ロスレスイーサネット基盤: RoCE トラフィックを伝送するポートで優先フロー制御 (PFC) を有効にし、リーフ スイッチで ECN (明示的輻輳通知) しきい値を設定します。
  • 個別のトラフィック クラス: 厳密な優先スケジューリングを使用して、RoCE トラフィックを専用の優先キュー (通常は 3 または 5) に割り当てます。
  • バッファ管理: に従ってスイッチに共有バッファ プールを割り当てます。MCX556A-ECATの仕様(ロスレス操作のためにポートあたり 4MB を推奨)。

それぞれMCX556A-ECAT ConnectX アダプター PCIe ネットワーク カードQSFP28 光学系 (距離に応じて SR4、LR4、または AOC/DAC) を介してリーフ スイッチに接続します。高可用性を実現するために、デュアルホーミング構成は両方のポートを結合します。つまり、スループットを確保するためにアクティブ-アクティブ、またはフェールオーバーを確保するためにアクティブ-スタンバイです。コントロール プレーンは標準のイーサネットと IP を使用し、データ プレーンはゼロコピー転送に RDMA を利用します。

3. ソリューションにおける Mellanox (NVIDIA Mellanox) MCX556A-ECAT の役割と主な機能

MCX556A-ECATサーバー メモリとネットワーク ファブリック間の重要なオフロード エンジンとして機能します。ハードウェアベースのトランスポートにより、データ移動にカーネルが関与する必要がなくなります。から抽出された主要な機能MCX556A-ECAT データシート含む:

特徴 説明 利点
RDMA および RoCE v2 コンバージドイーサネットを介したハードウェアベースのリモートダイレクトメモリアクセス CPU の関与はゼロ。 1μs未満のハードウェア遅延
NVMe-oF オフロード NVMe/TCP および NVMe/RDMA コマンド処理の完全オフロード ローカルパフォーマンスで共有非集約ストレージを有効にします
GPUダイレクト GPUとNICメモリ間のピアツーピア通信 AI トレーニングのための中間システム メモリを排除します。

MCX556A-ECAT イーサネット アダプタ カードまた、高度なステアリング (128 の仮想キューへのフロー分類)、最大 512 の仮想機能を備えた SR-IOV、および高精度時間プロトコル (PTP) のハードウェア タイマー オフロードも含まれています。これらの機能により、単なる高速インターフェイスではなく、完全なデータ パス アクセラレーション エンジンになります。

4. 導入とスケーリングの推奨事項 (一般的なトポロジ)

中規模のクラスター (64 ~ 256 ノード) の場合は、次のトポロジが推奨されます。

  • 葉の層: 2 つまたは 4 つの 48 ポート 100GbE RoCE スイッチ (NVIDIA SN3700 など)。各リーフは 24 ~ 48 台のサーバーに接続します。MCX556A-ECAT互換QSFP28ポート。
  • スパイン層: リーフから 128 個のノンブロッキング 100GbE アップリンクを提供する 4 つの 32 ポート 400GbE スイッチ。
  • サーバー構成: 1つMCX556A-ECATサーバーごとに、ポート A からリーフ スイッチ A、ポート B からリーフ スイッチ B に接続されます。これにより、合計 200 Gbps の帯域幅とパスの冗長性が得られます。

ファブリックを 256 ノードを超えて拡張するには、リーフとスパインのペアを追加するか、3 段階の Clos アーキテクチャに移行する必要があります。評価する場合MCX556A-ECAT 価格将来の容量に対して、アダプターがMCX556A-ECAT互換PCIe 4.0 マザーボード (最初は 3.0 x16 で実行) を搭載しており、簡単なアップグレード パスを提供します。

5. 運用、監視、トラブルシューティング、最適化

RoCE 導入の優れた運用には、特定の監視と調整が必要です。主な実践方法は次のとおりです。

  • 監視カウンター: 使用ethtool -S ethX | grep -E "roce|pfc|ecn"優先一時停止フレームと CNP (輻輳通知パケット) を追跡します。のMCX556A-ECATの仕様予想されるベースライン値を文書化します。
  • バッファチューニング: RoCE キューのスイッチ出力バッファを 4 ~ 6MB に設定します。バッファが不十分だと、PFC ストームが発生し、スループットが低下します。
  • ファームウェア管理: 最新のファームウェア (NVIDIA エンタープライズ サポート ポータルから入手可能) を維持して、エラッタに対処し、パフォーマンスの強化を実現します。MCX556A-ECAT データシート
  • パフォーマンスのベースライン: 走るib_write_bwそしてib_read_latOFED ツールキットから。期待される結果: 8 バイト メッセージの場合、双方向 98 ~ 99 Gbps、遅延 0.8 ~ 1.2 μs。

一般的なトラブルシューティング シナリオ: PFC デッドロック (誤って設定されたキュー マッピングをチェック)、リンク フラッピング (電力とケーブルの定格を検証)、RDMA 接続タイムアウト (ジャンボ フレームの 4200 バイトでの MTU の一貫性を確認)。チームをお探しの方へMCX556A-ECAT 販売用クラスターを拡張するには、バッチ間で事前にファームウェアの調整を行うことで、互換性の問題を回避します。

6. 概要と価値の評価

MCX556A-ECAT最新のデータセンターに明確な価値提案を提供します。 RDMA/RoCE を有効にすると、NVIDIA Mellanox MCX556A-ECATTCP と比較してアプリケーションの遅延を 10 分の 1 に削減し、CPU ネットワークのオーバーヘッドを 85% 削減し、NVMe-oF を介してストレージの分散を解除します。アーキテクトにとって、カードのデュアルポート 100GbE 容量は将来の余裕を提供します。運用チームにとっては、成熟したドライバー スタック (アップストリーム Linux、Windows、および VMware) により管理が簡素化されます。評価する場合MCX556A-ECAT 価格ソフトウェア ライセンス、電力、冷却などの総所有コストと比較すると、アダプターは通常、サーバー統合を通じて 6 ~ 12 か月以内に元が取れます。として参照されるかどうかMCX556A-ECAT イーサネット アダプタ カードまたはMCX556A-ECAT ConnectX アダプター PCIe ネットワーク カード、このソリューションは、ロスレスで高スループットのイーサネット ネットワーキングのリファレンス デザインのままです。