Mellanox (NVIDIA Mellanox) MCX556A-ECAT サーバー NIC テクニカル ソリューション
June 9, 2026
このホワイト ペーパーは、ネットワーク アーキテクト、プリセールス エンジニア、運用リーダーに、ネットワーク アーキテクト、プリセールス エンジニア、および運用リーダーに、メラノックス (NVIDIA メラノックス) MCX556A-ECATサーバーネットワークアダプター。このソリューションは、RDMA/RoCE を通じて TCP/IP ボトルネックを排除し、確定的な低遅延通信を実現しながら、データ集約型ワークロードのサーバー スループットを最大化することに重点を置いています。
1. プロジェクトの背景と要件の分析
AI トレーニング クラスター、分散データベース、ハイパーコンバージド インフラストラクチャ、高頻度取引プラットフォームなどの最新のデータセンター環境には、共通の制約があります。それは、従来のネットワーク スタックがメモリ コピー、コンテキスト スイッチ、プロトコル処理で CPU サイクルの 30 ~ 50% を消費するということです。リンク速度が 100Gbps 以上に上昇すると、ソフトウェア ベースのネットワーキングは持続不可能になります。次世代サーバー接続の主な要件には、ノード間遅延が 5 マイクロ秒未満、100Gbps リンクあたり 10% 未満の CPU オーバーヘッド、ストレージ プロトコルのロスレス トランスポート (NVMe-oF)、既存のイーサネット インフラストラクチャとのシームレスな統合が含まれます。のMCX556A-ECAT イーサネット アダプタ カード ソリューションこれらの要求に直接対応します。
2. 全体的なネットワーク/システム アーキテクチャの設計
推奨されるアーキテクチャでは、NVIDIA Mellanox MCX556A-ECAT各コンピューティング ノードまたはストレージ ノードのデュアル ポート 100GbE アダプターとして。このソリューションは、RoCE (RDMA over Converged Ethernet) サポートを備えた 2 層リーフ/スパイン トポロジを採用しています。主要なアーキテクチャ上の決定には次のものが含まれます。
- ロスレスイーサネット基盤: RoCE トラフィックを伝送するポートで優先フロー制御 (PFC) を有効にし、リーフ スイッチで ECN (明示的輻輳通知) しきい値を設定します。
- 個別のトラフィック クラス: 厳密な優先スケジューリングを使用して、RoCE トラフィックを専用の優先キュー (通常は 3 または 5) に割り当てます。
- バッファ管理: に従ってスイッチに共有バッファ プールを割り当てます。MCX556A-ECATの仕様(ロスレス操作のためにポートあたり 4MB を推奨)。
それぞれMCX556A-ECAT ConnectX アダプター PCIe ネットワーク カードQSFP28 光学系 (距離に応じて SR4、LR4、または AOC/DAC) を介してリーフ スイッチに接続します。高可用性を実現するために、デュアルホーミング構成は両方のポートを結合します。つまり、スループットを確保するためにアクティブ-アクティブ、またはフェールオーバーを確保するためにアクティブ-スタンバイです。コントロール プレーンは標準のイーサネットと IP を使用し、データ プレーンはゼロコピー転送に RDMA を利用します。
3. ソリューションにおける Mellanox (NVIDIA Mellanox) MCX556A-ECAT の役割と主な機能
のMCX556A-ECATサーバー メモリとネットワーク ファブリック間の重要なオフロード エンジンとして機能します。ハードウェアベースのトランスポートにより、データ移動にカーネルが関与する必要がなくなります。から抽出された主要な機能MCX556A-ECAT データシート含む:
| 特徴 | 説明 | 利点 |
|---|---|---|
| RDMA および RoCE v2 | コンバージドイーサネットを介したハードウェアベースのリモートダイレクトメモリアクセス | CPU の関与はゼロ。 1μs未満のハードウェア遅延 |
| NVMe-oF オフロード | NVMe/TCP および NVMe/RDMA コマンド処理の完全オフロード | ローカルパフォーマンスで共有非集約ストレージを有効にします |
| GPUダイレクト | GPUとNICメモリ間のピアツーピア通信 | AI トレーニングのための中間システム メモリを排除します。 |
のMCX556A-ECAT イーサネット アダプタ カードまた、高度なステアリング (128 の仮想キューへのフロー分類)、最大 512 の仮想機能を備えた SR-IOV、および高精度時間プロトコル (PTP) のハードウェア タイマー オフロードも含まれています。これらの機能により、単なる高速インターフェイスではなく、完全なデータ パス アクセラレーション エンジンになります。
4. 導入とスケーリングの推奨事項 (一般的なトポロジ)
中規模のクラスター (64 ~ 256 ノード) の場合は、次のトポロジが推奨されます。
- 葉の層: 2 つまたは 4 つの 48 ポート 100GbE RoCE スイッチ (NVIDIA SN3700 など)。各リーフは 24 ~ 48 台のサーバーに接続します。MCX556A-ECAT互換QSFP28ポート。
- スパイン層: リーフから 128 個のノンブロッキング 100GbE アップリンクを提供する 4 つの 32 ポート 400GbE スイッチ。
- サーバー構成: 1つMCX556A-ECATサーバーごとに、ポート A からリーフ スイッチ A、ポート B からリーフ スイッチ B に接続されます。これにより、合計 200 Gbps の帯域幅とパスの冗長性が得られます。
ファブリックを 256 ノードを超えて拡張するには、リーフとスパインのペアを追加するか、3 段階の Clos アーキテクチャに移行する必要があります。評価する場合MCX556A-ECAT 価格将来の容量に対して、アダプターがMCX556A-ECAT互換PCIe 4.0 マザーボード (最初は 3.0 x16 で実行) を搭載しており、簡単なアップグレード パスを提供します。
5. 運用、監視、トラブルシューティング、最適化
RoCE 導入の優れた運用には、特定の監視と調整が必要です。主な実践方法は次のとおりです。
- 監視カウンター: 使用
ethtool -S ethX | grep -E "roce|pfc|ecn"優先一時停止フレームと CNP (輻輳通知パケット) を追跡します。のMCX556A-ECATの仕様予想されるベースライン値を文書化します。 - バッファチューニング: RoCE キューのスイッチ出力バッファを 4 ~ 6MB に設定します。バッファが不十分だと、PFC ストームが発生し、スループットが低下します。
- ファームウェア管理: 最新のファームウェア (NVIDIA エンタープライズ サポート ポータルから入手可能) を維持して、エラッタに対処し、パフォーマンスの強化を実現します。MCX556A-ECAT データシート。
- パフォーマンスのベースライン: 走る
ib_write_bwそしてib_read_latOFED ツールキットから。期待される結果: 8 バイト メッセージの場合、双方向 98 ~ 99 Gbps、遅延 0.8 ~ 1.2 μs。
一般的なトラブルシューティング シナリオ: PFC デッドロック (誤って設定されたキュー マッピングをチェック)、リンク フラッピング (電力とケーブルの定格を検証)、RDMA 接続タイムアウト (ジャンボ フレームの 4200 バイトでの MTU の一貫性を確認)。チームをお探しの方へMCX556A-ECAT 販売用クラスターを拡張するには、バッチ間で事前にファームウェアの調整を行うことで、互換性の問題を回避します。
6. 概要と価値の評価
のMCX556A-ECAT最新のデータセンターに明確な価値提案を提供します。 RDMA/RoCE を有効にすると、NVIDIA Mellanox MCX556A-ECATTCP と比較してアプリケーションの遅延を 10 分の 1 に削減し、CPU ネットワークのオーバーヘッドを 85% 削減し、NVMe-oF を介してストレージの分散を解除します。アーキテクトにとって、カードのデュアルポート 100GbE 容量は将来の余裕を提供します。運用チームにとっては、成熟したドライバー スタック (アップストリーム Linux、Windows、および VMware) により管理が簡素化されます。評価する場合MCX556A-ECAT 価格ソフトウェア ライセンス、電力、冷却などの総所有コストと比較すると、アダプターは通常、サーバー統合を通じて 6 ~ 12 か月以内に元が取れます。として参照されるかどうかMCX556A-ECAT イーサネット アダプタ カードまたはMCX556A-ECAT ConnectX アダプター PCIe ネットワーク カード、このソリューションは、ロスレスで高スループットのイーサネット ネットワーキングのリファレンス デザインのままです。

