メロノックス (NVIDIA メロノックス) MCX623106AN-CDAT サーバーアダプター 技術ホワイトペーパー
April 24, 2026
このテクニカルホワイトペーパーは、ネットワークアーキテクト、プリセールスエンジニア、および運用マネージャーを対象としています。これは、Mellanox (NVIDIA Mellanox) MCX623106AN-CDATサーバーアダプターに焦点を当て、RDMA/RoCEテクノロジーを使用して低遅延、高スループットのデータセンターネットワークを構築する方法を説明します。本稿では、アーキテクチャ設計、主要な技術的特徴、展開およびスケーリング戦略、運用および監視を取り上げ、実世界の導入に向けた実行可能なガイダンスを提供します。
現代のデータセンターは、CPUがネットワークのボトルネックになる、ストレージアクセス遅延が過剰になる、分散アプリケーションの通信オーバーヘッドが制御不能になるという3つの主要な課題に直面しています。従来のTCP/IPプロトコルスタックは、大規模な並列通信中にプロトコル処理とデータコピーでCPUリソースの30%以上を消費し、効果的なサーバーのスループットを大幅に低下させます。一方、NVMe over Fabrics、分散機械学習フレームワーク(例:NCCL)、インメモリデータベースなどのアプリケーションは、エンドツーエンドで20マイクロ秒未満の遅延を要求します。カーネルをバイパスし、ハードウェアレベルのトランスポートオフロードを提供するソリューションが緊急に必要とされています。これはまさに、MCX623106AN-CDATイーサネットアダプターカードソリューションとRoCEテクノロジーの組み合わせが解決する問題です。
このソリューションは、2層のSpine-Leafトポロジーを採用しています。すべてのコンピューティングノードとストレージノードには、NVIDIA Mellanox MCX623106AN-CDATイーサネットアダプターが装備されています。Leafスイッチは、PFC(Priority Flow Control)とECN(Explicit Congestion Notification)を有効にし、RoCEトラフィック専用の優先度キューを割り当てることで、ロスレスRoCE動作用に構成されています。主要な設計原則は次のとおりです。
- 制御プレーンとデータプレーンの分離:RoCEデータフローはアダプター上のハードウェアで完全に処理されますが、制御プロトコル(ARP、DHCPなど)は引き続き従来のパスに従います。
- 統一ファブリック:イーサネットは標準TCP/IPとRoCEトラフィックの両方を運び、DSCPマーキングを通じてQoS分離を実現します。
- エンドツーエンドの輻輳管理:DCQCNアルゴリズムに基づいて、ソースアダプターとスイッチ間のクローズドループフィードバックメカニズムを確立します。
このソリューションの各サーバーノードでは、MCX623106AN-CDATイーサネットアダプターカードが重要な役割を果たします。デュアルポート100GbE設計は、冗長性のために異なるLeafスイッチに接続したり、ストレージトラフィックとコンピューティングトラフィックの間に物理的な分離を提供したりできます。
このソリューションのコアデータプレーンコンポーネントとして、MCX623106AN-CDAT ConnectXアダプターPCIeネットワークカードは、以下の決定的な機能を提供します。
- ハードウェアRoCEオフロードエンジン:ホストCPUの介入なしに、トランスポートレイヤー処理(セグメンテーション、再アセンブリ、確認応答、再送信)を処理します。
- 動的なConnectXオフロード:マルチキューイングトラフィックを自動的に分散し、マルチコアサーバーのスループットを向上させます。
- PCIe 4.0 x16ホストインターフェイス:理論帯域幅256Gb/sで、ラインレート転送のボトルネックを解消します。
- 高度なストレージオフロード:NVMe over Fabricsのハードウェアアクセラレーションをサポートし、名前空間ルックアップとデータ整合性チェックを含みます。
MCX623106AN-CDATデータシートMCX623106AN-CDAT仕様によると、このアダプターは600ナノ秒未満のポート間遅延を実現し、最大2億パケット/秒のパケット処理レートをサポートします。コストを評価するチームにとって、MCX623106AN-CDATの価格は同等の100GbE RoCEアダプターの中で非常に競争力があり、MCX623106AN-CDATの販売は標準的な流通チャネルを通じて入手可能です。選択する前に、サーバーモデルがMCX623106AN-CDAT互換リストに記載されていることを確認することをお勧めします。主要なOEMプラットフォームはすべて検証済みです。4. 展開とスケーリングの推奨事項(典型的なトポロジーを含む)
2つのSpineスイッチと4つのLeafスイッチで構成されるClosアーキテクチャ。各サーバーノードには
MCX623106AN-CDATMCX623106AN-CDATイーサネットアダプターカードソリューション展開手順:
ステップ1:
- MCX623106AN-CDATMCX623106AN-CDATイーサネットアダプターカードソリューションステップ2:スイッチで、RoCEトラフィック用にPFC(優先度3を推奨)とECN(Kmin/Kmaxを設定)を構成します。
- ステップ3:オペレーティングシステムで、RoCEv2モードを有効にし、DCQCNパラメータ(初期値:α=1、β=1、タイマー周期100μs)を構成します。
- ステップ4:ib_write_bwおよびib_write_latツールを使用して、パフォーマンスベースラインを確認します。
- スケーリングの推奨事項:
クラスターが500ノードを超えてスケーリングする場合は、アダプターのフロー制御(PPC)とQoSマッピングテーブルを有効にすることを検討し、ヘッドオブラインブロッキングを回避するために複数のRoCE優先度を使用することを検討してください。5. 運用監視、トラブルシューティング、および最適化の推奨事項
MCX623106AN-CDATイーサネットアダプターカードソリューションMCX623106AN-CDATデータシートmlxconfig / mlxfwmanager
- :ファームウェアパラメータを設定し、ファームウェアのアップグレードを管理します。ethtool -S
- :RoCE送受信カウンターとPFCポーズフレームカウントを表示します。ibdiagnet
- :不要なPFCストームを検出するために、包括的なRoCEネットワーク診断を実行します。テレメトリとHIST
- :アダプターの組み込み履歴遅延分布テーブルを利用して、テール遅延の異常を特定します。一般的なトラブルシューティング:
期待を下回るスループット:PCIeネゴシエーションステータス(Gen4 x16であるべき)を確認し、MTUが9000ジャンボフレームに均一に設定されていることを確認します。
- RoCE接続の失敗:DSCPマッピングとVLAN構成を確認し、スイッチがRoCEマーク付きパケットをドロップしていないことを確認します。
- 高いCPU使用率:ハードウェアオフロードが無効になっている可能性があります。ethtoolオフロード設定を確認してください。
- 最適化の推奨事項:
非常に遅延に敏感なアプリケーション(高頻度取引、RDMAログレプリケーションなど)の場合は、RoCEサービスタイプを「接続型」から「データグラム」に変更し、輻輳制御を無効にすることを検討してください。6. まとめと価値評価
に基づくRDMA/RoCEソリューションは、既存のイーサネットインフラストラクチャを交換することなく、分散アプリケーションのエンドツーエンド遅延を1桁(数百マイクロ秒から数十マイクロ秒へ)削減し、同時にCPUコンピューティングリソースの20~30%を解放します。AIトレーニング、ハイパーコンバージドストレージ、リアルタイム分析などのシナリオでは、これは直接的にジョブ完了時間の短縮とサーバー密度の向上につながります。完全なMCX623106AN-CDATイーサネットアダプターカードソリューションとして、「ロスレスイーサネット+スマートNIC」が高スループットと低遅延の両方を実現する実行可能なパスであることを示しています。詳細については、MCX623106AN-CDATデータシートを入手するには、公式NVIDIAドキュメントを参照するか、ソリューションアーキテクチャチームに連絡してください。

