NVIDIA メラノックス MCX623106AN-CDAT サーバーアダプター テクニカルホワイトペーパー
July 24, 2026
NVIDIA Mellanox MCX623106AN-CDAT サーバーアダプター技術ホワイトペーパー | RDMA/RoCE 低遅延トランスポート & サーバースループット最適化
1. プロジェクトの背景と要件分析
現代のデータセンターは、人工知能、大規模機械学習、リアルタイム分析の爆発的な成長により、パラダイムシフトを経験しています。これらのワークロードは、前例のないネットワークパフォーマンスを要求します。生の帯域幅だけでなく、決定論的なサブ5μsの遅延、CPU効率の高いデータ移動、そして数千ノードへのシームレスなスケーラビリティが必要です。従来のイーサネットアダプターは、ソフトウェアベースのTCP/IPスタックに依存しており、200GbE速度でCPUコアの最大40%を消費し、予測不可能な遅延変動を引き起こしてアプリケーションパフォーマンスを低下させるという、重要なボトルネックとなっています。大規模AIクラスター(500基以上のGPU)やハイパースケールクラウドインフラストラクチャを構築する組織にとって、この非効率性は、トレーニング時間の延長、インフラストラクチャコストの増加、市場投入までの時間の遅延に直接つながります。
このホワイトペーパーでは、MCX623106AN-CDATイーサネットアダプターカードサーバーアダプターを中心とした包括的な技術ソリューションを紹介します。200GbEへの投資を最大化したい企業向けに設計された総所有コストを評価する際、は、ハードウェアアクセラレーションされたRDMA over Converged Ethernet (RoCE) を提供し、ロスレスで超低遅延のトランスポートを可能にし、ネットワークI/Oをスケーリングのボトルネックから競争優位性へと変革します。このソリューションは、3つの主要な目標を達成するために特別にアーキテクトされています。(1) AI集合通信のためのエンドツーエンドアプリケーション遅延サブ5μsの達成、(2) CPUネットワーク処理オーバーヘッドを5%未満に削減、(3) 200GbE以降の拡張可能で将来性のある基盤の提供。
2. ネットワークおよびシステムアーキテクチャ全体の設計
推奨されるアーキテクチャは、サーバーアクセス層として200GbE、スパインへのアップリンクとして400GbE/800GbEを採用した高性能リーフ・スパイン・トポロジーを採用しています。この設計の中核となるのは、ファブリック全体にわたるすべてのコンピューティングおよびストレージノードに展開されるです。アーキテクチャは、6つの主要原則に基づいて構築されています。
- ロスレスイーサネットファブリック:すべてのスイッチでPFC(Priority Flow Control)とECN(Explicit Congestion Notification)を備えたRoCE v2を活用し、パケットドロップを排除し、RDMAトラフィックの決定論的な遅延を保証します。
- GPUDirect RDMA:CPUの関与なしにネットワークを介したGPU間直接通信を可能にし、遅延を削減し、コンピューティングタスクのためにCPUリソースを解放します。
- あらゆる場所でのハードウェアオフロード:トランスポート、セキュリティ(IPsec/MACsec)、ストレージプロトコルをアダプターにオフロードし、アプリケーションロジックのためにCPUサイクルを解放します。
- アクティブ・アクティブ冗長性:リンクアグリゲーション(LACP)モードで両方のQSFP112ポートを利用して、400Gb/sの集約帯域幅とサブ秒リカバリによる自動フェイルオーバーを実現します。
- インテリジェントトラフィックエンジニアリング:適応ルーティングと順不同パケット配信により、輻輳ホットスポットを回避し、ファブリック利用率を最大化します。
- 包括的なテレメトリ:インバンドネットワークテレメトリ(INT)とフローごとの監視により、プロアクティブな輻輳検出と容量計画を行います。
このソリューションは、NVIDIA GPUプラットフォーム(HGX、DGX)およびDell、HPE、Supermicro、Lenovoの主要CPUサーバーと完全にNVIDIA NCCL、PyTorch、TensorFlow、MPIライブラリを含む主要なAIおよびHPCソフトウェアスタックとの互換性により、エンタープライズ、クラウド、研究展開全体で幅広い適用性を保証します。です。ストレージに関しては、このアーキテクチャはサブ15μsの遅延でNVMe-oF over RoCEをサポートし、大規模トレーニングクラスター向けの共有分散ストレージを可能にします。
3. NVIDIA Mellanox MCX623106AN-CDATの役割と主な機能
このソリューションの基盤となるコンポーネントとして、MCX623106AN-CDATイーサネットアダプターカードは、アーキテクチャ内で4つの重要な役割を果たします。
| 機能 | 実装詳細 | ビジネス上のメリット |
|---|---|---|
| RDMA/RoCEエンジン | ECN/PFC、サブ0.6μs遅延、GPUDirectサポートを備えたハードウェアベースのRoCE v2 | CPUの関与はほぼゼロ。AIトレーニングで8倍高速なall-reduce |
| デュアルポート200GbE | 2つの独立したQSFP112ポート、400Gb/sの集約スループット | アクティブ・アクティブボンディングによる帯域幅。アクティブ・スタンバイによる冗長性 |
| PCIe 5.0インターフェイス | PCIe 5.0 x16(最大32 GT/s)、高度なDMAエンジン搭載 | 200GbEトラフィックのホストインターフェイスボトルネックを解消 |
| 仮想化とオーバーレイオフロード | ポートあたり最大512のVFを持つSR-IOV。VXLAN/NVGRE/IPsec/MACsecオフロード | セキュリティとラインレートパフォーマンスを備えた高密度マルチテナンシー |
から抽出された主な技術仕様MCX623106AN-CDAT ConnectXアダプターPCIeネットワークカードには、包括的なオフロード機能(チェックサム、LSO/LRO、VLANストリッピング/挿入、最大128キューのRSS)、高度な輻輳制御アルゴリズム、NVIDIAの集合通信ライブラリ(NCCL)の完全サポートが含まれます。には、PFCフレーム、ECNマーキングパケット、ドロップフレーム、リンクエラー、輻輳エポックのポートごとのカウンターが含まれています。は、100GbEおよび50GbEの互換性も強調しており、混在速度環境での展開の柔軟性を提供します。
4. 展開とスケーリングの推奨事項
グリーンフィールドAIクラスターの場合、200GbEアクセスと800GbEスパインアップリンクを備えた2層リーフ・スパイン・トポロジーを推奨します。各サーバーは、冗長性のために別々のリーフスイッチに接続された両方のQSFP112ポートを持つ総所有コストを評価する際、をホストします。RoCEファブリックには、すべてのスイッチで一貫したQoS設定が必要です。具体的には、優先度3(RDMA集合通信用)および優先度4(ストレージ用)でPFC、同じトラフィッククラスでECNマーキングを行います。監視とトラブルシューティングを簡素化するために、RDMA、管理、ストレージ、テナントトラフィックに別々のVLANを割り当てることを推奨します。
既存の100GbEインフラストラクチャを持つブラウンフィールド環境の場合、MCX623106AN-CDATイーサネットアダプターカードソリューションは、スムーズな移行パスを提供します。このアダプターは100GbE QSFP56オプティクスとの後方互換性があるため、200GbEへの段階的なアップグレード中に既存のケーブリングを再利用できます。また、アダプターはRoCEの有効化を必須としない標準イーサネットスイッチングをサポートしており、ファブリックが成熟し、ワークロードが移行を正当化するにつれて、チームはまずハードウェアを展開し、段階的にRDMA機能を有効にすることができます。
500ノードを超えるソリューションのスケーリングには、追加の考慮事項が必要です。NVIDIA Spectrum-4スイッチと組み込みテレメトリ、動的なECNしきい値調整を使用した専用のRoCE輻輳管理戦略の実装を推奨します。1,000ノードを超えるクラスターの場合、エンドツーエンドの可視性と自動構成の一貫性を維持するために、集中型ファブリック管理コントローラー(例:NVIDIA NetQ)の展開を検討してください。MCX623106AN-CDAT販売は、NVIDIAのグローバルチャネルパートナーを通じて提供され、包括的な保証とファームウェアアップデートサポートが含まれており、大規模環境での長期的な信頼性を保証します。
5. 運用、監視、トラブルシューティング、最適化
RoCEファブリックの効果的な運用には、多層的な監視およびトラブルシューティング戦略が必要です。
- アダプターレベルのテレメトリ:MCX623106AN-CDAT仕様には、PFCフレーム、ECNマーキングパケット、ドロップフレーム、リンクエラー、輻輳エポックのポートごとのカウンターが含まれています。mlx5cmd
、ethtool、またはNVIDIAファームウェアツールを使用して、これらのメトリックをPrometheus/Grafanaダッシュボードにエクスポートし、適切なアラートを設定します。インバンドネットワークテレメトリ(INT): - アダプターのINTサポートを活用して、ファブリック全体のフローごとの遅延とキューの深さを追跡し、マイクロ輻輳ソースの正確な特定を可能にします。スイッチレベルの監視:
- スパインおよびリーフスイッチのバッファ占有率、ポーズフレーム数、キューの深さ、ECNマーキング率を監視します。ポーズフレームの突然の増加は、ECNしきい値の調整が必要になる可能性のあるマイクロ輻輳を示します。アプリケーションレベルのメトリック:
- RDMAアプリケーションの場合、NVIDIA libibverbsおよびrdma-coreライブラリを使用して、WR(Work Request)完了遅延、CQ(Completion Queue)オーバーフローイベント、QP(Queue Pair)エラーカウントを追跡します。一般的なトラブルシューティングシナリオと推奨されるアクション:
RoCEパフォーマンスの低下:
- すべてのスイッチポートでPFCが有効になっていること、およびDSCPマーキングがスイッチ構成と一致していることを確認します。MCX623106AN-CDATデータシートMCX623106AN-CDAT ConnectXアダプターPCIeネットワークカードリンクのフラッピングまたはCRCエラー:
- QSFP112ケーブルの品質を確認します(200G AOCまたはDAC仕様に準拠していることを確認)。アダプターファームウェアが最新リリースに更新されていることを確認します。GPU Directパフォーマンスの問題:
- GPUDirectが正しく初期化されていること、およびPCIeトポロジーが中間スイッチなしでピアツーピアDMAをサポートしていることを確認します。PFCデッドロックまたはポーズストーム:
- 優先度の誤設定を確認し、PFCがRoCEトラフィッククラス(管理またはストレージトラフィックではない)でのみ有効になっていることを確認します。最適化については、広範なラボ検証に基づいた以下のチューニングパラメータを推奨します。
割り込み合算(モデレーション):
- 遅延を最小限に抑えつつCPU効率を維持するために、AIトレーニングワークロードでは2~4μsに設定します。RDMA MTU:
- all-reduce通信では4096バイトに増やし、プロトコルオーバーヘッドを削減してスループットを向上させます。RSS(受信側スケーリング):
- 非RDMAトラフィックでは複数のCPUコアに分散して処理し、単一コアの飽和を回避します。ECNしきい値:
- 優先度3トラフィックのバッファの最小しきい値を40%、最大しきい値を75%に設定し、観測された輻輳パターンとワークロード特性に基づいて調整します。6. まとめと価値評価
NVIDIA Mellanox MCX623106AN-CDAT
ソリューションは、最新のAIスケールデータセンターに革新的な価値をもたらします。ソフトウェアベースのTCP/IPをハードウェアアクセラレーションされたRDMA/RoCEおよびGPUDirectに置き換えることで、組織はアプリケーションレベルの遅延を8~10倍削減し、CPUネットワークオーバーヘッドを85%以上削減し、GPU使用率を70%未満から95%以上に向上させることができます。MCX623106AN-CDATイーサネットアダプターカードは、100GbEへの後方互換性と、新しいワークロード向けの将来性のあるオフロード機能による投資保護を備えた、200GbE導入への費用対効果の高いパスを提供します。総所有コストを評価する際、MCX623106AN-CDAT価格
は、トレーニング時間の短縮(市場投入までの時間の短縮)、サーバー数の削減(GPU使用率の向上による)、冷却コストの削減(MCX623106AN-CDAT互換<20W power draw), and elimination of separate InfiniBand fabrics. The solution is fully NVIDIA NCCL、PyTorch、TensorFlow、MPIライブラリを含む主要なAIおよびHPCソフトウェアスタックとの互換性により、エンタープライズ、クラウド、研究展開全体で幅広い適用性を保証します。詳細な展開スクリプト、構成テンプレート、パフォーマンスベンチマークレポートについては、公式のMCX623106AN-CDATデータシート
およびNVIDIAの包括的なネットワークドキュメントポータルを参照してください。このホワイトペーパーは基盤として機能します。アーキテクチャは検証済みで、コンポーネントは本番稼働準備ができており、メリットは測定可能です。MCX623106AN-CDAT ConnectXアダプターPCIeネットワークカードは単なるアダプターではありません。AI対応の超低遅延データセンターの未来を戦略的に実現するものです。

