NVIDIA メラノックス MCX623106AN-CDAT サーバー アダプタ 技術ソリューション

June 10, 2026

NVIDIA メラノックス MCX623106AN-CDAT サーバー アダプタ 技術ソリューション

ネットワークアーキテクター,プレセールスエンジニア,オペレーションチームにNVIDIA メラノックス MCX623106AN-CDAT現代のデータセンター環境で RDMA/RoCE を使って 決定的な低レイテンシーを達成し サーバーのスループットを最大化する方法について説明します

1プロジェクト背景と要件分析

伝統的なTCP/IPスタックは,特にNVMe-oF,分散型データベースのアプリケーションのパフォーマンスを制限する重要なオーバーヘッドを導入します.AIのトレーニングクラスター次の世代のインフラストラクチャの主要な要件は以下のとおりである.

  • ストレージとリアルタイム分析のための端から端までの遅延時間 < 10μs
  • ビジネスロジックのためのフリーコアへのCPUバイパス (目標: <20%ネットワーク関連CPU使用)
  • 100GbEのリーフ・スピントポロジーでPFCとECNをサポートするLossless Ethernet fabric
  • 性能低下のないインライン暗号化 (IPsec/TLS)
  • 既存の自動化フレームワーク (Ansible,Terraform) とのシームレスな統合

2ネットワーク・システム・アーキテクチャ

リファレンスアーキテクチャは,全域に100GbEポートを搭載した2階層の葉骨トポロジーを採用している.各コンピューティング/ストレージノードは,MCX623106AN-CDAT ConnectX アダプタ PCIe ネットワーク カード設計の重要な要素:

  • Leaf スイッチ: 4MB の共有バッファー,PFC 優先度 3 (ストレージ) と 4 (AI トラフィック) で構成され,ECN マークドレッホは 200KB のキュー ディープ
  • スピーンスイッチ: ブロックしない12.8Tbpsのファブリック,3:1のオーバーサブスクリプション比 (東西パターンに最適化)
  • ホスト構成: PCIe 4.0 x16 (利用可能な場合は PCIe 5.0),アダプターあたり 256MB のファームウェアメモリ
  • RDMA 輸送: DCQCN 混雑制御の RoCEv2, 4K MTU, 256 バイトまでのインラインデータ

についてMCX623106AN-CDAT イーサネット アダプタカードソリューション1,024 つの仮想機能 (VF) と 256 つの物理機能 (PF) をサポートし,NFV およびコンテナ化されたワークロードに最適です.

3. NVIDIA Mellanox MCX623106AN-CDATの役割と主要機能

についてNVIDIA メラノックス MCX623106AN-CDATホストCPUからすべてのネットワーク処理をオフロードします.MCX623106AN-CDAT データシート公式MCX623106AN-CDATの仕様重要な能力には

特徴 RDMA/RoCEの給付金
ハードウェア・ステアリング (ASAP2) 特定のキューへの直接パケット ゼロCPU介入
On-chip RoCE 混雑管理について DCQCN 固件に実装された 100ns 応答粒度
GPUDirect® RDMA ホストメモリをバイパスするGPUメモリアクセス 2μs遅延削減
VIRTIO 加速 VM/コンテナネットワークのネイティブパフォーマンス

についてMCX623106AN-CDAT イーサネット アダプター カード金融や政府部門の厳格なセキュリティポリシーを満たす 安全なブートとフラッシュ暗号化も含まれています

4配備と拡大に関する勧告

アダプタが完全にMCX623106AN-CDAT対応既存の100GbEスイッチ (ブロードコム,メラノックス,シスコ) とファームウェアアップグレード後.推奨展開段階:

  • 第1段階 (実験室検証):2 つのストレージノード + 2 つのコンピューティングノード,ポートごとに PFC と ECN を有効にします. ib_write_bw で検証します. (ポートごとに目標 98Gb/s のスループット)
  • 第2段階 (パイロット):1つのフルラック (40ノード) で,ECNの限界値でDCQCNを展開する:min=150KB,max=500KB
  • 第3段階 (拡大):マルチラックとバックレイヤ,グローバルPFCパズフレームをモニター (総トラフィックの0.1%を保持)

拡張のために,アダプタはNVIDIAスペクトルスイッチで使用する場合,リンクアグリゲーション (LAG) と適応ルーティング (AR) をサポートします.混合速度環境 (100GbE から 25GbE) は,出口ポートにバッファ予約が必要です..

5運用,監視,トラブルシューティング

NVIDIA DOCA フレームワークは,包括的なテレメトリを提供します.基本的なモニタリングメトリックには以下が含まれます:

  • 列のカウンター:rdma_out_of_sequence,cnp_sent,cnp_received (ethtool -S を使って) について
  • PCIe 健康について修正可能な/修正できないエラー,リンク速度交渉 (mlxlinkツール)
  • 交通渋滞検出:PFCウォッチドッグタイマー,ECNマークされたパケット比率 (目標 <5%)

一般的なトラブルシューティング: RoCE 性能が 80Gb/s 以下に低下した場合,PCIe バイフォークション (x16 になる必要があります) を確認し,TSO/GRO を無効にし,スイッチ ECN 限界値を確認します.MCX623106AN-CDAT価格サーバー数を集約することで 9~12ヶ月以内に ROI を達成します.

6概要 価値評価

についてNVIDIA メラノックス MCX623106AN-CDATソフトウェアベースのネットワークと比較して,CPUオーバーヘッドを最大75%削減しながら,低レイテンシーで決定的な構造を提供します.このソリューションガイドは,詳細なアーキテクチャ設計,主要な機能,配備のステップ運営のベストプラクティスMCX623106AN-CDAT 販売中評価ユニットについては,認定販売業者と連絡することができます.MCX623106AN-CDAT データシート詳細にMCX623106AN-CDATの仕様要求に応じて利用できます