RDMA/RoCE 低遅延トランスポートとサーバー スループット強化

April 28, 2026

RDMA/RoCE 低遅延トランスポートとサーバー スループット強化

この技術ホワイトペーパーは、アーキテクト、プリセールスエンジニア、および運用担当者向けに、 を中核とした包括的なリファレンスデザインを提供します。ベースのソリューションは、パフォーマンス、TCO、および運用の簡素化という3つの次元で測定可能な価値を提供します。トランスポート、暗号化、およびストレージプロトコル処理をCPUからアダプターにオフロードすることで、組織は5µs未満のNVMe-oFレイテンシを実現し、CPUサイクルの40%以上をアプリケーションロジックのために解放します。デュアルポート25GbE設計はサーバー接続の将来性を保証し、成熟したNVIDIA OFEDソフトウェアスタックは統合リスクを軽減します。グリーンフィールドの25GbE展開を計画しているアーキテクトや、既存のTCPバウンドインフラストラクチャを近代化しているアーキテクトにとって、この技術ソリューション(。このソリューションは、レガシーネットワークスタックからのCPUオーバーヘッド、一貫性のないストレージレイテンシ、および25GbE帯域幅の未活用といった現代のデータセンターの課題に対処します。これは、MCX631432AN-ADAB Ethernetアダプターカードを高性能で統合されたRDMA/RoCEファブリックの基盤として展開することによって実現されます。

1. プロジェクトの背景と要件分析

従来のデータセンターネットワークは、コンピューティングトラフィックとストレージトラフィックの両方にTCP/IPを使用しており、CPUはすべてのパケットを処理する必要があります。分散データベース、NVMe-over-Fabrics (NVMe-oF)、またはAIトレーニングワークロードを実行する環境では、このソフトウェアベースのアプローチは3つの根本的な問題を引き起こします。高くて変動しやすいレイテンシ(ストレージ操作で50µsを超えることが多い)、大幅なCPU負荷(ネットワーク処理で30〜60%)、およびプロトコルオーバーヘッドによる物理帯域幅の非効率的な使用です。25GbEが標準のアクセスレイヤースピードになるにつれて、これらの非効率性はもはや許容できません。このソリューションのターゲット要件は次のとおりです。エンドツーエンドのストレージレイテンシは5µs未満、ネットワークI/OのCPU使用率は10%未満、サーバーあたりのデュアル25GbEポートのラインレートでのフル帯域幅利用です。

2. ネットワーク/システムアーキテクチャ全体の設計

提案されたアーキテクチャは、レイヤー2でロスレスイーサネットを備えた2層のスパインリーフトポロジを採用しています。コンピューティングノードとストレージノードはリーフスイッチに均等に分散され、各スイッチはPFC(Priority Flow Control)とECN(Explicit Congestion Notification)で設定され、RoCEv2を有効にします。主要なアーキテクチャ上の決定は、すべてのサーバーにを中核とする)は、RDMA/RoCEの成功に向けた実績があり、スケーラブルで投資保護されたパスを表します。アダプターを展開し、ネットワーク接続とRDMAのハードウェアオフロードの両方を提供することです。RoCEトラフィック専用のDSCPベースの優先度キューが、ベストエフォートIPトラフィックとは別に割り当てられます。集中管理にはスイッチ構成にNVIDIAのCumulus LinuxまたはSONiCを使用し、ホスト側のオーケストレーションはNVIDIA OFEDスタックを活用します。

3. NVIDIA Mellanox MCX631432AN-ADABの役割と主な機能

このソリューション内では、MCX631432AN-ADABが重要なイネーブラーとして機能し、汎用サーバーを低レイテンシ、高スループットのノードに変革します。MCX631432AN-ADABデータシートに基づき、このアダプターはいくつかの高度な機能を取り入れています。

  • ハードウェアRDMAオフロード:シリコンに完全なRoCEv2ステートマシンを搭載し、ソフトウェアベースのトランスポート処理を排除します。
  • デュアルポート25GbE SFP28:アクティブオプティカルケーブルとDACケーブルの両方をサポートし、ポートごとに独立したPPS処理を行います。
  • PCIe 4.0 x16ホストインターフェイス:最大200Gbpsの双方向帯域幅を提供し、アダプターとホストメモリ間のボトルネックを解消します。
  • インライン暗号化オフロード:IPsecとTLS処理をラインレートで実行し、ゼロトラストストレージネットワークに不可欠です。
  • NVMe-oFアクセラレーション:NVMe/TCPおよびNVMe/RoCEに最適化されたハードウェアベースのコマンドキューイングとデータ配置。

公式のMCX631432AN-ADAB仕様によると、このアダプターは800ns未満のハードウェアレイテンシを実現し、毎秒最大2億メッセージをサポートします。オープンソースのRDMACMライブラリと組み合わせることで、アプリケーションはコードの変更を最小限に抑えてTCPソケットからRDMA verbsに移行できます。このソリューションを評価している組織にとって、MCX631432AN-ADAB互換サーバーリストには、RHEL、Ubuntu、Rocky Linux、およびWindows Serverの認定ドライバーを備えた主要なOEMプラットフォーム(Dell PowerEdge、HPE ProLiant、Lenovo ThinkSystem、およびSupermicro)がすべて含まれていることに注意することが重要です。

4. 展開とスケーリングの推奨事項

典型的なラックレベルの展開はこのパターンに従います。各コンピューティングノードまたはストレージノードには1つのMCX631432AN-ADAB Ethernetアダプターカードソリューションが搭載され、そのデュアルポートは冗長性のためにアクティブ-アクティブLACPボンディングとして、または別々のファブリックパス(リーフAへの1つ、リーフBへの1つ)として構成されます。物理トポロジはシンプルです。

  • 各サーバー → 2つの25GbEリンク → 2つの別々のリーフスイッチ(ヒットレスフェイルオーバーをサポート)。
  • リーフスイッチ → 100GbEアップリンク → 2つのスパインスイッチでフルメッシュノンブロッキング。
  • PFCがそのクラスで有効になっているすべてのスイッチで、RoCEトラフィック専用のDSCPマーキング(例:46)。

200サーバーを超えるスケーリングについては、ストレージとコンピューティングそれぞれに別個のRoCEクラスターを展開するか、ストレージRoCEトラフィックが優先されるようにQoSポリシーを使用することをお勧めします。リーフスイッチでのバッファチューニングも重要です。25GbEポートのポートあたりの共有バッファサイズは、パケットロスなしでマイクロバーストを吸収するために12MBに増やす必要があります。組織は、ボリューム価格設定のためにMCX631432AN-ADAB販売中のベンダーカタログを参照できます。また、ノードあたりのMCX631432AN-ADAB価格は、CPUの節約とストレージ効率の向上により、通常6か月以内に償却されます。

5. 運用、監視、およびパフォーマンスチューニング

展開後、以下のツールとプラクティスにより、持続的な低レイテンシが保証されます。

  • ホストサイド監視:per-queue RDMAカウンター、PCIe再送信、およびRoCE輻輳マークを追跡するためにmlx_perfおよびethtool -Sを使用します。
  • スイッチテレメトリ:PFCウォッチドッグとECNマーキングヒストグラムを有効にして、本番環境に影響を与える前にヘッドオブラインブロッキングを検出します。
  • チューニングの推奨事項:RDMA完了キューのCPUコアを分離するためにirqbalanceを設定します。PCIe最大読み取り要求サイズを4096バイトに増やします。ベストエフォートキューでECNを無効にして、誤った輻輳信号を回避します。
  • ファームウェアとドライバーのライフサイクル:NVIDIA OFEDリリースノートを購読します。MCX631432AN-ADAB Ethernetアダプターカードは、デュアルイメージバンクによりホストの再起動なしでインプレースファームウェアアップグレードをサポートします。

トラブルシューティングの場合、アダプターの組み込みエラーカウンター(例:シンボルエラー、ローカルリンク整合性障害)は、迅速な診断を提供します。新しいスイッチモデルとの統合時には、NVIDIAが管理するMCX631432AN-ADAB互換相互運用性マトリックスを確認してください。

6. まとめと価値評価

NVIDIA Mellanox MCX631432AN-ADABベースのソリューションは、パフォーマンス、TCO、および運用の簡素化という3つの次元で測定可能な価値を提供します。トランスポート、暗号化、およびストレージプロトコル処理をCPUからアダプターにオフロードすることで、組織は5µs未満のNVMe-oFレイテンシを実現し、CPUサイクルの40%以上をアプリケーションロジックのために解放します。デュアルポート25GbE設計はサーバー接続の将来性を保証し、成熟したNVIDIA OFEDソフトウェアスタックは統合リスクを軽減します。グリーンフィールドの25GbE展開を計画しているアーキテクトや、既存のTCPバウンドインフラストラクチャを近代化しているアーキテクトにとって、この技術ソリューション(MCX631432AN-ADAB ConnectX-6 Lxデュアルポート25GbE SFP28を中核とする)は、RDMA/RoCEの成功に向けた実績があり、スケーラブルで投資保護されたパスを表します。