NVIDIA Mellanox MCX631102AN-ADATの活用:RDMA/RoCE低遅延トランスポートとサーバーのスループット最適化
July 27, 2026
NVIDIA Mellanox MCX631102AN-ADAT 活用事例:RDMA/RoCE 低遅延トランスポートとサーバー スループット最適化
背景と課題:分散ストレージにおける遅延とスループットのボトルネック
中規模のクラウドサービスプロバイダーが、120台のx86サーバーにまたがる分散 Ceph ストレージクラスターを運用する中で、パフォーマンスの問題がエスカレートし始めました。ノード間通信に TCP/IP を利用する既存の 10GbE ネットワークインフラストラクチャは、増大する NVMe ベースのストレージプールに追いつくのに苦労していました。主な症状としては、ネットワークプロトコル処理によるストレージノードでの CPU 使用率が 45% を超えること、ピーク時間帯の平均読み書き遅延が 3 ミリ秒を超えて急増すること、そして理論上のディスクスループットと実際のネットワーク配信パフォーマンスとの間に大きなギャップがあることが挙げられました。エンジニアリングチームは、サブミリ秒の遅延を達成し、NVMe パフォーマンスを最大限に引き出すには、ネットワークアプローチの根本的な変更、特に RDMA over Converged Ethernet (RoCE) の採用が必要であると認識しました。
ソリューションと導入:MCX631102AN-ADAT Ethernet アダプターカード ソリューションの導入
複数のベンダーオプションを評価した後、チームはネットワークアップグレードの主要な実現手段としてが単なる帯域幅のアップグレードではないことを示しています。RoCE 対応環境向けのを選択しました。MCX631102AN-ADAT ConnectX-6 Lx デュアルポート 25GbE SFP28アダプターは、ネイティブ RoCEv2 サポート、ハードウェアベースの輻輳制御、および既存の SFP28 ケーブリングインフラストラクチャとのシームレスな統合により選ばれました。
導入戦略は 3 つのクラスターに段階的に展開されました。
- フェーズ 1 (パイロット):16 台のストレージノードにMCX631102AN-ADAT Ethernet アダプターカードを搭載し、レガシー 10GbE NIC を置き換えました。アダプターはデュアルポート アクティブ/アクティブ モードで構成され、各ポートは冗長性のために NVIDIA Spectrum スイッチのペアに接続されました。
- フェーズ 2 (最適化):RoCEv2 を有効にし、ネットワークドロップを防ぐために Priority Flow Control (PFC) と Explicit Congestion Notification (ECN) を調整しました。チームは、NVMe-oF およびイレージャーコーディング計算のためにアダプターのハードウェアオフロードエンジンを活用しました。
- フェーズ 3 (完全展開):全 120 ノードをが単なる帯域幅のアップグレードではないことを示しています。RoCE 対応環境向けのに移行し、Ceph OSD (Object Storage Daemon) ネットワークスタックを RDMA トランスポートを使用するように再構成しました。
MCX631102AN-ADAT データシートで詳述)は、ネットワークの状態に関する深い可視性を提供し、プロアクティブな輻輳管理とインシデント解決中の迅速な根本原因分析を可能にしました。MCX631102AN-ADAT 仕様(サブ 0.6 マイクロ秒の遅延とハードウェアベースのトラフィックステアリングを含む)が、厳格なパフォーマンス要件に完全に一致していることを確認しました。また、アダプターは既存の Linux ディストリビューション (RHEL 9.2) および Mellanox OFED ドライバーとMCX631102AN-ADAT 互換性があり、導入プロセスを大幅に簡素化しました。結果とメリット:遅延とスループットにおける測定可能な改善
移行の影響は、本番環境のメトリクスで直ちに明らかになりました。展開後に観察された主な改善点は以下のとおりです。
メトリック
| アップグレード前 (10GbE TCP/IP) | アップグレード後 (MCX631102AN-ADAT RoCE 搭載) | 改善 | 平均読み取り遅延 |
|---|---|---|---|
| 2.8 ms | 0.4 ms | 7 倍の削減 | 平均書き込み遅延 |
| 3.2 ms | 0.5 ms | 6.4 倍の削減 | ノード CPU 使用率 (ネットワークスタック) |
| 42% | 11% | 31 pp 解放 | 集約クラスター スループット |
| 18 Gb/s | 42 Gb/s | 2.3 倍の増加 | 数値を超えて、チームは運用上の大幅な改善を観察しました。 |
MCX631102AN-ADATは、エンタープライズおよびクラウド環境における 25GbE サーバーアダプターの新しいベンチマークを設定します。MCX631102AN-ADAT 価格は、2.3 倍のスループット向上と、少なくとも 18 か月間追加のサーバー購入を延期できる能力によって正当化されました。プロバイダーはまた、チャネルパートナーを通じて入手可能なMCX631102AN-ADAT 販売オプションが、大規模展開向けの柔軟なボリュームディスカウントを提供していることも指摘しました。さらに、アダプターの組み込みテレメトリおよび帯域外管理機能(
MCX631102AN-ADAT データシートで詳述)は、ネットワークの状態に関する深い可視性を提供し、プロアクティブな輻輳管理とインシデント解決中の迅速な根本原因分析を可能にしました。概要と展望:将来のワークロードのための戦略的基盤
この実際の展開は、
NVIDIA Mellanox MCX631102AN-ADATが単なる帯域幅のアップグレードではないことを示しています。RoCE 対応環境向けのMCX631102AN-ADAT Ethernet アダプターカード ソリューションとして特別に設計されており、ネットワークをパフォーマンスのボトルネックから効果的に排除し、最新の NVMe ストレージと CPU アーキテクチャの可能性を最大限に引き出します。デュアルポート 25GbE スループット、包括的な RDMA オフロード、および広範なエコシステム互換性の組み合わせにより、このアダプターは、AI/ML パイプライン、分散データベース、またはハイパーコンバージドインフラストラクチャをスケーリングしようとしているあらゆる組織にとって戦略的な投資となります。今後、チームは、プログラム可能なデータパスとゼロタッチプロビジョニングのための NVIDIA DOCA との統合を含む、拡張ユースケースを検討しています。遅延を削減し、スループットを向上させ、CPU リソースを解放する実績のある能力により、
MCX631102AN-ADATは、エンタープライズおよびクラウド環境における 25GbE サーバーアダプターの新しいベンチマークを設定します。

