NVIDIA Mellanox MCX623106AN-CDATサーバーアダプターの実働 | RDMA/RoCE低遅延トランスポートとサーバースループットの向上
July 22, 2026
NVIDIA Mellanox MCX623106AN-CDATサーバーアダプターの実働 | RDMA/RoCE低遅延トランスポートとサーバースループットの向上
背景と課題:200GbEがAIスケーリングの壁に直面したとき
急速に成長しているAI研究組織(「DeepCore Labs」と呼びましょう)は、クリティカルなスケーリングのボトルネックに直面していました。512基のNVIDIA H100 GPUを128ノードに分散させたフラッグシップ大規模言語モデルトレーニングクラスターは、64ノードを超えてスケールアップすると深刻なパフォーマンス低下を経験していました。問題はコンピューティングやメモリではなく、ネットワークファブリックでした。All-reduce同期勾配は1イテレーションあたり15秒以上かかり、ネットワークの停止によりGPU使用率はわずか62%に低下していました。ソフトウェアベースのTCP/IPに依存する既存の100GbEインフラストラクチャでは、分散トレーニングのバースト的でレイテンシに敏感な通信パターンに対応できませんでした。チームは、マイクロ秒レベルの決定論的なレイテンシでラインレート200GbEスループットを提供するソリューションを必要としていました。
彼らの評価は、NVIDIA Mellanox MCX623106AN-CDATへとつながりました。これは、最も要求の厳しいAIおよびHPCワークロード向けに設計された200GbEサーバーアダプターです。研究チームは、MCX623106AN-CDAT ConnectXアダプターPCIeネットワークカードが、ネットワークボトルネックを解消しGPU使用率を最大化するために必要な高度なオフロードとGPUDirect機能を提供することに気づきました。
ソリューション:MCX623106AN-CDATイーサネットアダプターカードの展開
DeepCore Labsは、128のトレーニングノードすべてにMCX623106AN-CDATイーサネットアダプターカードを展開しました。各サーバーには、NVIDIA Spectrum-4スイッチ上に構築されたリーフ・スパインファブリックに接続されたデュアルポートQSFP112アダプターが1基搭載されていました。この展開では、アダプターのネイティブRoCE v2サポートを活用してロスレスイーサネットトランスポートを有効にし、個別のInfiniBandファブリックの必要性をなくしました。ソリューションの鍵となったのは、アダプターのGPUDirect RDMA機能であり、CPUの介入なしにGPU間でネットワークを介した直接データ移動を可能にしました。これは同期オーバーヘッドを削減するための重要な機能でした。
チームは、スイッチレベルでPFC(Priority Flow Control)とECN(Explicit Congestion Notification)を設定し、コレクティブ通信トラフィックに優先度3、ストレージI/Oに優先度4を割り当てました。また、NVIDIAのアダプティブルーティングテクノロジーを実装してトラフィックを複数のパスに動的に分散させ、ホットスポットを最小限に抑えました。4週間以内に、トレーニングファブリック全体がRDMAで稼働し、512基のGPUすべてがRoCE上でシームレスに通信できるようになりました。MCX623106AN-CDAT互換エコシステムは堅牢であることが証明されました。カードはH100ベースのサーバーおよびNVIDIAのNCCL(NVIDIA Collective Communications Library)と変更なしでシームレスに統合されました。
チームは、MCX623106AN-CDATデータシートを参照して、バッファ割り当てと輻輳制御パラメータを微調整し、同期トレーニング(All-reduceが支配的)と非同期チェックポイントの両方を含む混合ワークロード環境で最適なパフォーマンスを達成しました。
測定可能な結果:スケーリング効率、スループット、GPU使用率
パフォーマンスの向上は変革的でした。RDMA over RoCEがNVIDIA Mellanox MCX623106AN-CDATを介して有効になったことで、All-reduce同期レイテンシは平均15.2秒から1イテレーションあたりわずか1.8秒に低下しました。これは8.4倍の改善です。これは直接、モデル収束の高速化につながりました。70Bパラメータモデルの総トレーニング時間は42日から19日に短縮され、研究サイクルが50%以上加速されました。
ネットワークの停止により62%に低迷していたGPU使用率は、アップグレード後に94%に跳ね上がり、実効コンピューティング能力が52%向上しました。アダプターの高度な順不同データ配置とパケットペーシングは、テールレイテンシのスパイクを引き起こしていたマイクロバーストを解消し、すべてのノードで一貫したパフォーマンスを確保しました。
トレーニングパフォーマンスを超えて、サーバーのスループット向上も同様に説得力がありました。ハードウェアオフロードエンジン(チェックサムオフロード、LSO/LRO、RoCEアクセラレーションを含む)は、ネットワーク処理のCPU使用率をすべてのノードで38%から4%未満に削減しました。これにより、以前は制約されていたデータ前処理、チェックポイント圧縮、その他の補助タスクに大幅なCPU容量が解放されました。
| メトリック | 変更前(レガシー100GbE NIC) | 変更後(MCX623106AN-CDAT) | 改善 |
|---|---|---|---|
| All-Reduceレイテンシ(イテレーションあたり) | 15.2秒 | 1.8秒 | 8.4倍高速 |
| GPU使用率 | 62% | 94% | 52%向上 |
| モデルトレーニング時間(70Bパラメータ) | 42日 | 19日 | 55%高速 |
| CPUネットワークオーバーヘッド | 38% | 4%未満 | 89%削減 |
| NVMe-oF読み取りレイテンシ(ストレージ) | 185μs | 12μs | 15倍高速 |
運用上のメリット:TCOとインフラストラクチャ効率
パフォーマンスの向上は劇的でしたが、運用上および財務上のメリットも同様に注目に値しました。MCX623106AN-CDATイーサネットアダプターカードソリューションは、個別のInfiniBandファブリックの必要性をなくすことで総所有コストを削減し、スイッチインフラストラクチャコストで50万ドル以上を節約しました。アダプターのエネルギー効率の高い設計(カードあたり20W未満)は、128ノードクラスター全体での測定可能な電力削減に貢献し、年間冷却費用を推定18%削減しました。
ITマネージャーがMCX623106AN-CDAT価格を代替ソリューションと比較して評価するにあたり、DeepCoreのインフラストラクチャディレクターは、投資回収期間が6ヶ月未満であったと述べました。これは主にトレーニング時間の短縮によるもので、製品開発パイプラインを直接加速しました。チームはまた、アダプターの将来性も高く評価しました。今日販売されている同じMCX623106AN-CDATは200GbEをサポートしていますが、100GbEおよび50GbEオプティクスとも互換性があり、ハイブリッド速度環境や段階的なアップグレードに柔軟性を提供します。
によるとMCX623106AN-CDAT仕様、アダプターには、インバンドネットワークテレメトリ(INT)やフローごとのレイテンシ追跡を含む包括的なテレメトリ機能が含まれています。DeepCoreはこれらのメトリックをPrometheus/Grafanaスタックに統合し、トレーニングパフォーマンスに影響を与える前にマイクロ輻輳をプロアクティブに検出できるようにしました。チームはまた、アダプターの輻輳制御アルゴリズムを活用してECNしきい値を動的に調整し、チェックポイント操作で追加のネットワーク負荷が発生した場合でもロスレス動作を維持しました。
概要と展望:AIスケールネットワーキングのブループリント
DeepCore LabsのNVIDIA Mellanox MCX623106AN-CDATとの旅は、AIインフラストラクチャを構築またはスケーリングする組織にとって、明確なブループリントを示しています。デュアルポート200GbEスループット、PCIe 5.0ホストインターフェイス、GPUDirect対応RDMAを組み合わせることで、MCX623106AN-CDATイーサネットアダプターカードは、ネットワークをスケーリングのボトルネックからパフォーマンスの乗数へと変革します。8.4倍高速なAll-reduce、94%のGPU使用率、55%高速なトレーニングサイクルといった結果は、最も要求の厳しいコンピューティング環境で具体的なビジネス成果をもたらすアダプターの能力を物語っています。
今後、モデルサイズが数ヶ月ごとに倍増し、分散トレーニングクラスターが数千のGPUに拡大するにつれて、MCX623106AN-CDAT ConnectXアダプターPCIeネットワークカードは、ロスレスで超低レイテンシのファブリックの強固な基盤を提供します。次のAIインフラストラクチャ投資を計画しているアーキテクトやITリーダーにとって、このアダプターは単なるコンポーネントではなく、競争優位性を実現するための戦略的なイネーブラーです。詳細なチューニングパラメータ、展開スクリプト、パフォーマンスベンチマークレポートは、公式のMCX623106AN-CDATデータシートで入手可能です。これは、大規模なAI展開に不可欠なリファレンスです。

