Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand スイッチの実践

July 15, 2026

最新の会社ニュース Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand スイッチの実践

メラノックス (NVIDIA メラノックス) 920-9B210-00FN-0D0 インフィニバンドスイッチを実用化します

背景と課題:クラスタースケールが相互接続のボトルネックに遭遇したとき

インターネットのトップ企業の AI研究部門は 馴染みのある交差点に立たされました成長するGPUサーバーの艦隊は,複数のラックに広がり,大規模な言語モデルの訓練のためにますます使用され,予測不能な作業完了時間に苦しんでいました.既存のイーサネットベースの構造は,汎用的なワークロードに適しているものの,分散訓練の同期,爆発的なトラフィックパターンを処理できませんでした.パケットの落下やインカストの混雑により定期的に停止しますインフラストラクチャのチームは バックエンドネットワークの RDMA トラフィック処理方法に 根本的な変化が必要でしたデータセンターのアーキテクチャを 改造することなく.

ソリューション設計: 920-9B210-00FN-0D0 インフィニバンドスイッチ OPN を展開

複数のインターコネクトオプションを評価した後,チームはメラノックス (NVIDIA メラノックス) 920-9B210-00FN-0D0この展開は2階層のリーフ・脊髄トポロジーを中心に,リーフ・スイッチは各リーフ・スイッチが400Gb/sリンクを通じて最大40のGPUノードに接続している.920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRこのバージョンは,ブロックしないアーキテクチャと統合された SHARPv3 ネットワーク内コンピューティング機能のために特別に選択されました.チームに 直接スイッチの構造に コレクティブ・コミュニケーション・オペレーションをオフロードできるようにしましたCPUのオーバーヘッドを削減し,実際の計算のために GPU サイクルを解放します.

物理的な展開の観点から,スイッチは,既存のホット・ korridor/コールド・ korridor構成にマッチするために,前から後ろの空気流でインストールされました.920-9B210-00FN-0D0 データシートQSFP-DDトランシーバーを使用して,ケーブルを一貫して保持し,920-9B210-00FN-0D0対応する100mまでの脊髄から葉への接続を含む リンク予算全体で検証された光学

配備方法:段階的な統合

  • 実験室での検証8つのGPUノードと2つのスイッチを備えた小規模テストベッドが,レイテンシーとスループットをベンチマークするために使用されました.NVIDIA メラノックス 920-9B210-00FN-0D0前世代のHDRに比べて60%改善した.
  • 段階的な展開:チームは NVIDIA の Unified Fabric Manager を使って リアルタイムでリンクの健康と混雑メトリックを監視し 訓練パッドを"つずつ移行しました継続的な生産作業の混乱を最小限に抑える.
  • 段階3 完全統合全18つのスイッチは3つのラックに展開され,400Gb/sのアップリンクを持つ完全にブロックしない脊柱を形成した.アダプティブ・ルーティングにより,トラフィックを動的にバランスさせ,ピークの求人中にオーバーサブスクリプションを回避することが可能になった..

エンジニアリングチームは,総合的な920-9B210-00FN-0D0 仕様スイッチの高度なテレメトリにより,ポート毎のエラー数とリンク利用率を詳細に把握できます.積極的なメンテナンスと容量プランニングを可能にする.

測定可能な結果と運用上の利益

標準的な1024GPUトレーニングの完了時間は 12.3秒から 7.8秒に低下しました通信コストを37%削減する典型的なGPT型のモデルでの作業完了時間がほぼ30%改善され,研究チームは毎週より多くの実験を実行できるようになりました.SHARPv3エンジンは 平均18%の作業を処理しました訓練実行ごとに GPU の利用率が高く エネルギー消費が低くなります

ネットワーク関連の仕事失敗が少なく,リンクレベルの問題を診断するのに費やされた時間が大幅に少なくなりました.920-9B210-00FN-0D0 インフィニバンドスイッチ OPN ソリューション3ヶ月間の観測期間中に計画外の中断がゼロで,驚くほど安定していました.統一管理インターフェイスは,ネットワーク運用チームのための学習曲線を削減しました.単一のガラスのパネルを通して 全体の布を管理できる.

費用 と 調達 に 関する 考え方

初期には920-9B210-00FN-0D0価格スイッチをプレミアム端に配置すると 総所有コスト分析は別の物語を語りました同等のコンピューティング容量に対するクラウドインスタンスのコストの22%削減を達成さらに,920-9B210-00FN-0D0 販売中複数のチャネルパートナーを通じて競争的な入札を許可し,NVIDIA Mellanoxの長期的なサポートコミットメントは投資への信頼をもたらしました.

概要と展望:次世代AIインフラストラクチャの青写真

開発を推進するメラノックス (NVIDIA メラノックス) 920-9B210-00FN-0D0この大規模なAI研究施設では,類似の相互接続課題に直面している組織にとって説得力のある参照アーキテクチャとして機能します.微秒未満の遅延ネットワークアーキテクトは,RDMAベースのHPCとAIクラスタの核心の痛みを解決します.920-9B210-00FN-0D0 インフィニバンドスイッチ OPNITマネージャーは,強力な管理ツールと包括的な管理システムに頼ることができます.920-9B210-00FN-0D0 データシート容量計画について

組織は既に 組織を拡大し 大きいGPUクラスターをサポートする予定です追加のストレージのオフロードとセキュリティ隔離のためのBlueField-3 DPUの統合を含む..920-9B210-00FN-0D0対応するAIやHPCワークロードを大規模に展開する企業にとって,AIやHPCは,このスイッチは 漸進的なアップグレードだけでなく スケールでのパフォーマンスの基本的推進力でもあります.