NVIDIA Mellanox 980-9I510-00NS00 テクニカル ホワイト ペーパー |高信頼性の接続性と運用の最適化

June 5, 2026

NVIDIA Mellanox 980-9I510-00NS00 テクニカル ホワイト ペーパー |高信頼性の接続性と運用の最適化

この技術白書では,NVIDIA メラノックス 980-9I510-00NS00現代のデータセンターとエンタープライズネットワークの基礎となる要素として 決定的な低レイテンシー,アクティブ・アクティブ・ハイ・アベイラビリティの 需要を拡大させています標準的なシャシーやオーバーレイによる設計の複雑さなく 効率的な運用テレメトリ.

1プロジェクト背景と要件分析

現在,データセンターのオペレーターは 3つの共通課題に直面しています.第一に,東西トラフィック (サーバーとストレージ) が支配しており,損失のない低ジッター転送が必要です.第二に,障害ドメインが拡大する一方で,メンテナンスウィンドウは縮小します3つ目に,運用チームはログ,SNMPアンケート,そしてCLI出力の差異によって手動的な相関によって圧倒されています.ある大手クラウドプロバイダは最近,ネットワーク関連のトラブルチケットの68%は,ハードウェア故障そのものではなく,遅延した故障隔離から生じていると定量化しましたこれらのプレッシャーは,高速な物理層の機能と内蔵された可視性と自動化に適したインターフェースを組み合わせた専用ネットワークデバイスの必要性を高めます.

建築家によって特定された主要な要件は,以下のとおりである: 50ms未満の故障切り替え,ハードウェア加速テレメトリ,ゼロタッチプロビジョニング (ZTP),および既存の光学およびケーブルプラントとの完全な互換性.980-9I510-00NS00ネットワーク製品評価のために選択されたのは,その特徴が直接これらの運用上の必要事項に映し出されているからです

2ネットワーク/システムアーキテクチャの設計

提案されたアーキテクチャは,高度な信頼性の接続性と運用効率の両方に最適化されたリーフ・脊柱トポロジーを採用しています.各リーフ・ブロックは2つのNVIDIA メラノックス 980-9I510-00NS00MLAGペアとして構成されたデバイスで,最大48のサーバー/ストレージノードを 100Gまたは 200Gブレイクアウト接続でサービスします.脊髄層は,完全なメッシュECMP設計で4つの独立した980-9I510-00NS00ユニットを使用,汎用ワークロードの 4:1オーバーサブスクリプションと,ストレージ/AIクラスターの 1:1 を提供する.すべての制御平面プロトコル (BGP,EVPN,PFC,ECN) はハードウェアデータ平面上で直接実行される.スローパスソフトウェアのボトルネックを取り除く.

既存のネットワークアドレシング,セキュリティポリシー,監視エージェントは変わっていない.980-9I510-00NS00 データセンター 高速ネットワークこの機能により, 200G ラインレートでも,切断転送の遅延は 600 ナノ秒未満に保たれます.メトロ・リンクのMACsec暗号化と帯域内テレメトリをサポートする.

3. NVIDIA Mellanox 980-9I510-00NS00の役割と主要な特徴

980-9I510-00NS00は,物理層とデータリンク層を統一する,トップ・オブ・ラックスイッチと脊髄相互接続要素の両方で機能する.その主要な技術的差別性は以下の通りである.

  • ハードウェア支援の故障切り替え:遅いSTPやオーバーレイタイマーに頼らずに,15ms未満のリンクアグリゲーショングループ (LAG) 障害切換
  • 深層バッファパイプライン:ポートグループごとに最大32MBの構成可能な共有バッファ,NVMe/TCPで一般的なマイクロバーストと分散型トレーニングワークロードを吸収する.
  • ストリーミングテレメトリ (gNMI/IPFIX):リアルタイムのキュー深さ,ドロップカウンター,PFCフレームカウントは1秒の粒度でコレクターに押し出されます.
  • 自動ケーブル診断:この装置は信号の整合性 (VCSEL状態,BER,温度) を継続的にモニターし,リンクフラップを引き起こす前に光学が悪化する信号を表示する.
  • オープンオートメーションエコシステムSONiC,Cumulus Linux,NVIDIAの独自の Onyx/FAST の完全なサポートにより,インフラストラクチャ・アス・コード・パイプラインが可能になります.

報告書によると,980-9I510-00NS00 データシートこのプラットフォームには,ハードウェアタイムスタンプリング (PTP/SyncE) と,通常,はるかに高い価格のシャーシシステムに留保されているインラインフロートラッキングの機能も含まれています.

4展開とスケーリングの推奨事項 (典型的なトポロジー)

典型的なラックレベルの展開は,簡単な2段階のプロセスをたどる.まず,2つの980-9I510-00NS00ユニットが1つのラックにインストールされ,200Gバックホールリンクと2つのMLAGピアリンクを通じて相互接続される.サーバーは2つのホームで,各葉に1つの接続があります.2つ目は,各ページペアが100Gまたは200Gリンクを使用して4つのスピンスイッチすべてに接続し,ブロックしないCLOSファブリックを形成します.さらに葉のペアが追加されspineが再構成されず,spineポートはルーティングされたECMPインターフェースとして事前に提供されています..

について980-9I510-00NS00 仕様柔軟なブレイクアウトモードをサポート:物理ポートごとに4x50G, 2x100G,または 1x200G,混合速度環境 (例えば,新しい100Gコンピューティングの隣にレガシー25Gストレージ) を可能にします.装置は完全に980-9I510-00NS00 互換性業界標準のSFP56/SFP112光学,DACケーブル,AOCを搭載し,移行リスクを軽減する.検証された基準設計では,金融取引所が4対から24対 (サーバーポート1152個以上) に拡大し,一つの脊柱配置ラインも変更しない.

5運用,監視,トラブルシューティング,最適化

運営の枠組みは 3つの柱に構築されています: 積極的な可視性,自動認証,ガイドされた修復.デバイスのストリーミングテレメトリは,PFCパウズフレームが設定可能な限界を超えたとき,またはリンクCRCエラーが上昇傾向にあるとき,警告を誘発するタイムシリアルデータベース (プロメテウス/TICKスタック) をフィードします.容量計画のためにも,歴史的なテレメトリデータを使用します.980-9I510-00NS00 ネットワーク製品ソリューションプリビルドの Grafana ダッシュボードを含みます. ポート利用量,バッファ占有率百分点,フローハッシュバランスを表示します.

CLI コマンド (ハードウェアの内部追跡を表示する) は,ナノ秒解像度のタイムスタンプとともに,混雑またはエラーを経験した最後の1,000パケットを記録します.これは診断までの平均時間 (MTTD) を劇的に短縮します.最適化勧告には,すべてのファブリック向きのポートでECNを有効にするが含まれます.PFCの限界値をバッファ深さの3/4に設定し,オーバーレイトラフィックにハードウェアのダイナミックロードバランス (DLB) を使用する.操作チームは,設定の漂流を検証する定期的な"健康証明書"スクリプトをスケジュールすることもできます.すべてのデバイスにケーブル BER を表示します

6概要 価値評価

導入するNVIDIA メラノックス 980-9I510-00NS00単一の葉の脊柱要素が4つの値次元で測定可能な改善をもたらすため:

  • 信頼性:決定的な15ms未満の故障オーバーと損失のないRoCE/ECN動作は,ほとんどのアプリケーション可視性障害を排除する.
  • 運用効率:ストリーミングテレメトリと自動ケーブル診断は,手動故障相関を60%以上削減します.
  • 総所有コスト (TCO)固定型因子価格設定 (固定型因子価格設定)980-9I510-00NS00価格100Gポートあたりモジュラー・シャシーより通常40~50%低) をゼロ・タッチプロビジョニングと組み合わせると,資本費と運用費の両方が低下します.
  • 投資保護デバイスは既にマークされています980-9I510-00NS00 販売主要な配送チャネルを通過し,バックグラウンド互換性により,現在の100G光学と将来の200G/400Gアップグレードの両方で使用できるようになります.

について980-9I510-00NS00 ネットワーク製品ソリューション高信頼性で操作が簡単なデータセンターファブリックへの実用的で即座に導入可能な道を提供します Network architects and IT managers seeking to reduce operational toil while guaranteeing wire‑speed performance should evaluate this platform as a key component of their next‑generation infrastructure roadmap.