Mellanox (NVIDIA Mellanox) 980-9I45J-00H010 ネットワーキング デバイス テクニカル ソリューション

July 17, 2026

Mellanox (NVIDIA Mellanox) 980-9I45J-00H010 ネットワーキング デバイス テクニカル ソリューション

メラノックス (NVIDIA メラノックス) 980-9I45J-00H010 ネットワークデバイス技術ソリューション 高い信頼性の接続性とデータセンターと企業ネットワークの運用最適化

1プロジェクト背景と要件分析

企業のデジタル変革が 最も深い段階に入っている今 データセンターネットワークは 前例のないパフォーマンスプレッシャーと 運用の複雑さに直面しています人工知能訓練クラスタの普及高性能データベース,分散型ストレージ,マイクロサービスアーキテクチャは,帯域幅,レイテンシー,管理可能性現代のデータセンターでは,東西のトラフィックが全体のスループットの75%以上を占めるので,ネットワークのボトルネックはしばしばビジネススケーラビリティに対する主要な制約になります.

これらの課題に対処するために,大規模なインターネットインフラストラクチャチームは,ネットワークアップグレードの明確な要件を確立しました.端から端まで10マイクロ秒未満のスイッチ遅延を達成し,リアルタイムリスク管理とオンライン推奨システムをサポートする.2つ目は,流量過密のシナリオでも RoCE トラフィックにゼロのパケット損失を維持する損失のないネットワーク環境を構築すること.障害物検定時間を15分未満に縮める統一的な運用可視性枠組みを確立する技術評価とPOCの検証の複数のラウンドの後,チームは最終的にメラノックス (NVIDIA メラノックス) 980-9I45J-00H010高信頼性と操作のシンプルさを 提供する次世代データセンターネットワークを構築する 核心ネットワークデバイスとして

2ネットワーク/システムアーキテクチャの設計

このソリューションは,Spin-Leaf2階建てのアーキテクチャを採用し,980-9I45J-00H010レイヤ3のルーティングの複雑さを簡素化しながら東西のスループットを最大化するように設計されています.980-9I45J-00H010Leafレイヤはサーバータイプ (コンピューティング,ストレージ,GPU加速) に基づいて対応するToRスイッチに接続する.すべての Spine-Leaf リンクは 100GbE または 200GbE で設定されていますこのアーキテクチャは,オーバーレイネットワーク (VXLAN) とアンダーレイネットワークの共存もサポートします.未来におけるハイブリッド・マルチ・クラウドの導入へのシームレスな進化を促進する.

操縦機でこのソリューションは,分散型BGP EVPNプロトコルと連携して作業する中央 SDN コントローラーを推奨し,自動化されたネットワークポリシー配布とレンタ隔離を可能にします.P4プログラム可能なパイプラインと流量加速エンジン980-9I45J-00H010帯域内ネットワークテレメトリなどの将来のカスタムデータ平面機能に十分な柔軟性を備える.

3ソリューションにおける"Mellanox (NVIDIA Mellanox) 980-9I45J-00H010"の役割と主要特徴

この建築の内部では,NVIDIA メラノックス 980-9I45J-00H010Spine スイッチングコアとネットワーク全体のクロックソースの二重役割を担っている.その最も顕著な技術機能には以下が含まれます:

  • 超低決定性遅延:カットスルー転送とダイナミック出力バッファスケジューリングを活用して,デバイスは 64 バイトの小パケットシナリオでも微秒未満のポート遅延を維持します.高周波取引とリアルタイムAI推論のための決定的ネットワーク保証を提供する.
  • インテリジェント 渋滞制御遠隔測定フィードバックループと協調して動作する適応型PFC (優先流量制御) とECN (明示的な混雑通知) アルゴリズムにより,980-9I45J-00H010 データセンター 高速ネットワークこの能力は,すべての負荷条件下で RoCEv2 トラフィックのパケット損失をゼロに保証します.
  • 高可用性と冗長性設計:二重冗長式ホットスワップ可能な電源とファン,N+1冗長アーキテクチャ,ISSU (In-Service Software Upgrade) は,サービス中断なくファームウェア更新とラインカード拡張を可能にします.
  • 深いプログラム可能性Support for P4 language and the Broadcom DNX family of programmable forwarding engines allows network architects to customize packet processing pipelines and introduce new protocol extensions without hardware replacement.
  • 総合的なテレメトリと観測能力ストリーミングテレメトリのハードウェアレベルでのサポート,キュー深度,バッファ利用,および各フローの遅延測定を含む.組織の既存のプロメテウスとELKモニタリングスタックに直接フィードします.

この特徴が組み合わせると,980-9I45J-00H010ネットワーク製品性能予測性と運用敏捷性の両方を要求する環境に非常に適しています.980-9I45J-00H010 互換性優れたベンダーから幅広い光学,ケーブル,サーバーNICを用意し,統合リスクを大幅に削減します.

4展開及び拡張に関する勧告 (典型的なトポロジー記述を含む)

緑地での新しい展開では,少なくとも4つの980-9I45J-00H010Spine 層のユニットは十分な冗長性と容量ヘッドルームを確保するために,各 Spine ユニットは2つまたは4つの 100GbE/200GbEリンクを通じて各 Leaf スイッチに接続し,フルメッシュトポロジーを形成します.葉のスイッチは,機能ゾーンに基づいてポッドに分類されるべきです.汎用サーバーのためのコンピューティングポッド,NVMe-oFとCephクラスターのためのストレージポッド,AIトレーニングワークロードを実行するGPUサーバーのための加速器ポッド.このゾーニングアプローチは,クロスポッドトラフィックを最小限に抑え,QoSポリシー設計を簡素化します.

拡大する際には,追加の980-9I45J-00H010装置は,最大 128 x 100GbE ポートを各シャシーに対応する.成長の余地があるブラウンフィールド環境では,980-9I45J-00H010既存のレガシーコアスイッチの上に"スーパー脊柱"アグリゲーション層として展開され,後方互換性を維持しながら,徐々にトラフィックを新しいファブリックに移行できます.

詳細な展開パラメータは,バッファ割り当てプロファイル,PFCの限界値,ECNのマークを含む980-9I45J-00H010 データシートデバイスを特定のワークロード特性に調整するための包括的なガイドラインを提供します.データシートには,AIトレーニングなどの一般的な使用事例のための検証された構成も含まれています.HPC バッチスケジュールデータベースの複製です

5運用監視,トラブルシューティング,最適化勧告

運用能力を最大限に活用する980-9I45J-00H010 ネットワーク製品ソリューション3段階のモニタリングの枠組みを導入することを推奨します.

  • レベル1 リアルタイム可視性:デバイスから gRPC ベースのデータを 100 ミリ秒ごとに消費するストリーミング テレメトリ 収集機を展開します. キーメトリックには,ポート利用,優先グループごとにバッファの占有,PFCの停止フレーム数これらのメトリックは,自動警告ポリシーを持つカスタム化されたGrafanaダッシュボードで可視化されるべきです.
  • レベル2 積極的な健康評価日々の自動スクリプトを予定して デバイスの内部診断ログ,温度センサー,電源の状態を 問い合わせるFEC (Forward Error Correction) の修正の上昇傾向など性能低下が顕著になる前に メンテナンス・チケットを起動させる必要があります
  • レベル3 ディープパケット検査と法医分析:sFlow または IPFIX サンプリングを設定可能な速さで有効にして,オフライン分析のためのトラフィックフローを記録する.このデータは,単一の総計数器で目に見えないマイクロバーストパターンや騒々しい隣人の問題を特定するためにアプリケーションログと関連付けることができます..

特定の問題のトラブルシューティングのために,デバイスの組み込みパケットキャプチャとミラーリング機能により,オペレーターは生産トラフィックに影響を及ぼさずに問題のある流れを隔離することができます.について980-9I45J-00H010 仕様詳細なパフォーマンス曲線を様々なパケットサイズとミックスパターンに含め,実際のパフォーマンスを比較できる基準基準として使用する.

最適化勧告は2つの分野に焦点を当てています. (a) 偏振を避けるためにECMPハッシングアルゴリズムを微調整し,特にリーフスイッチが対称性のないリンク数を持つ場合.そして (b) PFC ウォッチドッグ タイマーを調整し,持続的な休止嵐が全組織に広がらないようにする.980-9I45J-00H010価格運営効率の向上とともに所有総コストに考慮すると,パフォーマンスと管理性の両方を求める組織にとって説得力のある価値提案を示しています..

6概要と価値評価

についてメラノックス (NVIDIA メラノックス) 980-9I45J-00H010高性能ネットワークと精簡化された運用の2つの要求に収束した解決策です. プログラム可能で,テレメトリに富んだ,非常に信頼性の高いスイッチングコアとして機能することで,AI/MLの作業負荷をサポートし,同時に運用上のオーバーヘッドを削減するこの文書に概説されたアーキテクチャは,毎日5PB以上のトラフィックを処理する生産環境で検証されており,その拡張性と強度が確認されています.

次の世代ネットワークインフラストラクチャを評価する組織では,980-9I45J-00H010遅延削減,パケット損失排除によって測定されるか,MTTR の改善この値が980-9I45J-00H010 ネットワーク製品ソリューションこのデバイスは現在,認証されたNVIDIA Mellanoxパートナーを通じて利用可能で,980-9I45J-00H010 販売迅速な配備スケジュールを満たすように配置された在庫.