Référence Technique NVIDIA Mellanox 920-9B210-00FN-0D0 : Optimisation de l'interconnexion à faible latence NDR 400 Gb/s

August 26, 2026

Référence Technique NVIDIA Mellanox 920-9B210-00FN-0D0 : Optimisation de l'interconnexion à faible latence NDR 400 Gb/s

Référence technique NVIDIA Mellanox 920-9B210-00FN-0D0 : Optimisation de l'interconnexion à faible latence 400 Gb/s NDR pour les clusters RDMA/HPC/IA

1. Contexte du projet et analyse des exigences

Alors que les clusters d'entraînement IA dépassent les 4 000 GPU et que les simulations HPC approchent les performances exascale, les fabrics réseau sont confrontés à des exigences sans précédent en matière de bande passante, de latence et de déterminisme. Le passage de 200 Gb/s HDR à 400 Gb/s NDR n'est plus une option pour les organisations ciblant des modèles à mille milliards de paramètres ou des simulations météorologiques à l'échelle du kilomètre — c'est un impératif stratégique. Les exigences clés identifiées dans les déploiements de recherche et d'entreprise de premier plan comprennent :

  • Latence déterministe ultra-faible : Latence de port à port inférieure à 100 ns pour minimiser la surcharge de communication MPI et all-to-all.
  • Fabric sans perte à grande échelle : Zéro perte de paquets en cas de congestion sur des milliers de points d'extrémité, garantissant que les performances RDMA restent prévisibles.
  • Déchargement de calcul dans le réseau : Déchargement des opérations collectives (all-reduce, all-to-all, broadcast) vers le fabric réseau pour maximiser l'utilisation des GPU.
  • Scalabilité à haute radix : Prise en charge des topologies fat-tree et dragonfly+ à grande échelle avec une bande passante de bissection complète jusqu'à plus de 8 000 nœuds.
  • Protection de l'investissement : Compatibilité transparente avec les câbles, optiques et outils de gestion HDR existants pour permettre des mises à niveau progressives.

Pour répondre à ces exigences, cette solution adopte le NVIDIA Mellanox 920-9B210-00FN-0D0 comme bloc de construction principal — un commutateur InfiniBand NDR 400 Gb/s qui offre la densité, les performances et l'intelligence requises pour les déploiements de classe exascale.

2. Conception globale de l'architecture réseau

La solution proposée utilise une topologie leaf-spine à deux niveaux, qui fournit un fabric évolutif et non bloquant avec une latence déterministe et un câblage simplifié. Au niveau leaf, chaque rack de calcul est équipé d'une ou deux unités 920-9B210-00FN-0D0 InfiniBand switch OPN, offrant 64 ports de connectivité NDR 400 Gb/s aux serveurs GPU via des câbles DAC (direct-attach copper) OSFP-à-OSFP ou des câbles optiques actifs (AOC). Au niveau spine, un deuxième niveau de commutateurs 920-9B210-00FN-0D0 MQM9790-NS2F 400 Gb/s NDR interconnecte tous les commutateurs leaf, créant un fabric fat-tree à bande passante de bissection complète.

Pour les clusters dépassant 5 000 nœuds, une architecture folded-Clos à trois niveaux peut être mise en œuvre, le 920-9B210-00FN-0D0 servant à la fois de leaf et de spine pour maintenir des performances constantes à tous les niveaux. Le commutateur prend en charge jusqu'à 64 commutateurs dans un seul fabric sous un seul gestionnaire de sous-réseau, permettant un contrôle unifié des topologies à grande échelle.

Le tableau suivant résume les paramètres clés de mise à l'échelle pour un fabric NDR à 2 niveaux basé sur le 920-9B210-00FN-0D0 :

Composant Spécification Valeur
Commutateurs Leaf 920-9B210-00FN-0D0 1 à 2 par rack
Commutateurs Spine 920-9B210-00FN-0D0 N/2 (N = nombre de commutateurs Leaf)
Points d'extrémité max. Serveurs GPU Jusqu'à 4 096 (radix 64 ports)
Bande passante de bissection Non bloquant complet 51,2 Tbit/s par niveau Spine

3. Rôle et caractéristiques clés du NVIDIA Mellanox 920-9B210-00FN-0D0

Dans cette architecture, le NVIDIA Mellanox 920-9B210-00FN-0D0 sert d'élément de commutation fondamental, fournissant plusieurs capacités critiques qui répondent directement aux exigences identifiées dans la section 1 :

  • 64 ports NDR 400 Gb/s : Chaque port OSFP prend en charge 400 Gb/s bidirectionnels avec correction d'erreurs directe (FEC) pour une connectivité fiable à longue portée. La capacité de commutation agrégée de 51,2 Tbit/s offre une marge suffisante, même pour les charges de travail les plus intensives en communication.
  • Latence de coupure ultra-faible : Latence de port à port inférieure à 100 ns, comme documenté dans la fiche technique détaillée du 920-9B210-00FN-0D0, garantit une surcharge minimale pour les opérations MPI et RDMA.
  • SHARPv3 intégré (Scalable Hierarchical Aggregation and Reduction Protocol) : Décharge les opérations collectives des CPU hôtes, réduisant la latence all-reduce jusqu'à 40 % et all-to-all jusqu'à 35 % dans les travaux à grande échelle.
  • Routage adaptatif et contrôle de congestion : Réachemine dynamiquement le trafic pour éviter les points chauds, garantissant des performances prévisibles dans des modèles de trafic adverses. La télémétrie avancée fournit une visibilité par flux et par port pour une gestion proactive.
  • Gérabilité complète : Intégration complète avec le Unified Fabric Manager (UFM) de NVIDIA pour le provisionnement sans intervention, la surveillance de l'état et le basculement automatisé.

Le spécifications du 920-9B210-00FN-0D0 mettent également en évidence des alimentations redondantes doubles, des modules de ventilateur remplaçables à chaud et la prise en charge de configurations de gestionnaire de sous-réseau redondantes, garantissant une disponibilité de 99,999 % pour les charges de travail critiques.

4. Recommandations de déploiement et de mise à l'échelle

Pour les organisations qui prévoient d'adopter la solution 920-9B210-00FN-0D0 InfiniBand switch OPN, les directives de déploiement suivantes sont recommandées :

  • Stratégie de câblage : Utilisez des câbles DAC OSFP-à-OSFP pour les connexions intra-rack (jusqu'à 3 m) et des câbles AOC ou des émetteurs-récepteurs optiques pour les liaisons inter-racks et spine-leaf (jusqu'à 100 m). Vérifiez que tous les câbles sont compatibles avec le 920-9B210-00FN-0D0 conformément à la matrice de compatibilité NVIDIA pour éviter les problèmes d'intégrité du signal.
  • Redondance : Déployez des alimentations doubles connectées à des PDU séparées. Utilisez au moins deux commutateurs spine par leaf pour éliminer les points de défaillance uniques. Pour les charges de travail critiques, envisagez une redondance N+1 au niveau spine.
  • Gestion du firmware : Assurez-vous que tous les commutateurs exécutent des versions de firmware NVIDIA identiques. Utilisez la fonction de mise à niveau automatique du firmware de l'UFM pour des mises à jour progressives sans temps d'arrêt. Validez la compatibilité du firmware avec les cartes hôtes et les câbles avant le déploiement.
  • Chemin de mise à l'échelle : Pour les clusters dépassant 4 096 nœuds, passez à une topologie folded-Clos à trois niveaux ou utilisez dragonfly+ avec routage adaptatif. Le 920-9B210-00FN-0D0 prend en charge jusqu'à 64 commutateurs dans un seul fabric, avec plusieurs fabrics interconnectés via des passerelles pour des déploiements plus importants.
  • Validation des performances : Avant le déploiement en production, effectuez des tests de stress complets à l'aide d'outils tels que les benchmarks de performance OpenFabrics Enterprise Distribution (OFED) pour valider les performances du fabric par rapport aux spécifications de la fiche technique détaillée du 920-9B210-00FN-0D0.

Lors du calcul du coût total de possession, tenez compte du nombre réduit de niveaux de commutateurs et du câblage simplifié par rapport aux alternatives à radix plus faible. Bien que le prix du 920-9B210-00FN-0D0 par unité soit plus élevé que celui des commutateurs HDR, le coût par port et le coût de mise en réseau par GPU sont considérablement plus bas dans les déploiements à grande échelle, ce qui en fait un choix rentable pour les projets exascale.

5. Opérations, surveillance et dépannage

Une gestion efficace d'un fabric NDR nécessite un cadre de surveillance et de dépannage complet. L'UFM de NVIDIA fournit une interface unique pour l'ensemble du fabric basé sur le NVIDIA Mellanox 920-9B210-00FN-0D0, offrant :

  • Visualisation de la topologie : Découverte automatique et représentation graphique de tous les commutateurs, liens et points d'extrémité, avec des mises à jour d'état en temps réel.
  • Tableaux de bord de performance : Vues en temps réel de l'utilisation des ports, des taux d'erreur, des indicateurs de congestion et de l'occupation des tampons sur l'ensemble du fabric.
  • Alertes proactives : Alarmes basées sur des seuils pour la dégradation des liens, les anomalies de température, les défaillances d'alimentation et l'usure des câbles.
  • Isolation des défauts : Flux de dépannage guidés qui identifient les câbles, les émetteurs-récepteurs ou les ports de commutateur défectueux, réduisant le temps moyen de résolution (MTTR).
  • Analyses historiques : Analyse des tendances et planification de la capacité basées sur les données de performance historiques, permettant des décisions de mise à l'échelle proactives.

Pour un dépannage avancé, utilisez les outils de diagnostic intégrés du commutateur, y compris les tests en boucle arrière, l'analyse du taux d'erreur binaire (BER) et la surveillance diagnostique des modules optiques (DOM). Les problèmes courants rencontrés dans les premiers déploiements NDR incluent un routage sous-optimal causé par des vitesses de lien inégales, des types de câbles incompatibles ou des incohérences de firmware. L'activation du routage adaptatif, la vérification que tous les liens fonctionnent à 400 Gb/s avec le FEC activé et la garantie d'un firmware cohérent sur tous les commutateurs résolvent la majorité des anomalies de performance.

Les ingénieurs réseau doivent également établir une base de référence des spécifications du 920-9B210-00FN-0D0 pendant la phase de validation, y compris la latence, le débit et les taux d'erreur attendus. Les écarts par rapport à cette base de référence peuvent être utilisés comme indicateurs précoces de problèmes potentiels. Le 920-9B210-00FN-0D0 InfiniBand switch OPN prend également en charge la journalisation complète des événements via syslog et SNMP, permettant l'intégration avec les piles de surveillance de centre de données existantes.

6. Résumé et évaluation de la valeur

Le 920-9B210-00FN-0D0 offre une proposition de valeur convaincante pour les organisations qui construisent ou étendent des clusters HPC et IA basés sur NDR. Il fournit 64 ports NDR 400 Gb/s avec une latence inférieure à 100 ns, un déchargement SHARPv3, une gérabilité de niveau entreprise et une compatibilité totale avec l'écosystème HDR existant, le tout dans une plateforme compacte 1U. Les principaux points de valeur incluent :

  • Performance : Réduction jusqu'à 75 % de la latence de communication all-to-all et jusqu'à 40 % de la latence all-reduce grâce au déchargement SHARPv3 et à la bande passante NDR.
  • Rentabilité : Coût de mise en réseau par GPU inférieur à celui des alternatives HDR dans les déploiements à grande échelle, grâce à un radix plus élevé et à un nombre réduit de couches de commutateurs.
  • Simplicité opérationnelle : Intégration approfondie avec l'UFM pour une gestion unifiée, un provisionnement automatisé, une surveillance proactive et une résolution rapide des défauts.
  • Protection de l'investissement : Compatibilité totale avec les câbles, optiques et piles logicielles HDR existants, permettant des mises à niveau progressives sans perturber les charges de travail de production.
  • Scalabilité pérenne : Prise en charge des topologies folded-Clos à trois niveaux et dragonfly+, garantissant que le fabric peut évoluer jusqu'à plus de 8 000 nœuds à mesure que les besoins de calcul augmentent.

Pour les organisations évaluant le 920-9B210-00FN-0D0 à vendre via les partenaires de distribution NVIDIA, nous recommandons de consulter la fiche technique détaillée du 920-9B210-00FN-0D0 et de collaborer avec un architecte de solutions certifié pour valider la conception pour vos besoins spécifiques en matière de charge de travail et d'échelle. Le NVIDIA Mellanox 920-9B210-00FN-0D0 est prêt pour la production aujourd'hui, offrant une base d'interconnexion évolutive et haute performance pour la prochaine génération d'innovation IA et HPC.