Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Solution technique de commutateur à bande Infini
July 15, 2026
Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch Solution technique. Optimisation des interconnexions à faible latence pour les grappes RDMA / HPC / AI
1. Analyse des antécédents et des besoins du projet
Les cadres de formation de l'IA moderne et les applications HPC sont de plus en plus limités par les performances d'interconnexion réseau plutôt que par la seule densité de calcul.Les emplois de formation distribués, en particulier ceux qui utilisent de grands modèles linguistiques, génèrent desLes exigences clés identifiées dans les déploiements d'entreprise comprennent:une latence de commutation inférieure à la microseconde pour minimiser les frais de communication, débit non bloquant à l'échelle pour éliminer les surabonnements, contrôle avancé de la congestion pour gérer les rafales incast,et intégration transparente avec RDMA sur Ethernet convergé (RoCE) ou écosystèmes InfiniBand natifsEn outre, les équipes opérationnelles exigent une télémétrie approfondie pour une détection proactive des défauts et une gestion simplifiée dans des centaines de ports.
2. Conception globale de l'architecture réseau/système
L'architecture proposée est centrée sur une topologie à deux niveaux, spécialement conçue pour les charges de travail centrées sur le GPU.Le produit est fabriqué à partir d'un matériau d'une valeur supérieure ou égale à la valeur nominale de l'appareilLa couche vertébrale se compose d'un deuxième niveau deLe système de détection de la pollution par le gaz est utilisé pour la détection de la pollution par le gaz.les commutateurs, offrant une connectivité pleine maille avec surabonnement 4:1 ou totalement non-bloquant lorsqu'ils sont déployés avec suffisamment de ports d'accès.Cette conception prend en charge jusqu'à 512 nœuds GPU dans un seul domaine de tissu, avec la possibilité de mise à l'échelle horizontalement via plusieurs sous-réseaux interconnectés via l'UFM (Unified Fabric Manager) de NVIDIA.
L'architecture tire parti du moteur informatique en réseau SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) de NVIDIA, déchargeant les opérations collectives directement sur le commutateur ASIC.Cela réduit le volume de données traversant les bus de mémoire CPU/GPU et réduit la latence de fonctionnement collectif jusqu'à 40% par rapport aux approches basées sur le logiciel. Le920-9B210-00FN-0D0 InfiniBand commutateur OPNsupporte également le routage adaptatif, qui sélectionne dynamiquement le chemin le moins encombré pour chaque paquet, assurant une utilisation optimale de la bande passante même sous des charges de trafic asymétriques.
3. Rôle et caractéristiques clés du 920-9B210-00FN-0D0 dans la solution
LeNVIDIA Mellanox 920-9B210-00FN-0D0Elle sert de base à l'ensemble du tissu d'interconnexion.
- Aggrégation à haute densité:Avec jusqu'à 64 ports 400Gb/s non bloquants dans un facteur de forme 2U, le commutateur offre une capacité de commutation globale de 25,6 Tb/s. Cette densité réduit le nombre de commutateurs nécessaires par rack,simplification du câblage et réduction de la consommation d'énergie par port.
- Commutation à très faible latence:Le commutateur maintient une latence inférieure à 600ns pour toute taille de paquet, ce qui est essentiel pour les applications sensibles à la latence de la queue telles que l'inférence en ligne et le calcul haute performance financier.
- L'informatique en réseau:L'intégration de SHARPv3 permet une accélération matérielle des opérations collectives, réduisant le nombre de traversées à travers le tissu et améliorant les temps de réalisation globaux des travaux jusqu'à 30%.
- Télémétrie avancée et contrôle de la congestion:L'interrupteur fournit une visibilité par flux, marquant les flux congestionnés pour les ajustements côté hôte et permettant un avertissement précoce des points chauds naissants.
Selon leLe nombre de points de contrôle doit être le même que le nombre de points de contrôle., le commutateur prend en charge à la fois les émetteurs-récepteurs QSFP-DD en cuivre et optiques, ce qui le rend920-9B210-00FN-0D0 est compatibleLe système est doté d'un réseau de câblodistribution et d'un réseau de câblodistribution intégré, avec une infrastructure de câblage existante dans la plupart des centres de données.
4Recommandations de déploiement et de mise à l'échelle (topologie typique)
Pour un déploiement de 128 nœuds GPU, nous recommandons une architecture à deux niveaux avec 4 commutateurs de feuille et 2 commutateurs de colonne vertébrale,Chaque colonne vertébrale se connecte à chaque feuille via 4x400Gb/s uplinksPour les applications sensibles à la latence ou à une large bande passante, un ratio de surabonnement de 1:Une conception non bloquante peut être réalisée en augmentant le nombre de colonne vertébrale à 4., ce qui donne une capacité globale de liaison ascendante égale aux ports descendants.
La mise à l'échelle au-delà de 512 nœuds nécessite la partition du tissu en plusieurs sous-réseaux, chacun géré par UFM comme une île de tissu distincte.La communication inter-sous-réseau peut être acheminée via les passerelles Quantum-2 de NVIDIA ou via le routage basé sur l'hôte, bien que l'approche recommandée pour les charges de travail sensibles aux performances soit de maintenir le tissu dans un seul sous-réseau dans la mesure du possible.Les spécifications 920-9B210-00FN-0D0supporter ces topologies à grande échelle, avec un contrôle de débit intégré et un contrôle de débit basé sur la priorité (PFC) pour empêcher les chutes de paquets lors d'événements de redirection du chemin.
Lors de la planification du câblage physique, envisagez d'utiliser des câbles MPO à QSFP-DD pour les connexions à feuille vertébrale afin de réduire la densité des câbles, ou des câbles optiques actifs (AOC) pour des distances supérieures à 3 mètres.920-9B210-00FN-0D0 à vendreIl comprend généralement un kit d'accessoires complet, mais nous recommandons de valider la compatibilité des émetteurs-récepteurs tiers à travers la matrice d'interopérabilité du fournisseur pour éviter les problèmes de formation des liens.
5- Opérations, surveillance et diagnostic des défauts
L'excellence opérationnelle est une pierre angulaire de920-9B210-00FN-0D0 InfiniBand commutateur OPN solutionLe commutateur s'intègre parfaitement à la plateforme UFM de NVIDIA, qui fournit:
- Surveillance en temps réel de l'état du tissu:Tableaux de bord pour l'état de liaison, la température, la consommation d'énergie et les compteurs d'erreur par port (CRC, symbole et erreurs d'alignement).
- Analyse prédictive des défaillances:Les modèles d'apprentissage automatique sur UFM identifient de manière proactive les défaillances optiques ou les liaisons détériorées avant qu'elles ne causent des pannes de travail.
- Résolution automatique des problèmes:Le système recommande des mesures correctives, telles que le redirigement du trafic ou l'isolement des liaisons défectueuses, réduisant ainsi de manière significative le temps moyen de résolution (MTTR).
Pour les diagnostics avancés, le commutateur prend en charge le sFlow et le mirroring des ports, permettant une inspection approfondie des paquets pour le débogage au niveau du protocole.Les spécifications 920-9B210-00FN-0D0pour les seuils de tampon et les paramètres recommandés, en particulier pour régler le trafic RoCEv2 s'il est utilisé dans des environnements mixtes InfiniBand/Ethernet.Le réglage des performances devrait se concentrer sur les seuils de routage adaptatif et les intervalles d'agrégation SHARPv3, qui peut être ajusté par phase de charge de travail, par exemple, en fonction de la formation par rapport à l'inférence.
La maintenance de routine comprend les mises à jour du micrologiciel, qui sont effectuées avec un minimum d'interruption en utilisant la capacité de mise à niveau continue d'UFM,et nettoyage périodique des connecteurs optiques pour maintenir l'intégrité du signalLa puissance redondante de l'interrupteur et les modules de ventilateur permettent de remplacer les commutateurs à chaud pendant le fonctionnement.
6. Résumé et évaluation de la valeur
LeLe produit est fabriqué à partir d'un matériau d'une valeur supérieure ou égale à la valeur nominale de l'appareiloffre une solution complète pour les organisations qui cherchent à libérer la pleine performance de leurs investissements en IA et HPC.La gestion intelligente de la congestion au sein d'unL'architecture décrite fournit un parcours éprouvé entre les clusters pilotes de 128 nœuds et les centres de données de 2,0 nœuds.Tissus pour supercalculateurs à nœuds supérieurs à 1000, avec des outils opérationnels qui simplifient la gestion et réduisent le coût total de possession.
Lors de l'évaluation du920-9B210-00FN-0D0 prix, considérer la valeur à long terme: des délais de réalisation réduits se traduisent directement par des coûts inférieurs dans le cloud ou un temps de visibilité accéléré pour les charges de travail sur site.920-9B210-00FN-0D0 InfiniBand commutateur OPN solutionest soutenu par le réseau mondial de support et l'écosystème de partenaires étendu de NVIDIA, garantissant que les organisations peuvent déployer, mettre à l'échelle et optimiser leur infrastructure en toute confiance pour les années à venir.
Pour une planification détaillée, veuillez vous référer à laLe nombre de points de contrôle doit être le même que le nombre de points de contrôle.etLes spécifications 920-9B210-00FN-0D0document, qui comprend des dessins mécaniques, des profils thermiques et des critères de performance.

