NVIDIA Mellanox MCX653105A-HDAT en action: RDMA/RoCE Optimisation du transport à faible latence et du débit du serveur
July 29, 2026
NVIDIA Mellanox MCX653105A-HDAT en action : Transport à faible latence RDMA/RoCE et optimisation du débit serveur
Contexte et défis : Le goulot d'étranglement réseau dans un cluster IA/HPC
Une grande entreprise technologique a récemment déployé un cluster accéléré par GPU de 128 nœuds pour l'entraînement de grands modèles de langage (LLM), chaque nœud étant équipé de huit GPU NVIDIA H100 et d'un stockage NVMe haute performance. Cependant, au-delà de 32 nœuds, le cluster a connu une dégradation spectaculaire des performances. La latence de communication collective All-Reduce a grimpé à 8-10 millisecondes, tandis que la pile réseau TCP/IP consommait plus de 45 % des ressources CPU par nœud. Le réseau — construit sur plusieurs liens 25GbE — était devenu le principal goulot d'étranglement, limitant sévèrement l'utilisation des GPU et prolongeant les cycles d'entraînement bien au-delà des délais acceptables. L'équipe avait un besoin urgent d'une solution capable de fournir à la fois une latence ultra-faible et une bande passante massive tout en déchargeant le traitement réseau gourmand en CPU.
Solution et déploiement : Transformer le tissu avec le MCX653105A-HDAT
Après une évaluation technique exhaustive, l'équipe a sélectionné leNVIDIA Mellanox MCX653105A-HDATcomme fondation de sa transformation réseau. Chaque nœud GPU a été équipé d'unecarte réseau PCIe adaptateur MCX653105A-HDAT ConnectX, configurée avec une connectivité 100GbE double port pour fournir 200 Gb/s de bande passante agrégée par serveur.
Le déploiement a été exécuté en quatre phases structurées :
- Phase 1 — Installation matérielle (128 nœuds) : Chaque serveur a reçu lacarte adaptateur Ethernet MCX653105A-HDAT, avec les deux ports QSFP28 connectés à des commutateurs leaf NVIDIA Spectrum-4 redondants. Les adaptateurs ont été installés avec le dernier firmware et la pile de pilotes NVIDIA OFED.
- Phase 2 — Configuration RoCEv2 : L'équipe a activé RoCEv2 sur l'ensemble du tissu, en ajustant soigneusement les paramètres de Priority Flow Control (PFC) et d'Explicit Congestion Notification (ECN) pour établir un environnement Ethernet sans perte. Les fonctionnalités avancées de gestion de la congestion détaillées dans lafiche technique MCX653105A-HDATont été déterminantes pour obtenir une allocation optimale des tampons.
- Phase 3 — Optimisation NCCL : La NVIDIA Collective Communications Library (NCCL) a été reconfigurée pour tirer parti des capacités RDMA de l'adaptateur, avec des règles de routage de trafic personnalisées programmées dans les moteurs de traitement embarqués de l'adaptateur pour optimiser les modèles spécifiques d'all-reduce et d'all-gather de la charge de travail LLM.
- Phase 4 — Validation et réglage fin : En utilisant les données de télémétrie exposées via lesspécifications MCX653105A-HDAT, l'équipe a validé la configuration, ajusté les paramètres de modération des interruptions et établi des métriques de performance de référence pour une surveillance continue.
Notamment, l'adaptateur s'est avérécompatible MCX653105A-HDATavec l'infrastructure de câblage existante, car les ports QSFP28 prenaient en charge les optiques 100GbE et 25GbE, permettant une migration en douceur sans remplacement de câble perturbateur. L'équipe a également exploité les capacités multi-hôtes de l'adaptateur pour prendre en charge les fonctions de calcul et de stockage sur le même port physique.
Résultats et avantages : Gains mesurables en performance d'entraînement
Les améliorations de performance apportées par leNVIDIA Mellanox MCX653105A-HDATont dépassé toutes les projections initiales. Les principales métriques de performance avant et après la mise à niveau sont résumées ci-dessous :
| Métrique | Avant mise à niveau (25GbE TCP/IP) | Après mise à niveau (MCX653105A-HDAT avec RoCE) | Amélioration |
|---|---|---|---|
| Latence All-Reduce (128 nœuds) | 9,2 ms | 0,28 ms | Réduction de 32,8x |
| Utilisation CPU réseau (par nœud) | 47 % | 6 % | 41 pp récupérés |
| Utilisation GPU (phase d'entraînement) | 58 % | 94 % | Augmentation de +36 % |
| Débit d'entraînement du cluster | 1,9x baseline | 5,7x baseline | Augmentation de 3x |
Au-delà de ces réalisations quantitatives, l'équipe a observé des avantages opérationnels significatifs. Les cycles d'entraînement qui consommaient auparavant 12 jours ont été achevés en seulement 4 jours, accélérant considérablement les cycles d'itération des modèles. Le plan de données programmable de l'adaptateur a permis un façonnage personnalisé du trafic pour les flux prioritaires, garantissant que le trafic de communication collective critique ne subissait jamais de contention. Pour les organisations évaluant le retour sur investissement, leprix MCX653105A-HDATs'est avéré pleinement justifié par le gain de débit de 3x et la capacité de reporter l'acquisition de serveurs GPU supplémentaires d'au moins 12 mois. L'équipe a noté que lesoffres MCX653105A-HDAT à vendreen bundle avec les commutateurs NVIDIA Spectrum-4 offraient l'économie la plus favorable pour un déploiement sur l'ensemble du cluster.
Résumé et perspectives : Une base pour l'infrastructure IA de nouvelle génération
Ce déploiement à l'échelle de la production valide que leNVIDIA Mellanox MCX653105A-HDATest un composant transformateur pour les clusters IA et HPC modernes. La combinaison d'une bande passante agrégée de 200 Gb/s, d'une latence de communication collective inférieure à 0,3 milliseconde et de déchargements matériels complets permet aux organisations d'atteindre une mise à l'échelle quasi linéaire pour les charges de travail accélérées par GPU. En tant quesolution de carte adaptateur Ethernet MCX653105A-HDATde bout en bout, elle élimine le goulot d'étranglement réseau qui a historiquement limité l'efficacité de l'entraînement distribué.
À l'avenir, l'entreprise explore l'intégration avec NVIDIA DOCA pour implémenter une programmabilité supplémentaire du plan de données pour l'optimisation spécifique à la charge de travail. Elle exploite également la télémétrie avancée de l'adaptateur — largement documentée dans lafiche technique MCX653105A-HDAT— pour construire des modèles de performance prédictifs et des stratégies d'atténuation automatisée de la congestion. LeNVIDIA Mellanox MCX653105A-HDATest devenu la pierre angulaire de leur feuille de route d'infrastructure IA, fournissant une base robuste et évolutive pour la prochaine génération de développement et de déploiement de modèles fondamentaux.

