NVIDIA Mellanox MCX623106AN-CDAT Adaptateur Serveur en Action | Transport à Faible Latence RDMA/RoCE et Gains de Débit Serveur
July 22, 2026
Adaptateur serveur NVIDIA Mellanox MCX623106AN-CDAT en action | Transport RDMA/RoCE à faible latence et gains de débit serveur
Contexte et le défi : quand le 200 GbE rencontre le mur de l'évolutivité de l'IA
Une organisation de recherche en IA en pleine croissance — appelons-la « DeepCore Labs » — était confrontée à un goulot d'étranglement critique en matière d'évolutivité. Leur cluster d'entraînement de modèles de langage volumineux phare, comprenant 512 GPU NVIDIA H100 répartis sur 128 nœuds, subissait une dégradation sévère des performances lors du passage au-delà de 64 nœuds. Le problème ne résidait pas dans le calcul ou la mémoire, mais dans le tissu réseau. La synchronisation des gradients en mode all-reduce prenait plus de 15 secondes par itération, et l'utilisation des GPU avait chuté à seulement 62 % en raison des blocages réseau. Leur infrastructure 100 GbE existante, s'appuyant sur le TCP/IP basé sur logiciel, ne pouvait tout simplement pas gérer les modèles de communication intermittents et sensibles à la latence de l'entraînement distribué. L'équipe avait besoin d'une solution capable de fournir un débit 200 GbE en ligne avec une latence déterministe au niveau de la microseconde.
Leur évaluation les a conduits à l'adaptateur serveur NVIDIA Mellanox MCX623106AN-CDAT — un adaptateur serveur 200 GbE conçu pour les charges de travail IA et HPC les plus exigeantes. L'équipe de recherche a reconnu que la carte réseau PCIe de l'adaptateur MCX623106AN-CDAT ConnectX offrait les délestages avancés et les capacités GPUDirect nécessaires pour éliminer le goulot d'étranglement réseau et maximiser l'utilisation des GPU.
La solution : déploiement de la carte adaptateur Ethernet MCX623106AN-CDAT
DeepCore Labs a déployé la carte adaptateur Ethernet MCX623106AN-CDAT sur les 128 nœuds d'entraînement, chaque serveur étant équipé d'un adaptateur QSFP112 à double port connecté à un tissu leaf-spine construit sur des commutateurs NVIDIA Spectrum-4. Le déploiement a tiré parti du support natif RoCE v2 de l'adaptateur pour permettre un transport Ethernet sans perte, éliminant ainsi le besoin d'un tissu InfiniBand séparé. La capacité GPUDirect RDMA de l'adaptateur a été essentielle à la solution, permettant le mouvement direct des données entre les GPU sur le réseau sans intervention du CPU — une fonctionnalité critique pour réduire la surcharge de synchronisation.
L'équipe a configuré le PFC (contrôle de flux prioritaire) et l'ECN (notification explicite de congestion) au niveau du commutateur, dédiant la priorité 3 au trafic de communication collective et la priorité 4 aux E/S de stockage. Ils ont également mis en œuvre la technologie de routage adaptatif de NVIDIA pour distribuer dynamiquement le trafic sur plusieurs chemins, minimisant les points chauds. En quatre semaines, l'ensemble du tissu d'entraînement fonctionnait sur RDMA, avec les 512 GPU communiquant de manière transparente sur RoCE. L'écosystème compatible MCX623106AN-CDAT s'est avéré robuste — les cartes se sont intégrées sans faille aux serveurs basés sur H100 et à la bibliothèque NCCL (NVIDIA Collective Communications Library) de NVIDIA sans aucune modification.
L'équipe s'est référée à la fiche technique officielle du MCX623106AN-CDAT pour affiner l'allocation des tampons et les paramètres de contrôle de la congestion, obtenant des performances optimales pour leur environnement de charge de travail mixte — qui comprenait à la fois l'entraînement synchrone (dominé par l'all-reduce) et la sauvegarde asynchrone.
Résultats mesurables : efficacité de l'évolutivité, débit et utilisation des GPU
L'amélioration des performances a été transformatrice. Avec le RDMA sur RoCE activé via le NVIDIA Mellanox MCX623106AN-CDAT, la latence de synchronisation all-reduce est passée d'une moyenne de 15,2 secondes à seulement 1,8 seconde par itération — une amélioration de 8,4x. Cela s'est traduit directement par une convergence plus rapide des modèles : le temps d'entraînement total pour leur modèle de 70 milliards de paramètres est passé de 42 jours à 19 jours, accélérant leur cycle de recherche de plus de 50 %.
L'utilisation des GPU, qui stagnait à 62 % en raison des blocages réseau, a grimpé à 94 % après la mise à niveau — une amélioration de 52 % de la capacité de calcul effective. Le moteur de délestage avancé de l'adaptateur, incluant le placement de données hors séquence et le cadencement des paquets, a éliminé les micro-rafales qui causaient des pics de latence, garantissant des performances constantes sur tous les nœuds.
Au-delà des performances d'entraînement, les gains de débit serveur ont été tout aussi convaincants. Le moteur de délestage matériel — incluant le délestage de somme de contrôle, LSO/LRO et l'accélération RoCE — a réduit l'utilisation du CPU pour le traitement réseau de 38 % à moins de 4 % sur tous les nœuds. Cela a libéré une capacité CPU importante pour le prétraitement des données, la compression des sauvegardes et d'autres tâches auxiliaires qui étaient auparavant limitées.
| Métrique | Avant (carte réseau 100 GbE héritée) | Après (MCX623106AN-CDAT) | Amélioration |
|---|---|---|---|
| Latence All-Reduce (par itération) | 15,2 s | 1,8 s | 8,4x plus rapide |
| Utilisation des GPU | 62 % | 94 % | 52 % plus élevé |
| Temps d'entraînement du modèle (70 milliards de paramètres) | 42 jours | 19 jours | 55 % plus rapide |
| Surcharge réseau du CPU | 38 % | < 4 % | 89 % plus faible |
| Latence de lecture NVMe-oF (stockage) | 185 µs | 12 µs | 15x plus rapide |
Avantages opérationnels : TCO et efficacité de l'infrastructure
Bien que les gains de performance aient été spectaculaires, les avantages opérationnels et financiers ont été tout aussi notables. La solution de carte adaptateur Ethernet MCX623106AN-CDAT a réduit le coût total de possession en éliminant le besoin d'un tissu InfiniBand séparé — économisant plus de 500 000 $ en coûts d'infrastructure de commutateurs. La conception économe en énergie de l'adaptateur (moins de 20 W par carte) a contribué à des économies d'énergie mesurables sur le cluster de 128 nœuds, réduisant les dépenses de refroidissement annuelles d'environ 18 %.
Pour les responsables informatiques évaluant le prix du MCX623106AN-CDAT par rapport aux solutions alternatives, le directeur de l'infrastructure de DeepCore a noté que la période de retour sur investissement était inférieure à six mois — principalement due à la réduction du temps d'entraînement, qui a directement accéléré leur pipeline de développement de produits. L'équipe a également apprécié la pérennité de l'adaptateur : le même MCX623106AN-CDAT à vendre aujourd'hui prend en charge le 200 GbE mais est également compatible avec les optiques 100 GbE et 50 GbE, offrant une flexibilité pour les environnements à vitesse hybride et les mises à niveau progressives.
Selon les spécifications du MCX623106AN-CDAT, l'adaptateur comprend des fonctionnalités de télémétrie complètes, notamment la télémétrie réseau en bande (INT) et le suivi de la latence par flux. DeepCore a intégré ces métriques dans leur pile Prometheus/Grafana, permettant la détection proactive de la micro-congestion avant qu'elle n'affecte les performances d'entraînement. L'équipe a également exploité les algorithmes de contrôle de la congestion de l'adaptateur pour ajuster dynamiquement les seuils ECN, maintenant un comportement sans perte même pendant les opérations de sauvegarde qui généraient une charge réseau supplémentaire.
Résumé et perspectives : un plan directeur pour la mise à l'échelle du réseau IA
Le parcours de DeepCore Labs avec le NVIDIA Mellanox MCX623106AN-CDAT démontre un plan clair pour les organisations qui construisent ou mettent à l'échelle leur infrastructure IA. En combinant un débit 200 GbE double port, une interface hôte PCIe 5.0 et le RDMA activé par GPUDirect, la carte adaptateur Ethernet MCX623106AN-CDAT transforme le réseau d'un goulot d'étranglement d'évolutivité en un multiplicateur de performance. Les résultats — 8,4x plus rapide en all-reduce, 94 % d'utilisation des GPU et 55 % de cycles d'entraînement plus rapides — témoignent de la capacité de l'adaptateur à fournir des résultats commerciaux tangibles dans les environnements de calcul les plus exigeants.
À l'avenir, alors que la taille des modèles continue de doubler tous les quelques mois et que les clusters d'entraînement distribués s'étendent à des milliers de GPU, la carte réseau PCIe de l'adaptateur MCX623106AN-CDAT ConnectX fournit une base solide pour des tissus sans perte et à latence ultra-faible. Pour les architectes et les responsables informatiques qui planifient leur prochain investissement en infrastructure IA, cet adaptateur représente non seulement un composant, mais un catalyseur stratégique pour une différenciation concurrentielle. Des paramètres de réglage détaillés, des scripts de déploiement et des rapports de benchmarks de performance sont disponibles dans la fiche technique officielle du MCX623106AN-CDAT — une référence essentielle pour tout déploiement IA à grande échelle.

