NVIDIA Mellanox MCX631432AN-ADAB en action: RDMA/RoCE Optimisation du transport à faible latence et du débit du serveur
July 28, 2026
NVIDIA Mellanox MCX631432AN-ADAB en action: RDMA/RoCE Optimisation du transport à faible latence et du débit du serveur
Contexte et défis: le goulot d'étranglement du réseau dans un groupe de formation sur l'IA
Une société fintech de premier plan a récemment déployé un cluster d'IA basé sur un GPU à 64 nœuds conçu pour la formation en stratégie de trading à haute fréquence, chaque serveur étant équipé d'un stockage NVMe haute performance.,En effet, après la mise en service, le débit effectif de formation est tombé nettement en dessous des attentes.L'analyse post-déploiement a révélé que le tissu de communication internœuds basé sur TCP/IP 10GbE était devenu le principal goulot d'étranglementLes opérations de communication collective All-Reduce affichaient une latence allant jusqu'à 4 à 5 millisecondes.alors que les frais généraux du processeur pour le traitement du protocole réseau ont dépassé 40% L'équipe avait besoin d'urgence d'une solution de réseau qui pourrait à la fois réduire considérablement la latence de communication et récupérer la capacité de calcul du processeur.
Solution et déploiement: Construire un réseau sans perte RoCE avec le MCX631432AN-ADAB
Après une évaluation technique exhaustive, l'équipe a sélectionné lesNVIDIA Mellanox MCX631432AN-ADAB est une plateforme de téléchargementChaque serveur était équipé d'unLe système de connectivité de l'équipement est équipé d'un système de connectivité à double port de 25 GbE SFP28adaptateur, avec les deux ports SFP28 connectés à des commutateurs NVIDIA Spectrum-3 redondants pour établir une architecture hautement disponible.
Le déploiement a été réalisé en trois phases distinctes:
- Phase 1 L'équipe a installéLe système d'exploitation de l'appareil doit être équipé d'une carte de connexion à l'émetteur.sur un sous-ensemble de serveurs GPU, en configurant RoCEv2 avec le contrôle prioritaire du flux (PFC) et la notification explicite de congestion (ECN) pour créer un tissu Ethernet sans perte.NCCL (NVIDIA Collective Communications Library) a été recompilé avec le support RDMA.
- Phase 2 Tuning et validation:L'utilisation des données de télémétrie détaillées dans leLe numéro de série de l'appareil est le numéro de série de l'appareil, l'équipe a affiné les paramètres DCB et les seuils de tampon pour éliminer les tempêtes de pause PFC tout en maintenant une perte de paquets proche de zéro.Les spécifications du MCX631432AN-ADABa guidé l'optimisation de la modération des interruptions et de la profondeur des files d'attente pour le profil de charge de travail spécifique.
- La phase 3 Après validation réussie, les nœuds restants ont été migrés vers le nouvel adaptateur.Compatible avec MCX631432AN-ADABles pilotes intégrés de manière transparente à l'environnement Ubuntu existant et à la pile Mellanox OFED.
L'équipe a noté queSolution de carte d'adaptateur Ethernet MCX631432AN-ADABLes adaptateurs étaient entièrement compatibles avec leur infrastructure de câblage et de commutation SFP28 existante, ce qui éliminait le besoin de mises à niveau auxiliaires coûteuses.
Résultats et avantages: transformation mesurable de la latence et du débit
Les gains de performance obtenus grâce à laNVIDIA Mellanox MCX631432AN-ADAB est une plateforme de téléchargementLe tableau suivant résume les indicateurs clés avant et après la mise à niveau:
| Pour la métrique | Pré-mise à niveau (10GbE TCP/IP) | Le système d'avertissement doit être conforme à la norme ISO/IEC 17049. | Amélioration |
|---|---|---|---|
| Réduction totale de la latence (en moyenne) | 40,7 ms | 0.32 secondes | 14.7 fois de réduction |
| Utilisation du processeur réseau (par nœud) | 42% | 9% | 33 p.p. libérés |
| Utilisation du GPU (phase de chargement des données) | 61% | 89% | +28% |
| Performance de la formation en grappes | 1.8x la valeur de référence | 4.3x le niveau de référence | 2.4 fois plus |
Au-delà de ces gains quantitatifs, l'équipe a observé des améliorations opérationnelles qui ont directement affecté la productivité des développeurs.Des courses de formation modèle qui nécessitaient auparavant 36 heures, terminées en seulement 15 heuresLe déchargement NVMe-oF basé sur le matériel a également réduit la latence d'accès au stockage de 35%, accélérant davantage les opérations de points de contrôle à forte intensité de données.Pour les organisations évaluant le business case, leLe prix MCX631432AN-ADABL'équipe a également noté que les performances de l'appareil étaient très compétitives par rapport au gain de débit de 2,4 fois et à la possibilité de reporter les acquisitions de serveurs GPU supplémentaires.MCX631432AN-ADAB à vendreLes paquets avec des commutateurs NVIDIA Spectrum offraient la voie la plus rentable pour une éventuelle mise à l'échelle.
Résumé & Perspectives: une base pour l'innovation des futures charges de travail
Ce déploiement de la production démontre que leNVIDIA Mellanox MCX631432AN-ADAB est une plateforme de téléchargementIl s'agit d'un élément d'infrastructure transformateur qui libère tout le potentiel de l'informatique moderne accélérée par GPU.La combinaison de 50 Gb/s de bande passante globale, une latence de communication collective inférieure à 0,4 ms, et des capacités de décharge de processeur spectaculaires positionnent cet adaptateur comme un choix idéal pour les organisations exécutant l'IA distribuée, HPC,et les charges de travail d'analyse en temps réel.
À l'avenir, l'équipe fintech explore l'intégration avec NVIDIA DOCA pour accélérer davantage la programmabilité des chemins de données et mettre en œuvre un provisioning sans contact pour les futures expansions de clusters.Ils évaluent également les capacités de télémétrie de l'adaptateurLe numéro de série de l'appareil est le numéro de série de l'appareilL'objectif est de créer des modèles prédictifs de gestion de la congestion.Solution de carte d'adaptateur Ethernet MCX631432AN-ADABcontinue de prouver sa valeur, la société prévoit de normaliser sur cette plateforme pour tous les futurs investissements en infrastructures,Nous sommes convaincus qu'il fournit une base solide et évolutive pour la prochaine génération d'applications financières basées sur l'IA..

