NVIDIA Mellanox MCX631102AN-ADAT en action : Transport RDMA/RoCE à faible latence et optimisation du débit serveur
July 27, 2026
NVIDIA Mellanox MCX631102AN-ADAT en action: Optimisation du transport et du débit du serveur à faible latence RDMA/RoCE
Contexte et défis: Le goulot d'étranglement de la latence et du débit dans le stockage distribué
Un fournisseur de services cloud de taille moyenne exploitant un cluster de stockage Ceph distribué sur 120 serveurs x86 a commencé à éprouver des problèmes de performance croissants.s'appuyant sur TCP/IP pour la communication entre les nœudsLes principaux symptômes comprenaient une utilisation élevée du processeur dépassant 45% sur les nœuds de stockage en raison du traitement du protocole réseau,Les délais moyens de lecture/écriture dépassant 3 millisecondes pendant les heures de pointe, et un écart significatif entre le débit théorique du disque et les performances réelles fournies par le réseau.L'équipe d'ingénieurs a reconnu que pour atteindre une latence inférieure à la milliseconde et libérer pleinement les performances NVMe, il fallait un changement fondamental dans l'approche des réseaux, l'adoption du RDMA sur Ethernet convergé (RoCE).
Solution et déploiement: Introduction de la solution de carte d'adaptateur Ethernet MCX631102AN-ADAT
Après avoir évalué plusieurs options de fournisseur, l'équipe a sélectionné leNVIDIA Mellanox MCX631102AN-ADAT est une plateforme de téléphonie mobile.Les réseaux de télécommunications sont les principaux acteurs de la mise à niveau du réseau.Le système de connectivité est équipé d'un système de connectivité à double port de 25 GbE.L'adaptateur a été choisi pour sa prise en charge native de RoCEv2, son contrôle de la congestion basé sur le matériel et son intégration transparente avec leur infrastructure de câblage SFP28 existante.
La stratégie de déploiement s'est déroulée par étapes sur trois pôles:
- Phase 1 (pilote):16 nœuds de stockage ont été équipés de laLe système de détection de l'émission de CO2 doit être équipé d'un système de détection de CO2 de qualité supérieure.Les adaptateurs ont été configurés en mode double port actif-actif, chaque port étant connecté à une paire de commutateurs NVIDIA Spectrum pour la redondance.
- Phase 2 (optimisation):Le RoCEv2 a été activé avec le contrôle des flux prioritaires (PFC) et la notification explicite de congestion (ECN) afin d'éviter les pannes de réseau.L'équipe a tiré parti des moteurs de décharge matérielle de l'adaptateur pour les calculs de NVMe-oF et de codage d'effacement.
- Phase 3 (déploiement complet):Tous les 120 nœuds ont été migrés vers leNVIDIA Mellanox MCX631102AN-ADAT est une plateforme de téléphonie mobile., avec la pile de réseau Ceph OSD (Object Storage Daemon) reconfigurée pour utiliser le transport RDMA.
Selon leLa feuille de données MCX631102AN-ADAT, l'interface PCIe 4.0 x8 de l'adaptateur fournit une large bande passante suffisante pour gérer le débit global de 50 Gb/s.Les spécifications du MCX631102AN-ADATL'adaptateur s'est également avéré être un excellent outil de gestion de la circulation, avec une latence inférieure à 0,6 microsecondes et une direction de trafic basée sur le matériel.Compatible avec le MCX631102AN-ADATavec leur distribution Linux existante (RHEL 9.2) et les pilotes Mellanox OFED, simplifiant considérablement le processus de déploiement.
Résultats et avantages: Gains mesurables en latence et en débit
L'impact de la migration a été immédiatement évident dans les mesures de production.
| Pour la métrique | Pré-mise à niveau (10GbE TCP/IP) | Le système d'exploitation de l'appareil doit être équipé d'un système de gestion de l'équipement. | Amélioration |
|---|---|---|---|
| La latence de lecture moyenne | 20,8 ms | 00,4 ms | Réduction de 7 fois |
| La latence d'écriture moyenne | 3.2 ms | 0.5 ms | 6.4 fois de réduction |
| Utilisation du processeur de nœud (stack réseau) | 42% | - 11% | 31 p.p. libérés |
| Le débit global des grappes | 18 Gb/s | 42 Gb/s | 2.3 fois plus |
Au-delà des chiffres, l'équipe a observé des améliorations opérationnelles significatives.Le numéro de série est le numéro de série de l'appareil.a permis une migration en direct transparente des machines virtuelles exécutant des applications sensibles à la latence, car le jitter du réseau est tombé à des niveaux négligeables.La décharge NVMe-oF basée sur le matériel a réduit la latence d'accès au stockage de 30% supplémentaire, permettant au cluster de gérer des charges de travail mixtes de lecture/écriture avec des temps de réponse cohérents inférieurs à une milliseconde.Le prix MCX631102AN-ADATLe fournisseur a également noté que la capacité de dépôt des serveurs supplémentaires était justifiée par le gain de débit de 2,3 fois et la possibilité de reporter les achats de serveurs supplémentaires d'au moins 18 mois.MCX631102AN-ADAT à vendreLes options offertes par les partenaires de canal offrent des réductions de volume flexibles pour les déploiements à grande échelle.
En outre, les capacités intégrées de télémétrie et de gestion hors bande de l'adaptateur sont détaillées dans leLa feuille de données MCX631102AN-ADAT fournir une visibilité approfondie sur l'état du réseau, permettant une gestion proactive de la congestion et une analyse plus rapide des causes profondes lors de la résolution des incidents.
Résumé et perspectives: une base stratégique pour les futures charges de travail
Ce déploiement réel démontre que leNVIDIA Mellanox MCX631102AN-ADAT est une plateforme de téléphonie mobile.est bien plus qu'une simple mise à niveau de la bande passante.Solution de carte d'adaptateur Ethernet MCX631102AN-ADATpour les environnements dotés de RoCE, il élimine efficacement le réseau en tant que goulot d'étranglement de performance, libérant ainsi tout le potentiel des architectures de stockage et de processeur NVMe modernes.La combinaison de débit 25GbE à double port, des décharges RDMA complètes et une large compatibilité avec l'écosystème positionnent cet adaptateur comme un investissement stratégique pour toute organisation prévoyant de mettre à l'échelle des pipelines IA/ML, des bases de données distribuées,ou une infrastructure hyperconvergente.
À l'avenir, l'équipe explore des cas d'utilisation étendus, y compris l'intégration de NVIDIA DOCA pour les chemins de données programmables et le provisionnement sans contact.le débit d'augmentation, et récupérer les ressources du processeur, leLe numéro de série est le numéro de série de l'appareil.Elle établit une nouvelle référence pour les adaptateurs serveur 25GbE dans les environnements d'entreprise et de cloud.

