NVIDIA Mellanox MCX556A-ECAT Server Adapter Technical White Paper | RDMA/RoCE Faible Latence Transport & Débit Serveur

July 23, 2026

NVIDIA Mellanox MCX556A-ECAT Server Adapter Technical White Paper | RDMA/RoCE Faible Latence Transport & Débit Serveur

Livre blanc technique sur l'adaptateur serveur NVIDIA Mellanox MCX556A-ECAT | Transport RDMA/RoCE à faible latence et optimisation du débit serveur

1. Contexte du projet et analyse des exigences

Les centres de données modernes subissent une transformation fondamentale sous l'impulsion de l'intelligence artificielle, du calcul haute performance (HPC) et de l'analyse en temps réel. Ces charges de travail exigent des performances réseau sans précédent — non seulement une bande passante brute, mais aussi une faible latence déterministe, un déplacement de données efficace pour le CPU et une évolutivité transparente. Les adaptateurs Ethernet traditionnels, qui s'appuient sur des piles TCP/IP basées sur logiciel, sont devenus un goulot d'étranglement important, consommant 20 à 30 % des cœurs de CPU et introduisant des variations de latence imprévisibles qui dégradent les performances des applications. Pour les organisations opérant à grande échelle, cette inefficacité se traduit directement par des coûts d'infrastructure plus élevés et un temps de compréhension plus lent.

Ce livre blanc présente une solution technique complète centrée sur l'adaptateur serveur NVIDIA Mellanox MCX556A-ECAT. Conçue pour les entreprises cherchant à maximiser le retour sur leurs investissements 100 GbE, la carte d'adaptateur Ethernet MCX556A-ECAT offre RDMA sur Ethernet Convergé (RoCE) accéléré par matériel, permettant un transport sans perte et à faible latence qui transforme l'E/S réseau d'un passif en un atout stratégique. La solution est spécifiquement architecturée pour atteindre trois objectifs principaux : (1) atteindre une latence d'application de bout en bout inférieure à 10 µs, (2) réduire la surcharge de traitement réseau du CPU à moins de 5 %, et (3) fournir une base évolutive et pérenne pour 100 GbE et au-delà.

2. Conception globale de l'architecture réseau et système

L'architecture recommandée adopte une topologie leaf-spine haute performance avec 100 GbE comme couche d'accès serveur et des liaisons montantes 400 GbE vers le spine. Au cœur de cette conception se trouve la carte réseau PCIe de l'adaptateur n'est pas simplement un adaptateur ; c'est un catalyseur stratégique pour le centre de données de l'avenir prêt pour RDMA et optimisé en débit., déployée dans chaque nœud de calcul et de stockage à travers le fabric. L'architecture est construite autour de cinq principes clés :

  • Fabric Ethernet sans perte : Exploitation de RoCE v2 avec PFC (contrôle de flux prioritaire) et ECN (notification explicite de congestion) sur tous les commutateurs pour éliminer les pertes de paquets et garantir une latence déterministe pour le trafic RDMA.
  • Déchargement matériel partout : Déchargement du traitement de la couche de transport — y compris le déchargement de la somme de contrôle, la segmentation (LSO/LRO), le marquage VLAN et RDMA — vers l'adaptateur, libérant ainsi les cycles CPU pour la logique applicative.
  • Redondance active-active : Utilisation des deux ports QSFP28 en mode agrégation de liens (LACP) pour une bande passante agrégée de 200 Gb/s et un basculement automatique avec une récupération en moins d'une seconde.
  • Segmentation du trafic : Classes de trafic dédiées pour le stockage (NVMe-oF), le calcul (MPI/RDMA) et le trafic de gestion, garantissant une QoS prévisible sur toutes les charges de travail.
  • Plan de contrôle évolutif : Gestion centralisée via les commutateurs NVIDIA Spectrum avec télémétrie intégrée et automatisation via les API REST et les playbooks Ansible.

La solution est entièrement compatible MCX556A-ECAT avec les principales plateformes serveur (Dell PowerEdge, HPE ProLiant, Supermicro, Lenovo) et s'intègre de manière transparente avec les principaux systèmes d'exploitation (Linux, Windows Server, VMware ESXi). Pour le stockage, l'architecture prend en charge NVMe-oF sur RoCE, permettant un stockage partagé désagrégé avec des latences approchant celles des disques NVMe locaux.

3. Rôle et caractéristiques clés du NVIDIA Mellanox MCX556A-ECAT

En tant que composant fondamental de cette solution, le NVIDIA Mellanox MCX556A-ECAT remplit trois rôles essentiels au sein de l'architecture :

Fonction Détail d'implémentation Avantage commercial
Moteur RDMA/RoCE RoCE v2 basé sur matériel avec prise en charge ECN/PFC, latence inférieure à 0,8 µs Implication CPU quasi nulle pour le déplacement des données ; performances déterministes
100 GbE double port Deux ports QSFP28 indépendants, débit agrégé de 200 Gb/s Liaison active-active pour la bande passante ; actif-veille pour la redondance
Déchargement de virtualisation et de superposition SR-IOV avec jusqu'à 128 VF par port ; déchargement matériel VXLAN/NVGRE Multi-location haute densité avec performances en ligne et isolation

Les spécifications techniques clés extraites de la officielle et au portail complet de documentation réseau de NVIDIA. Ce livre blanc sert de base — l'architecture est validée, les composants sont prêts pour la production et les avantages sont mesurables. La carte réseau PCIe de l'adaptateur comprennent une interface hôte PCIe 3.0/4.0 x16, des capacités de déchargement complètes (somme de contrôle, LSO/LRO, suppression/insertion VLAN, RSS) et une télémétrie avancée par port. L'efficacité énergétique de l'adaptateur (généralement inférieure à 15 W) et sa large prise en charge des systèmes d'exploitation en font un bloc de construction polyvalent pour les environnements hétérogènes. Les spécifications MCX556A-ECAT mettent également en évidence la prise en charge de la compatibilité 25 GbE et 40 GbE, offrant une flexibilité de déploiement pour les environnements à vitesse mixte.

4. Recommandations de déploiement et de mise à l'échelle

Pour les déploiements nouveaux, nous recommandons une topologie leaf-spine à deux niveaux avec un accès 100 GbE et des liaisons montantes 400 GbE vers le spine. Chaque serveur héberge une carte d'adaptateur Ethernet MCX556A-ECAT avec les deux ports QSFP28 connectés à des commutateurs leaf séparés pour la redondance. Le fabric RoCE nécessite une configuration QoS cohérente sur tous les commutateurs — spécifiquement, PFC sur la priorité 3 (pour le trafic RDMA) et la priorité 4 (pour le stockage), avec un marquage ECN sur les mêmes classes de trafic. Nous recommandons d'allouer des VLAN dédiés pour le trafic RoCE, de gestion et de stockage afin de simplifier la surveillance et le dépannage.

Pour les environnements existants avec une infrastructure 40 GbE, la solution de carte d'adaptateur Ethernet MCX556A-ECAT offre une voie de migration progressive. Comme l'adaptateur est rétrocompatible avec les optiques QSFP+ 40 GbE, le câblage existant peut être réutilisé lors de la mise à niveau progressive vers 100 GbE. L'adaptateur prend également en charge la commutation Ethernet standard sans activation RoCE obligatoire, permettant aux équipes de déployer d'abord le matériel et d'activer les capacités RDMA par étapes à mesure que le fabric mûrit et que les charges de travail justifient la transition.

La mise à l'échelle de la solution au-delà de 50 nœuds introduit des considérations supplémentaires. Nous recommandons la mise en œuvre d'une stratégie dédiée de gestion de la congestion RoCE utilisant des commutateurs NVIDIA Spectrum avec télémétrie intégrée et ajustement dynamique des seuils ECN. Pour les clusters dépassant 200 nœuds, envisagez de déployer un contrôleur de gestion de fabric centralisé (par exemple, NVIDIA Cumulus NetQ) pour maintenir la visibilité de bout en bout et la cohérence de la configuration automatisée. Le MCX556A-ECAT à vendre via les partenaires du canal mondial de NVIDIA comprend une garantie complète et une prise en charge des mises à jour du firmware, garantissant une fiabilité à long terme à grande échelle.

5. Opérations, surveillance, dépannage et optimisation

Le fonctionnement efficace du fabric RoCE nécessite une stratégie de surveillance et de dépannage multicouche :

  • Télémétrie au niveau de l'adaptateur : Les spécifications MCX556A-ECAT incluent des compteurs par port pour les trames PFC, les paquets marqués ECN, les trames perdues et les erreurs de lien. Utilisez mlx5cmd, ethtool, ou les outils de firmware NVIDIA pour exporter ces métriques vers des tableaux de bord Prometheus/Grafana.
  • Surveillance au niveau du commutateur : Surveillez l'occupation des tampons, les nombres de trames de pause, les profondeurs de file d'attente et les taux de marquage ECN sur les commutateurs spine et leaf. Les augmentations soudaines des trames de pause indiquent une micro-congestion qui peut nécessiter un réglage des seuils ECN.
  • Métriques au niveau de l'application : Pour les applications RDMA, suivez les latences d'achèvement WR (Work Request), les événements de dépassement de CQ (Completion Queue) et les nombres d'erreurs QP (Queue Pair) à l'aide des bibliothèques NVIDIA libibverbs et rdma-core.

Scénarios de dépannage courants et actions recommandées :

  • Dégradation des performances RoCE : Vérifiez que le PFC est activé sur tous les ports du commutateur et que le marquage DSCP correspond à la configuration du commutateur. Utilisez la officielle et au portail complet de documentation réseau de NVIDIA. Ce livre blanc sert de base — l'architecture est validée, les composants sont prêts pour la production et les avantages sont mesurables. La carte réseau PCIe de l'adaptateur pour valider les paramètres d'allocation de tampon par rapport aux valeurs recommandées pour votre profil de charge de travail.
  • Sauts de lien ou erreurs CRC : Vérifiez la qualité du câble QSFP28 et assurez-vous que le firmware de l'adaptateur est mis à jour vers la dernière version. Vérifiez que les câbles respectent les spécifications IEEE 802.3bj pour 100GBASE-SR4 ou LR4.
  • CPU toujours élevé malgré le déchargement : Confirmez que RDMA est effectivement utilisé (ne retombe pas sur TCP) en inspectant les compteurs de pilotes, les journaux d'applications et les états de connexion.
  • Interblocage PFC ou tempête de pauses : Vérifiez les priorités mal configurées et assurez-vous que le PFC n'est activé que sur les classes de trafic RoCE (pas sur le trafic de gestion ou de stockage).

Pour l'optimisation, nous recommandons les paramètres de réglage suivants basés sur des validations approfondies en laboratoire :

  • Agrégation d'interruptions (modération) : Réglez sur 4 à 8 µs pour les charges de travail mixtes (commerce + stockage) afin d'équilibrer la latence et l'efficacité du CPU.
  • MTU RDMA : Augmentez à 4096 octets pour les charges de travail de stockage afin de réduire la surcharge du protocole et d'améliorer le débit.
  • RSS (Receive Side Scaling) : Configurez sur plusieurs cœurs de CPU pour le trafic non-RDMA afin de distribuer le traitement et d'éviter la saturation d'un seul cœur.
  • Seuils ECN : Définissez le min-seuil à 50 % du tampon et le max-seuil à 80 % pour le trafic de priorité 3, en ajustant en fonction des modèles de congestion observés.

6. Résumé et évaluation de la valeur

La solution NVIDIA Mellanox MCX556A-ECAT apporte une valeur transformative aux centres de données modernes. En remplaçant le TCP/IP basé sur logiciel par RDMA/RoCE accéléré par matériel, les organisations peuvent obtenir des réductions de latence au niveau de l'application de 5 à 10 fois, réduire la surcharge réseau du CPU de plus de 80 % et augmenter la densité des conteneurs de serveurs de 30 à 50 %. La carte d'adaptateur Ethernet MCX556A-ECAT offre une voie rentable pour l'adoption du 100 GbE avec une protection de l'investissement grâce à la rétrocompatibilité avec le 40 GbE et des capacités de déchargement prêtes pour l'avenir pour les charges de travail émergentes.

Lors de l'évaluation du coût total de possession, le prix MCX556A-ECAT est compensé par des économies opérationnelles significatives : nombre de serveurs réduit (en raison d'une utilisation plus élevée), coûts de refroidissement inférieurs (grâce à une consommation d'énergie réduite par serveur), et une efficacité accrue des applications qui se traduit par un retour sur investissement plus rapide. La solution est <15W power draw), and elimination of separate InfiniBand or proprietary RDMA fabrics. The solution is fully compatible MCX556A-ECAT avec les principaux écosystèmes open-source et d'entreprise, y compris Kubernetes, Apache Spark, TensorFlow et VMware vSphere, garantissant une large applicabilité dans les déploiements d'entreprise, HPC et cloud-native.Pour les scripts de déploiement détaillés, les modèles de configuration et les rapports de référence de performance, veuillez vous référer à la

fiche technique MCX556A-ECAT officielle et au portail complet de documentation réseau de NVIDIA. Ce livre blanc sert de base — l'architecture est validée, les composants sont prêts pour la production et les avantages sont mesurables. La carte réseau PCIe de l'adaptateur MCX556A-ECAT ConnectX n'est pas simplement un adaptateur ; c'est un catalyseur stratégique pour le centre de données de l'avenir prêt pour RDMA et optimisé en débit.