NVIDIA Mellanox MCX623106AN-CDAT Adaptateur serveur Livre blanc technique

July 24, 2026

NVIDIA Mellanox MCX623106AN-CDAT Adaptateur serveur Livre blanc technique

NVIDIA Mellanox MCX623106AN-CDAT Carte d'Adaptateur Serveur Livre Blanc Technique | Transport RDMA/RoCE à Faible Latence et Optimisation du Débit Serveur

1. Contexte du Projet et Analyse des Besoins

Les centres de données modernes connaissent un changement de paradigme, entraîné par la croissance explosive de l'intelligence artificielle, de l'apprentissage automatique à grande échelle et de l'analyse en temps réel. Ces charges de travail exigent des performances réseau sans précédent — pas seulement une bande passante brute, mais une latence déterministe inférieure à 5 µs, un déplacement de données efficace pour le CPU et une évolutivité transparente vers des milliers de nœuds. Les cartes réseau Ethernet traditionnelles, qui s'appuient sur des piles TCP/IP basées sur logiciel, sont devenues un goulot d'étranglement critique, consommant jusqu'à 40 % des cœurs de processeur à des vitesses de 200 GbE et introduisant des variations de latence imprévisibles qui dégradent les performances des applications. Pour les organisations qui construisent des clusters d'IA à grande échelle (plus de 500 GPU) ou une infrastructure cloud hyperscale, cette inefficacité se traduit directement par des temps d'entraînement prolongés, des coûts d'infrastructure plus élevés et un délai de mise sur le marché plus lent.

Ce livre blanc présente une solution technique complète centrée sur la carte d'adaptateur serveur NVIDIA Mellanox MCX623106AN-CDAT. Conçue pour les entreprises cherchant à maximiser leurs investissements de 200 GbE, la carte réseau Ethernet carte réseau Ethernet MCX623106AN-CDAT offre RDMA sur Ethernet Convergé (RoCE) accéléré par matériel, permettant un transport sans perte et à latence ultra-faible qui transforme l'E/S réseau d'un goulot d'étranglement d'évolutivité en un avantage concurrentiel. La solution est spécifiquement architecturée pour atteindre trois objectifs principaux : (1) atteindre une latence d'application de bout en bout inférieure à 5 µs pour les communications collectives d'IA, (2) réduire la surcharge de traitement réseau du CPU à moins de 5 %, et (3) fournir une base évolutive et pérenne pour 200 GbE et au-delà.

2. Conception Globale de l'Architecture Réseau et Système

L'architecture recommandée adopte une topologie leaf-spine haute performance avec 200 GbE comme couche d'accès serveur et des liaisons montantes 400 GbE/800 GbE vers le spine. Au cœur de cette conception se trouve la carte réseau PCIe d'adaptateur MCX623106AN-CDAT ConnectX, déployée dans chaque nœud de calcul et de stockage à travers le fabric. L'architecture est construite autour de six principes clés :

  • Fabric Ethernet sans perte : Utilisation de RoCE v2 avec PFC (Priority Flow Control) et ECN (Explicit Congestion Notification) sur tous les commutateurs pour éliminer les pertes de paquets et garantir une latence déterministe pour le trafic RDMA.
  • GPUDirect RDMA : Permet la communication directe GPU à GPU sur le réseau sans intervention du CPU, réduisant la latence et libérant les ressources CPU pour les tâches de calcul.
  • Déchargement matériel partout : Déchargement des protocoles de transport, de sécurité (IPsec/MACsec) et de stockage sur la carte, libérant les cycles CPU pour la logique applicative.
  • Redondance Active-Active : Utilisation des deux ports QSFP112 en mode agrégation de liens (LACP) pour une bande passante agrégée de 400 Gb/s et un basculement automatique avec récupération en moins d'une seconde.
  • Ingénierie de trafic intelligente : Routage adaptatif et livraison de paquets hors séquence pour éviter les points chauds de congestion et maximiser l'utilisation du fabric.
  • Télémétrie complète : Télémétrie réseau en bande (INT) et surveillance par flux pour la détection proactive de la congestion et la planification de la capacité.

La solution est entièrement MCX623106AN-CDAT compatible avec les plateformes GPU NVIDIA (HGX, DGX) et les principaux serveurs CPU de Dell, HPE, Supermicro et Lenovo. Pour le stockage, l'architecture prend en charge NVMe-oF sur RoCE avec une latence inférieure à 15 µs, permettant un stockage partagé désagrégé pour les clusters d'entraînement à grande échelle.

3. Le Rôle et les Caractéristiques Clés du NVIDIA Mellanox MCX623106AN-CDAT

En tant que composant fondamental de cette solution, le NVIDIA Mellanox MCX623106AN-CDAT remplit quatre rôles critiques au sein de l'architecture :

Fonction Détail d'implémentation Avantage commercial
Moteur RDMA/RoCE RoCE v2 basé sur matériel avec ECN/PFC, latence inférieure à 0,6 µs, prise en charge GPUDirect Implication CPU quasi nulle ; all-reduce 8 fois plus rapide pour l'entraînement IA
200 GbE à double port Deux ports QSFP112 indépendants, débit agrégé de 400 Gb/s Liaison active-active pour la bande passante ; actif-veille pour la redondance
Interface PCIe 5.0 PCIe 5.0 x16 (jusqu'à 32 GT/s) avec moteur DMA avancé Élimine le goulot d'étranglement de l'interface hôte pour le trafic 200 GbE
Déchargement de virtualisation et de superposition SR-IOV avec jusqu'à 512 VF par port ; déchargement VXLAN/NVGRE/IPsec/MACsec Multi-tenant haute densité avec sécurité et performances à débit ligne

Les spécifications techniques clés extraites de la fiche technique MCX623106AN-CDAT incluent des capacités de déchargement complètes (checksum, LSO/LRO, suppression/insertion VLAN, RSS avec jusqu'à 128 files d'attente), des algorithmes avancés de contrôle de congestion et une prise en charge complète des bibliothèques de communication collective NVIDIA (NCCL). Les spécifications MCX623106AN-CDAT mettent également en évidence la prise en charge de la compatibilité 100 GbE et 50 GbE, offrant une flexibilité de déploiement pour les environnements à vitesse mixte.

4. Recommandations de Déploiement et de Mise à l'Échelle

Pour les clusters d'IA nouveaux, nous recommandons une topologie leaf-spine à deux niveaux avec un accès 200 GbE et des liaisons montantes spine 800 GbE. Chaque serveur héberge une carte réseau Ethernet MCX623106AN-CDAT avec les deux ports QSFP112 connectés à des commutateurs leaf séparés pour la redondance. Le fabric RoCE nécessite une configuration QoS cohérente sur tous les commutateurs — spécifiquement, PFC sur la priorité 3 (pour le trafic collectif RDMA) et la priorité 4 (pour le stockage), avec marquage ECN sur les mêmes classes de trafic. Nous recommandons de dédier des VLAN séparés pour le trafic RDMA, de gestion, de stockage et de locataire afin de simplifier la surveillance et le dépannage.

Pour les environnements existants avec une infrastructure 100 GbE, la solution de carte réseau Ethernet MCX623106AN-CDAT offre une voie de migration progressive. Comme la carte est rétrocompatible avec les optiques QSFP56 100 GbE, le câblage existant peut être réutilisé lors de la mise à niveau progressive vers 200 GbE. La carte prend également en charge la commutation Ethernet standard sans activation RoCE obligatoire, permettant aux équipes de déployer d'abord le matériel et d'activer les capacités RDMA par étapes à mesure que le fabric mûrit et que les charges de travail justifient la transition.

La mise à l'échelle de la solution au-delà de 500 nœuds nécessite des considérations supplémentaires. Nous recommandons la mise en œuvre d'une stratégie dédiée de gestion de la congestion RoCE à l'aide de commutateurs NVIDIA Spectrum-4 avec télémétrie intégrée et ajustement dynamique du seuil ECN. Pour les clusters dépassant 1 000 nœuds, envisagez de déployer un contrôleur de gestion de fabric centralisé (par exemple, NVIDIA NetQ) pour maintenir une visibilité de bout en bout et une cohérence de configuration automatisée. Le MCX623106AN-CDAT à vendre via les partenaires mondiaux de NVIDIA inclut une garantie complète et une prise en charge des mises à jour du firmware, garantissant une fiabilité à long terme à grande échelle.

5. Opérations, Surveillance, Dépannage et Optimisation

Le fonctionnement efficace du fabric RoCE nécessite une stratégie de surveillance et de dépannage à plusieurs niveaux :

  • Télémétrie au niveau de la carte : Les spécifications MCX623106AN-CDAT incluent des compteurs par port pour les trames PFC, les paquets marqués ECN, les trames perdues, les erreurs de lien et les époques de congestion. Utilisez mlx5cmd, ethtool, ou les outils de firmware NVIDIA pour exporter ces métriques vers des tableaux de bord Prometheus/Grafana avec des alertes appropriées.
  • Télémétrie réseau en bande (INT) : Exploitez la prise en charge INT de la carte pour suivre la latence par flux et les profondeurs de file d'attente à travers le fabric, permettant une identification précise des sources de micro-congestion.
  • Surveillance au niveau du commutateur : Surveillez l'occupation des tampons, les nombres de trames de pause, les profondeurs de file d'attente et les taux de marquage ECN sur les commutateurs spine et leaf. Les augmentations soudaines des trames de pause indiquent une micro-congestion qui peut nécessiter un réglage des seuils ECN.
  • Métriques au niveau de l'application : Pour les applications RDMA, suivez les latences d'achèvement des WR (Work Request), les événements de débordement des CQ (Completion Queue) et les décomptes d'erreurs des QP (Queue Pair) à l'aide des bibliothèques NVIDIA libibverbs et rdma-core.

Scénarios de dépannage courants et actions recommandées :

  • Dégradation des performances RoCE : Vérifiez que le PFC est activé sur tous les ports de commutateur et que le marquage DSCP correspond à la configuration du commutateur. Utilisez la fiche technique MCX623106AN-CDAT pour valider les paramètres d'allocation de tampon par rapport aux valeurs recommandées pour votre profil de charge de travail.
  • Sauts de lien ou erreurs CRC : Vérifiez la qualité du câble QSFP112 (assurez-vous de la conformité aux spécifications 200G AOC ou DAC) et vérifiez que le firmware de la carte est mis à jour vers la dernière version.
  • Problèmes de performances GPU Direct : Confirmez que GPUDirect est correctement initialisé et que la topologie PCIe prend en charge le DMA peer-to-peer sans commutation intermédiaire.
  • Interblocage PFC ou tempête de pause : Vérifiez les priorités mal configurées et assurez-vous que le PFC est activé uniquement sur les classes de trafic RoCE (pas sur le trafic de gestion ou de stockage).

Pour l'optimisation, nous recommandons les paramètres de réglage suivants basés sur des validations approfondies en laboratoire :

  • Agrégation d'interruptions (modération) : Réglez sur 2–4 µs pour les charges de travail d'entraînement IA afin de minimiser la latence tout en maintenant l'efficacité du CPU.
  • MTU RDMA : Augmentez à 4096 octets pour les communications all-reduce afin de réduire la surcharge du protocole et d'améliorer le débit.
  • RSS (Receive Side Scaling) : Configurez sur plusieurs cœurs CPU pour le trafic non-RDMA afin de distribuer le traitement et d'éviter la saturation d'un seul cœur.
  • Seuils ECN : Réglez le min-seuil à 40 % du tampon et le max-seuil à 75 % pour le trafic de priorité 3, en ajustant en fonction des modèles de congestion observés et des caractéristiques de la charge de travail.

6. Résumé et Évaluation de la Valeur

La solution NVIDIA Mellanox MCX623106AN-CDAT apporte une valeur transformative aux centres de données modernes à l'échelle de l'IA. En remplaçant le TCP/IP basé sur logiciel par RDMA/RoCE et GPUDirect accélérés par matériel, les organisations peuvent obtenir des réductions de latence au niveau de l'application de 8 à 10 fois, réduire la surcharge réseau du CPU de plus de 85 % et augmenter l'utilisation du GPU de moins de 70 % à plus de 95 %. La carte réseau Ethernet MCX623106AN-CDAT offre une voie rentable vers l'adoption de 200 GbE avec une protection de l'investissement grâce à la rétrocompatibilité avec 100 GbE et des capacités de déchargement prêtes pour l'avenir pour les charges de travail émergentes.

Lors de l'évaluation du coût total de possession, le prix MCX623106AN-CDAT est compensé par des économies opérationnelles significatives : temps d'entraînement réduit (accélérant le délai de mise sur le marché), nombre de serveurs réduit (en raison d'une utilisation plus élevée du GPU), coûts de refroidissement réduits (grâce à <20W power draw), and elimination of separate InfiniBand fabrics. The solution is fully MCX623106AN-CDAT compatible avec les principales piles logicielles d'IA et HPC, y compris les bibliothèques NVIDIA NCCL, PyTorch, TensorFlow et MPI, garantissant une large applicabilité dans les déploiements d'entreprise, cloud et de recherche.

Pour des scripts de déploiement détaillés, des modèles de configuration et des rapports de benchmarks de performance, veuillez vous référer à la fiche technique MCX623106AN-CDAT officielle et au portail de documentation réseau complet de NVIDIA. Ce livre blanc sert de base — l'architecture est validée, les composants sont prêts pour la production et les avantages sont mesurables. La carte réseau PCIe d'adaptateur MCX623106AN-CDAT ConnectX n'est pas simplement une carte d'adaptateur ; c'est un catalyseur stratégique pour le centre de données de l'avenir, prêt pour l'IA et à latence ultra-faible.