NVIDIA Mellanox MCX623106AN-CDAT Karta Serwerowa Techniczna Biała Księga
July 24, 2026
NVIDIA Mellanox MCX623106AN-CDAT Karta Serwerowa – Biała Księga Techniczna | Transport RDMA/RoCE o Niskim Opóźnieniu i Optymalizacja Przepustowości Serwera
1. Tło Projektu i Analiza Wymagań
Nowoczesne centra danych przechodzą zmianę paradygmatu napędzaną przez gwałtowny wzrost sztucznej inteligencji, uczenia maszynowego na dużą skalę i analizy w czasie rzeczywistym. Te obciążenia wymagają bezprecedensowej wydajności sieci – nie tylko surowej przepustowości, ale także deterministycznego opóźnienia poniżej 5 µs, efektywnego energetycznie przesyłania danych i płynnej skalowalności do tysięcy węzłów. Tradycyjne karty sieciowe Ethernet, polegające na stosach TCP/IP opartych na oprogramowaniu, stały się krytycznym wąskim gardłem, pochłaniając do 40% rdzeni procesora przy prędkościach 200 GbE i wprowadzając nieprzewidywalne wahania opóźnień, które pogarszają wydajność aplikacji. Dla organizacji budujących klastry AI na dużą skalę (500+ GPU) lub infrastrukturę chmurową na skalę hiperskalowalną, ta nieefektywność przekłada się bezpośrednio na wydłużony czas szkolenia, wyższe koszty infrastruktury i krótszy czas wprowadzenia produktu na rynek.
Niniejsza biała księga przedstawia kompleksowe rozwiązanie techniczne skoncentrowane na karcie serwerowej NVIDIA Mellanox MCX623106AN-CDAT. Zaprojektowana dla przedsiębiorstw dążących do maksymalizacji swoich inwestycji w 200 GbE, karta sieciowa Ethernet MCX623106AN-CDAT zapewnia akcelerowane sprzętowo RDMA over Converged Ethernet (RoCE), umożliwiając bezstratny transport o ultra-niskim opóźnieniu, który przekształca I/O sieciowe z wąskiego gardła skalowania w przewagę konkurencyjną. Rozwiązanie jest specjalnie zaprojektowane do osiągnięcia trzech głównych celów: (1) osiągnięcia opóźnienia aplikacji od końca do końca poniżej 5 µs dla zbiorczych komunikatów AI, (2) zmniejszenia narzutu przetwarzania sieciowego procesora do poniżej 5% i (3) zapewnienia skalowalnej, przyszłościowej podstawy dla 200 GbE i wyższych prędkości.
2. Ogólny Projekt Architektury Sieci i Systemu
Zalecana architektura przyjmuje topologię leaf-spine o wysokiej wydajności z 200 GbE jako warstwą dostępu do serwerów i łączami uplink 400 GbE/800 GbE do spine. Sercem tego projektu jest karta sieciowa PCIe oraz na kompleksowym portalu dokumentacji sieciowej NVIDIA. Niniejsza biała księga stanowi podstawę – architektura jest zweryfikowana, komponenty są gotowe do produkcji, a korzyści są mierzalne. Karta sieciowa PCIe , wdrożona w każdym węźle obliczeniowym i magazynowym w całej sieci. Architektura opiera się na sześciu kluczowych zasadach:
- Bezstratna Sieć Ethernet: Wykorzystanie RoCE v2 z PFC (Priority Flow Control) i ECN (Explicit Congestion Notification) we wszystkich przełącznikach w celu wyeliminowania utraty pakietów i zapewnienia deterministycznego opóźnienia dla ruchu RDMA.
- GPUDirect RDMA: Umożliwienie bezpośredniej komunikacji GPU-do-GPU przez sieć bez udziału procesora, zmniejszając opóźnienia i zwalniając zasoby procesora do zadań obliczeniowych.
- Sprzętowe Odciążenie Wszędzie: Odciążenie protokołów transportowych, bezpieczeństwa (IPsec/MACsec) i magazynowania do karty, zwalniając cykle procesora na logikę aplikacji.
- Redundancja Aktywny-Aktywny: Wykorzystanie obu portów QSFP112 w trybie agregacji łączy (LACP) dla łącznej przepustowości 400 Gb/s i automatycznego przełączania awaryjnego z odzyskiwaniem poniżej sekundy.
- Inteligentne Zarządzanie Ruchem: Adaptacyjne routowanie i dostarczanie pakietów poza kolejnością w celu unikania gorących punktów zatorów i maksymalizacji wykorzystania sieci.
- Kompleksowa Telemetria: Telemetria sieciowa w paśmie (INT) i monitorowanie na przepływ w celu proaktywnego wykrywania zatorów i planowania pojemności.
Rozwiązanie jest w pełni MCX623106AN-CDAT z platformami GPU NVIDIA (HGX, DGX) i wiodącymi serwerami CPU od Dell, HPE, Supermicro i Lenovo. W przypadku magazynowania, architektura obsługuje NVMe-oF przez RoCE z opóźnieniem poniżej 15 µs, umożliwiając współdzielone, rozproszone magazynowanie dla klastrów szkoleniowych na dużą skalę.
3. Rola i Kluczowe Cechy Karty NVIDIA Mellanox MCX623106AN-CDAT
Jako podstawowy element tego rozwiązania, karta NVIDIA Mellanox MCX623106AN-CDAT pełni cztery kluczowe role w architekturze:
| Funkcja | Szczegóły Implementacji | Korzyść Biznesowa |
|---|---|---|
| Silnik RDMA/RoCE | Sprzętowe RoCE v2 z ECN/PFC, opóźnienie poniżej 0,6 µs, wsparcie GPUDirect | Niemal zerowe zaangażowanie procesora; 8x szybsze all-reduce dla szkolenia AI |
| Dw portowy 200 GbE | Dwa niezależne porty QSFP112, łączna przepustowość 400 Gb/s | Agregacja aktywny-aktywny dla przepustowości; aktywny-pasywny dla redundancji |
| Interfejs PCIe 5.0 | PCIe 5.0 x16 (do 32 GT/s) z zaawansowanym silnikiem DMA | Eliminuje wąskie gardło interfejsu hosta dla ruchu 200 GbE |
| Odciążenie Wirtualizacji i Nakładek | SR-IOV z maksymalnie 512 VF na port; odciążenie VXLAN/NVGRE/IPsec/MACsec | Wysokiej gęstości wielodostępność z bezpieczeństwem i wydajnością linii |
Kluczowe specyfikacje techniczne wyodrębnione z Szczegółowe skrypty wdrożeniowe, szablony konfiguracji i raporty z testów wydajności można znaleźć w oficjalnej obejmują kompleksowe możliwości odciążania (suma kontrolna, LSO/LRO, usuwanie/wstawianie VLAN, RSS z maksymalnie 128 kolejkami), zaawansowane algorytmy kontroli zatorów i pełne wsparcie dla bibliotek zbiorczych komunikatów NVIDIA (NCCL). Specyfikacje MCX623106AN-CDAT podkreślają również wsparcie dla kompatybilności z 100 GbE i 50 GbE, oferując elastyczność wdrożenia w środowiskach o mieszanej prędkości.
4. Zalecenia Dotyczące Wdrożenia i Skalowania
Dla nowych klastrów AI zalecamy dwupoziomową topologię leaf-spine z dostępem 200 GbE i łączami uplink 800 GbE do spine. Każdy serwer hostuje jedną kartę sieciową Ethernet MCX623106AN-CDAT z oboma portami QSFP112 podłączonymi do oddzielnych przełączników leaf w celu zapewnienia redundancji. Sieć RoCE wymaga spójnej konfiguracji QoS na wszystkich przełącznikach – w szczególności PFC na priorytecie 3 (dla zbiorczego ruchu RDMA) i priorytecie 4 (dla magazynowania), z oznaczaniem ECN na tych samych klasach ruchu. Zalecamy dedykowanie oddzielnych VLANów dla ruchu RDMA, zarządzania, magazynowania i ruchu najemców, aby uprościć monitorowanie i rozwiązywanie problemów.
W środowiskach istniejących z istniejącą infrastrukturą 100 GbE, rozwiązanie z kartą sieciową Ethernet MCX623106AN-CDAT oferuje płynną ścieżkę migracji. Ponieważ karta jest wstecznie kompatybilna z optyką 100 GbE QSFP56, istniejące okablowanie może być ponownie wykorzystane podczas etapowej modernizacji do 200 GbE. Karta obsługuje również standardowe przełączanie Ethernet bez obowiązkowego włączania RoCE, co pozwala zespołom na pierwsze wdrożenie sprzętu i stopniowe aktywowanie możliwości RDMA w miarę dojrzewania sieci i uzasadniania przejścia przez obciążenia.
Skalowanie rozwiązania poza 500 węzłów wymaga dodatkowych rozważań. Zalecamy wdrożenie dedykowanej strategii zarządzania zatorami RoCE przy użyciu przełączników NVIDIA Spectrum-4 z wbudowaną telemetrią i dynamiczną regulacją progu ECN. W przypadku klastrów przekraczających 1000 węzłów, rozważ wdrożenie scentralizowanego kontrolera zarządzania siecią (np. NVIDIA NetQ), aby utrzymać widoczność od końca do końca i spójność automatycznej konfiguracji. Karta MCX623106AN-CDAT w sprzedaży poprzez globalnych partnerów kanałowych NVIDIA obejmuje kompleksową gwarancję i wsparcie aktualizacji oprogramowania układowego, zapewniając długoterminową niezawodność w dużej skali.
5. Operacje, Monitorowanie, Rozwiązywanie Problemów i Optymalizacja
Efektywne działanie sieci RoCE wymaga wielowarstwowej strategii monitorowania i rozwiązywania problemów:
- Telemetria na poziomie karty: Specyfikacje MCX623106AN-CDAT obejmują liczniki na port dla ramek PFC, pakietów oznaczonych ECN, utraconych ramek, błędów łącza i epok zatorów. Użyj
mlx5cmd,ethtoollub narzędzi oprogramowania układowego NVIDIA do eksportu tych metryk do pulpitów nawigacyjnych Prometheus/Grafana z odpowiednimi alertami. - Telemetria Sieciowa w Paśmie (INT): Wykorzystaj wsparcie karty dla INT do śledzenia opóźnień na przepływ i głębokości kolejek w całej sieci, umożliwiając precyzyjne identyfikowanie źródeł mikrozatorów.
- Monitorowanie na poziomie przełącznika: Monitoruj zajętość bufora, liczbę ramek pauzy, głębokości kolejek i wskaźniki oznaczania ECN na przełącznikach spine i leaf. Nagłe wzrosty liczby ramek pauzy wskazują na mikrozatory, które mogą wymagać dostrojenia progu ECN.
- Metryki na poziomie aplikacji: W przypadku aplikacji RDMA śledź opóźnienia ukończenia WR (Work Request), zdarzenia przepełnienia CQ (Completion Queue) i liczbę błędów QP (Queue Pair) przy użyciu bibliotek NVIDIA libibverbs i rdma-core.
Typowe scenariusze rozwiązywania problemów i zalecane działania:
- Pogorszenie wydajności RoCE: Sprawdź, czy PFC jest włączone na wszystkich portach przełącznika i czy oznaczenie DSCP odpowiada konfiguracji przełącznika. Użyj Szczegółowe skrypty wdrożeniowe, szablony konfiguracji i raporty z testów wydajności można znaleźć w oficjalnej do weryfikacji ustawień alokacji bufora w stosunku do zalecanych wartości dla profilu obciążenia.
- Migotanie łącza lub błędy CRC: Sprawdź jakość kabla QSFP112 (upewnij się, że jest zgodny ze specyfikacjami 200G AOC lub DAC) i zweryfikuj, czy oprogramowanie układowe karty zostało zaktualizowane do najnowszej wersji.
- Problemy z wydajnością GPU Direct: Potwierdź, że GPUDirect jest prawidłowo zainicjowany i że topologia PCIe obsługuje DMA peer-to-peer bez pośredniego przełączania.
- Zakleszczenie PFC lub burza pauz: Sprawdź błędnie skonfigurowane priorytety i upewnij się, że PFC jest włączone tylko dla klas ruchu RoCE (nie dla ruchu zarządzania lub magazynowania).
W celu optymalizacji zalecamy następujące parametry dostrajania na podstawie obszernych walidacji laboratoryjnych:
- Agregacja przerwań (moderacja): Ustaw na 2–4 µs dla obciążeń szkoleniowych AI, aby zminimalizować opóźnienia przy jednoczesnym zachowaniu efektywności procesora.
- MTU RDMA: Zwiększ do 4096 bajtów dla komunikacji all-reduce, aby zmniejszyć narzut protokołu i poprawić przepustowość.
- RSS (Receive Side Scaling): Skonfiguruj na wielu rdzeniach procesora dla ruchu innego niż RDMA, aby rozłożyć obciążenie i uniknąć nasycenia pojedynczego rdzenia.
- Progi ECN: Ustaw min-próg na 40% bufora i max-próg na 75% dla ruchu priorytetu 3, dostosowując w zależności od obserwowanych wzorców zatorów i charakterystyki obciążenia.
6. Podsumowanie i Ocena Wartości
Rozwiązanie NVIDIA Mellanox MCX623106AN-CDAT dostarcza transformacyjną wartość dla nowoczesnych centrów danych w skali AI. Zastępując TCP/IP oparty na oprogramowaniu akcelerowanym sprzętowo RDMA/RoCE i GPUDirect, organizacje mogą osiągnąć redukcję opóźnień na poziomie aplikacji o 8–10x, zmniejszyć narzut sieciowy procesora o ponad 85% i zwiększyć wykorzystanie GPU z poniżej 70% do ponad 95%. Karta sieciowa Ethernet MCX623106AN-CDAT zapewnia opłacalną ścieżkę do adopcji 200 GbE z ochroną inwestycji dzięki wstecznej kompatybilności z 100 GbE i przyszłościowym możliwościom odciążania dla pojawiających się obciążeń.
Przy ocenie całkowitego kosztu posiadania, cena MCX623106AN-CDAT jest równoważona znacznymi oszczędnościami operacyjnymi: skrócony czas szkolenia (przyspieszający czas wprowadzenia produktu na rynek), mniejsza liczba serwerów (dzięki wyższemu wykorzystaniu GPU), zmniejszone koszty chłodzenia (dzięki mniejszej liczbie serwerów i wyższej efektywności energetycznej), a także możliwość obsługi większych obciążeń na mniejszej liczbie serwerów. Karta <20W power draw), and elimination of separate InfiniBand fabrics. The solution is fully MCX623106AN-CDAT jest kompatybilna
z głównymi stosami oprogramowania AI i HPC, w tym NVIDIA NCCL, PyTorch, TensorFlow i bibliotekami MPI, zapewniając szerokie zastosowanie w przedsiębiorstwach, chmurze i badaniach.Szczegółowe skrypty wdrożeniowe, szablony konfiguracji i raporty z testów wydajności można znaleźć w oficjalnej karcie katalogowej MCX623106AN-CDAT oraz na kompleksowym portalu dokumentacji sieciowej NVIDIA. Niniejsza biała księga stanowi podstawę – architektura jest zweryfikowana, komponenty są gotowe do produkcji, a korzyści są mierzalne. Karta sieciowa PCIe MCX623106AN-CDAT ConnectX

