NVIDIA Mellanox MCX623106AN-CDAT Server Adapter w akcji.
July 22, 2026
NVIDIA Mellanox MCX623106AN-CDAT w akcji | Niskie opóźnienia RDMA/RoCE i wzrost przepustowości serwerów
Tło i wyzwanie: Kiedy 200GbE napotyka ścianę skalowania AI
Szybko rozwijająca się organizacja badawcza AI — nazwijmy ją „DeepCore Labs” — napotkała krytyczne wąskie gardło w skalowaniu. Ich flagowy klaster do trenowania dużych modeli językowych, składający się z 512 procesorów graficznych NVIDIA H100 rozmieszczonych na 128 węzłach, doświadczał poważnego spadku wydajności podczas skalowania powyżej 64 węzłów. Problem nie leżał w mocy obliczeniowej ani pamięci, ale w sieci szkieletowej. Synchronizacja gradientów all-reduce zajmowała ponad 15 sekund na iterację, a wykorzystanie GPU spadło do zaledwie 62% z powodu przestojów sieciowych. Ich istniejąca infrastruktura 100GbE, oparta na TCP/IP opartym na oprogramowaniu, po prostu nie była w stanie obsłużyć impulsywnych, wrażliwych na opóźnienia wzorców komunikacji trenowania rozproszonego. Zespół potrzebował rozwiązania, które mogłoby zapewnić przepustowość 200GbE liniową z deterministycznymi opóźnieniami na poziomie mikrosekund.
Ich ocena doprowadziła ich do NVIDIA Mellanox MCX623106AN-CDAT — adaptera serwerowego 200GbE zaprojektowanego do najbardziej wymagających obciążeń AI i HPC. Zespół badawczy zdał sobie sprawę, że MCX623106AN-CDAT ConnectX adapter PCIe network card oferuje zaawansowane odciążenia i możliwości GPUDirect wymagane do wyeliminowania wąskiego gardła sieciowego i maksymalizacji wykorzystania GPU.
Rozwiązanie: Wdrożenie karty adaptera Ethernet MCX623106AN-CDAT
DeepCore Labs wdrożyło karta adaptera Ethernet MCX623106AN-CDAT na wszystkich 128 węzłach treningowych, z każdym serwerem wyposażonym w jeden dwuportowy adapter QSFP112 podłączony do sieci szkieletowej leaf-spine zbudowanej na przełącznikach NVIDIA Spectrum-4. Wdrożenie wykorzystało natywne wsparcie adaptera dla RoCE v2, aby umożliwić bezstratny transport Ethernet, eliminując potrzebę oddzielnej sieci InfiniBand. Kluczową cechą rozwiązania była możliwość GPUDirect RDMA adaptera, która umożliwiła bezpośrednie przesyłanie danych między GPU przez sieć bez interwencji CPU — kluczowa funkcja do zmniejszenia narzutu synchronizacji.
Zespół skonfigurował PFC (Priority Flow Control) i ECN (Explicit Congestion Notification) na poziomie przełączników, dedykując priorytet 3 dla ruchu komunikacji zbiorczej i priorytet 4 dla I/O pamięci masowej. Zaimplementowali również technologię adaptacyjnego routingu NVIDIA, aby dynamicznie rozkładać ruch na wiele ścieżek, minimalizując punkty gorące. W ciągu czterech tygodni cała sieć treningowa działała na RDMA, a wszystkie 512 GPU komunikowały się bezproblemowo przez RoCE. Ekosystem kompatybilny z MCX623106AN-CDAT okazał się solidny — karty bezproblemowo zintegrowały się z serwerami opartymi na H100 i biblioteką NVIDIA NCCL (NVIDIA Collective Communications Library) bez żadnych modyfikacji.
Zespół odwołał się do karcie katalogowej MCX623106AN-CDAT w celu dostrojenia alokacji buforów i parametrów kontroli przeciążenia, osiągając optymalną wydajność dla swojego środowiska mieszanych obciążeń — które obejmowało zarówno trenowanie synchroniczne (zdominowane przez all-reduce), jak i asynchroniczne tworzenie kopii zapasowych.
Mierzalne wyniki: Efektywność skalowania, przepustowość i wykorzystanie GPU
Wzrost wydajności był transformacyjny. Dzięki włączonemu RDMA przez RoCE za pośrednictwem NVIDIA Mellanox MCX623106AN-CDAT opóźnienie synchronizacji all-reduce spadło ze średnio 15,2 sekundy do zaledwie 1,8 sekundy na iterację — poprawa 8,4x. Przełożyło się to bezpośrednio na szybszą konwergencję modelu: całkowity czas trenowania ich modelu z 70 miliardami parametrów skrócił się z 42 dni do 19 dni, przyspieszając cykl badawczy o ponad 50%.
Wykorzystanie GPU, które wynosiło zaledwie 62% z powodu przestojów sieciowych, wzrosło do 94% po modernizacji — poprawa efektywnej mocy obliczeniowej o 52%. Zaawansowane mechanizmy umieszczania danych poza kolejnością i taktowania pakietów adaptera wyeliminowały mikropakiety, które powodowały skoki opóźnień końcowych, zapewniając spójną wydajność na wszystkich węzłach.
Poza wydajnością trenowania, wzrost przepustowości serwerów był równie przekonujący. Silnik odciążania sprzętowego — w tym odciążanie sum kontrolnych, LSO/LRO i akceleracja RoCE — zmniejszył wykorzystanie CPU do przetwarzania sieci z 38% do poniżej 4% na wszystkich węzłach. Uwolniło to znaczną moc obliczeniową CPU do wstępnego przetwarzania danych, kompresji kopii zapasowych i innych zadań pomocniczych, które wcześniej były ograniczone.
| Metryka | Przed (starsza karta sieciowa 100GbE) | Po (MCX623106AN-CDAT) | Poprawa |
|---|---|---|---|
| Opóźnienie All-Reduce (na iterację) | 15,2 s | 1,8 s | 8,4x szybciej |
| Wykorzystanie GPU | 62% | 94% | 52% wyższe |
| Czas trenowania modelu (70B parametrów) | 42 dni | 19 dni | 55% szybciej |
| Narzut sieciowy CPU | 38% | < 4% | 89% niższy |
| Opóźnienie odczytu NVMe-oF (pamięć masowa) | 185 µs | 12 µs | 15x szybciej |
Korzyści operacyjne: TCO i efektywność infrastruktury
Chociaż wzrost wydajności był dramatyczny, korzyści operacyjne i finansowe były równie zauważalne. Rozwiązanie karty adaptera Ethernet MCX623106AN-CDAT zmniejszyło całkowity koszt posiadania poprzez wyeliminowanie potrzeby oddzielnej sieci InfiniBand — oszczędzając ponad 500 tys. USD na kosztach infrastruktury przełączników. Energooszczędna konstrukcja adaptera (poniżej 20 W na kartę) przyczyniła się do mierzalnych oszczędności energii w klastrze 128 węzłów, zmniejszając roczne koszty chłodzenia o szacunkowo 18%.
Dla menedżerów IT oceniających cenę MCX623106AN-CDAT w porównaniu z alternatywnymi rozwiązaniami, dyrektor ds. infrastruktury DeepCore zauważył, że okres zwrotu wyniósł poniżej sześciu miesięcy — napędzany głównie przez zmniejszony czas trenowania, który bezpośrednio przyspieszył ich potok rozwoju produktu. Zespół docenił również przyszłościowe rozwiązania adaptera: ten sam MCX623106AN-CDAT na sprzedaż dziś obsługuje 200GbE, ale jest również kompatybilny z optyką 100GbE i 50GbE, zapewniając elastyczność dla środowisk o mieszanej prędkości i stopniowych modernizacji.
Według specyfikacji MCX623106AN-CDAT adapter zawiera kompleksowe funkcje telemetryczne, w tym telemetrykę sieciową w paśmie (INT) i śledzenie opóźnień dla poszczególnych przepływów. DeepCore zintegrowało te metryki ze swoim stosem Prometheus/Grafana, umożliwiając proaktywne wykrywanie mikrozatorów, zanim wpłynęły one na wydajność trenowania. Zespół wykorzystał również algorytmy kontroli przeciążenia adaptera do dynamicznego dostosowywania progów ECN, utrzymując bezstratne zachowanie nawet podczas operacji tworzenia kopii zapasowych, które generowały dodatkowe obciążenie sieciowe.
Podsumowanie i perspektywy: Plan dla sieci na skalę AI
Podróż DeepCore Labs z NVIDIA Mellanox MCX623106AN-CDAT demonstruje jasny plan dla organizacji budujących lub skalujących infrastrukturę AI. Łącząc dwuportową przepustowość 200GbE, interfejs hosta PCIe 5.0 i RDMA z obsługą GPUDirect, karta adaptera Ethernet MCX623106AN-CDAT przekształca sieć z wąskiego gardła skalowania w mnożnik wydajności. Wyniki — 8,4x szybsze all-reduce, 94% wykorzystanie GPU i 55% szybsze cykle trenowania — świadczą o zdolności adaptera do dostarczania wymiernych wyników biznesowych w najbardziej wymagających środowiskach obliczeniowych.
Patrząc w przyszłość, w miarę jak rozmiary modeli nadal podwajają się co kilka miesięcy, a klastry trenowania rozproszonego rozszerzają się do tysięcy GPU, MCX623106AN-CDAT ConnectX adapter PCIe network card stanowi solidną podstawę dla bezstratnych sieci o ultra-niskich opóźnieniach. Dla architektów i liderów IT planujących kolejne inwestycje w infrastrukturę AI, ten adapter stanowi nie tylko komponent, ale strategiczny czynnik umożliwiający przewagę konkurencyjną. Szczegółowe parametry dostrajania, skrypty wdrażania i raporty z testów wydajności są dostępne w oficjalnej karcie katalogowej MCX623106AN-CDAT — niezbędnym odniesieniu dla każdego wdrożenia AI na dużą skalę.

