NVIDIA Mellanox MCX4121A-ACAT Server Adapter w akcji.
July 22, 2026
NVIDIA Mellanox MCX4121A-ACAT Server Adapter w akcji | Niskie opóźnienia RDMA/RoCE i wzrost przepustowości serwera
Tło i wyzwanie: Kiedy 25GbE napotyka ścianę opóźnień
Średniej wielkości dostawca usług chmurowych – nazwijmy go „CloudNova” – borykał się ze znajomym, ale bolesnym wąskim gardłem. Ich centrum danych działało w oparciu o infrastrukturę 25GbE, ale wydajność aplikacji opowiadała inną historię. Replikacja baz danych opóźniała się, rozproszone zadania uczenia maszynowego utknęły na synchronizacji gradientów, a macierze pamięci masowej NVMe nigdy nie dostarczały obiecanych IOPS. Przyczyna? Tradycyjny narzut stosu TCP/IP pochłaniał ponad 25% rdzeni procesora na ich węzłach obliczeniowych, a istniejące karty sieciowe brakowały sprzętowego odciążenia dla RDMA. Potrzebowali nie tylko większej przepustowości, aleużytecznej przepustowości z determinizmem na poziomie mikrosekund. Ich poszukiwania doprowadziły ich doNVIDIA Mellanox MCX4121A-ACAT – karty zaprojektowanej właśnie z myślą o tych nowoczesnych problemach centrów danych.
Rozwiązanie: Wdrożenie karty sieciowej MCX4121A-ACAT Ethernet
Zespół architektury CloudNova zastąpił swoje starsze karty sieciowe 10GbE kartami sieciowymikarta sieciowa MCX4121A-ACAT Ethernet na 120 węzłach obliczeniowych, z których każdy był wyposażony w podwójne porty SFP28. Wdrożenie wykorzystało natywne wsparcie karty dla RoCE v2, aby umożliwić bezstratny transport Ethernet, eliminując potrzebę oddzielnych sieci InfiniBand. Kluczowym elementem rozwiązania byłMCX4121A-ACAT ConnectX-4 Lx dwuportowy 25GbE SFP28 design, który pozwolił na aktywne-aktywne agregowanie połączeń dla łącznej przepustowości 50 Gb/s na serwer. Zespół skonfigurował PFC (Priority Flow Control) i ECN (Explicit Congestion Notification) na poziomie przełączników, zapewniając, że ruch RoCE pozostawał bezstratny nawet przy maksymalnym obciążeniu. W ciągu dwóch tygodni cała sieć pamięci masowej i obliczeniowa działała na RDMA – przejście to zostało usprawnione dzięki kompatybilności karty „od ręki” z istniejącym okablowaniem SFP28 i przełącznikami Mellanox Spectrum.
Z punktu widzenia operacyjnego, ekosystemkompatybilny z MCX4121A-ACAT okazał się nieoceniony. Karty bezproblemowo zintegrowały się z serwerami CloudNova opartymi na Ubuntu i klastrem Kubernetes, wymagając jedynie standardowej instalacji sterowników. Zespół odwołał się również dokarcie katalogowej MCX4121A-ACAT w celu dostrojenia alokacji buforów i ustawień agregacji przerwań, osiągając optymalną wydajność dla swojego środowiska mieszanych obciążeń – które obejmowało klastry MySQL, analizy Spark i zadania treningowe TensorFlow.
Mierzalne wyniki: Przepustowość, opóźnienia i efektywność CPU
Wzrost wydajności był natychmiastowy i mierzalny. Dzięki RDMA przez RoCE włączonemu za pośrednictwemNVIDIA Mellanox MCX4121A-ACAT, backend pamięci masowej odnotował spadek opóźnień odczytu NVMe-oF z 85 µs do zaledwie 12 µs – 7-krotna poprawa. Opóźnienie replikacji baz danych między węzłami głównym i zapasowym skróciło się z 320 ms do poniżej 2 ms, umożliwiając niemal synchroniczne przełączanie awaryjne. W przypadku obciążeń uczenia maszynowego, czas synchronizacji all-reduce dla treningu ResNet-50 zmniejszył się o 62%, skracając całkowity czas treningu epoki z 4,2 godziny do 1,6 godziny.
Poza opóźnieniami, wzrost przepustowości serwera był równie imponujący. Silnik sprzętowego odciążenia – który obejmuje odciążenie sumy kontrolnej, LSO/LRO i tagowanie VLAN – zmniejszył wykorzystanie procesora do przetwarzania sieci z 28% do poniżej 5% na wszystkich węzłach. Uwolniło to ponad 20 rdzeni procesora na serwer dla logiki aplikacji, bezpośrednio zwiększając gęstość kontenerów o 40%. Zgodnie zspecyfikacjami MCX4121A-ACAT, karta zapewnia przepustowość 25 Gb/s na port z opóźnieniami poniżej 1 µs, a wewnętrzne testy porównawcze CloudNova potwierdziły te liczby w produkcji.
| Metryka | Przed (starsza karta sieciowa) | Po (MCX4121A-ACAT) | Poprawa |
|---|---|---|---|
| Opóźnienie odczytu NVMe-oF | 85 µs | 12 µs | 7,1x szybciej |
| Opóźnienie replikacji DB | 320 ms | < 2 ms | 160x redukcja |
| Narzut sieciowy CPU | 28% | 4,8% | 83% niższy |
| Czas treningu ML (ResNet-50) | 4,2 godz. | 1,6 godz. | 62% szybciej |
Korzyści operacyjne: TCO i gotowość na przyszłość
Chociaż surowe liczby wydajności opowiadają fascynującą historię, korzyści operacyjne były równie znaczące. Rozwiązaniekarty sieciowej MCX4121A-ACAT Ethernet zmniejszyło całkowity koszt posiadania poprzez wyeliminowanie potrzeby oddzielnej sieci RDMA (oszczędzając ponad 180 tys. USD na infrastrukturze przełączników). Zużycie energii na serwer spadło o 8 W w porównaniu do poprzednich kart sieciowych, co przekłada się na roczne oszczędności na chłodzeniu w wysokości około 15%. Dodatkowo, dwuportowa konstrukcja karty zapewniła natywną redundancję – gdy jedno połączenie uległo niestabilności, ruch automatycznie przełączał się na port wtórny bez utraty pakietów, co zostało potwierdzone przez logi telemetryczne karty.
Dla menedżerów IT oceniającychcenę MCX4121A-ACAT w porównaniu do alternatywnych rozwiązań, dyrektor finansowy CloudNova zauważył, że okres zwrotu wyniósł poniżej 10 miesięcy, napędzany w dużej mierze przez zwiększone wykorzystanie serwerów i skrócony czas realizacji zadań. Zespół docenił również przyszłościową architekturę – ta samaMCX4121A-ACAT na sprzedaż dziś obsługuje 25GbE, ale może zostać przeprogramowana do środowisk 10GbE lub 40GbE z odpowiednimi optykami, zapewniając ochronę inwestycji na przyszłe modernizacje.
Podsumowanie i perspektywy: Plan dla centrów danych gotowych na RDMA
Podróż CloudNova zNVIDIA Mellanox MCX4121A-ACAT demonstruje jasny plan dla organizacji dążących do uwolnienia pełnego potencjału infrastruktury 25GbE. Łącząc dwuportową przepustowość 25GbE, sprzętowo przyspieszone RoCE i bezproblemową integrację z istniejącymi ekosystemami,karta sieciowa MCX4121A-ACAT Ethernet przekształca I/O sieciowe z wąskiego gardła w czynnik zwiększający wydajność. Wyniki – 7-krotnie niższe opóźnienia pamięci masowej, 83% redukcja narzutu CPU i 62% szybszy trening ML – świadczą o zdolności karty do dostarczania mierzalnych wyników biznesowych.
Patrząc w przyszłość, ponieważ obciążenia AI i analityka w czasie rzeczywistym nadal napędzają popyt na sieci deterministyczne,MCX4121A-ACAT ConnectX-4 Lx dwuportowy 25GbE SFP28 stanowi solidną podstawę do adopcji RDMA bez konieczności kosztownych modernizacji. Dla architektów i liderów IT planujących kolejną modernizację infrastruktury, ta karta stanowi nie tylko komponent, ale strategiczny zasób. Szczegółowe parametry dostrajania i najlepsze praktyki wdrażania są dostępne w oficjalnejkarcie katalogowej MCX4121A-ACAT – niezbędnym odniesieniu dla każdego poważnego wdrożenia.

