NVIDIA Mellanox MCX631432AN-ADAB w akcji: RDMA/RoCE Transport niskiego opóźnienia i optymalizacja przepustowości serwera

July 28, 2026

najnowsze wiadomości o firmie NVIDIA Mellanox MCX631432AN-ADAB w akcji: RDMA/RoCE Transport niskiego opóźnienia i optymalizacja przepustowości serwera

NVIDIA Mellanox MCX631432AN-ADAB w akcji: RDMA/RoCE Transport niskiego opóźnienia i optymalizacja przepustowości serwera

Temat i wyzwania: wąski gardło sieci w klastrze szkoleń w zakresie sztucznej inteligencji

Wiodąca firma fintech niedawno wdrożyła 64-węzłowy klaster AI oparty na GPU zaprojektowany do szkolenia w zakresie strategii handlowych o wysokiej częstotliwości, przy czym każdy serwer jest wyposażony w wysokiej wydajności pamięć NVMe.,Po uruchomieniu, rzeczywisty przepływ szkoleń spadł znacznie poniżej oczekiwań.Analiza po wdrożeniu wykazała, że komunikacja między węzłami oparta na 10GbE TCP/IP stała się głównym wąskim gardłemOperacje komunikacji zbiorowej All-Reduce wykazywały opóźnienie nawet 4 ̊5 milisekund,podczas gdy koszty procesora dla przetwarzania protokołów sieciowych przekroczyły 40% Zespół pilnie potrzebował rozwiązania sieciowego, które mogłoby zarówno znacząco zmniejszyć opóźnienie komunikacji, jak i odzyskać pojemność obliczeniową procesora.

Rozwiązanie i wdrożenie: Budowanie sieci bez strat RoCE z MCX631432AN-ADAB

Po kompleksowej ocenie technicznej zespół wybrałNVIDIA Mellanox MCX631432AN-ADABKażdy serwer był wyposażony wMCX631432AN-ADAB ConnectX-6 Lx podwójny port 25GbE SFP28Adapter, z obydwoma portami SFP28 podłączonymi do redundantnych przełączników NVIDIA Spectrum-3, aby ustanowić bardzo dostępną architekturę.

Wdrożenie zostało przeprowadzone w trzech różnych fazach:

  • Faza 1 Pilot (8 węzłów):Zespół zainstalowałKarta adaptera Ethernet MCX631432AN-ADABna podzbiorze serwerów GPU, konfigurując RoCEv2 z priorytetową kontrolą przepływu (PFC) i wyraźnym powiadamianiem o zatłoczeniu (ECN) w celu utworzenia bezstratnej tkanki Ethernet.NCCL (NVIDIA Collective Communications Library) został ponownie skompilowany z wsparciem RDMA.
  • Faza 2 Tuning & Validation:Wykorzystując dane telemetryczne szczegółowe wArkusz danych MCX631432AN-ADAB, zespół dopasował parametry DCB i progi buforu, aby wyeliminować burze przerwy PFC przy zachowaniu niemal zerowej straty pakietów.Specyfikacje MCX631432AN-ADABoptymalizacji moderacji przerwy i głębokości kolejki dla określonego profilu obciążenia pracą.
  • Faza 3 Po pomyślnej walidacji pozostałe węzły zostały przeniesione na nowy adapter.Kompatybilny z MCX631432AN-ADABsterowniki w pełni zintegrowane z istniejącym środowiskiem opartym na Ubuntu i stosem Mellanox OFED.

Zespół zauważył, żeRozwiązanie karty adaptera Ethernet MCX631432AN-ADABZapewnił prostą ścieżkę migracji, ponieważ adaptery były w pełni kompatybilne z istniejącą infrastrukturą kabli i przełączników SFP28, eliminując potrzebę kosztownych dodatkowych modernizacji.

Wyniki i korzyści: mierzalna transformacja opóźnienia i przepustowości

Wzrost wyników osiągnięty dziękiNVIDIA Mellanox MCX631432AN-ADABNastępująca tabela podsumowuje kluczowe wskaźniki przed i po modernizacji:

Metryczny Wstępna aktualizacja (10GbE TCP/IP) Po uaktualnieniu (MCX631432AN-ADAB z RoCE) Poprawa
Wskaźnik opóźnienia całkowitego zmniejszenia (średnia) 40,7 ms 0.32 ms 14.7x zmniejszenie
Wykorzystanie procesora sieciowego (na węzeł) 42% 9% 33 pp zwolnione
Wykorzystanie GPU (faza ładowania danych) 61% 89% +28%
Wydajność szkolenia klastra 10,8x wartość wyjściowa 4.3x wartość wyjściowa 2.4x wzrost

Oprócz tych ilościowych zysków, zespół zaobserwował poprawę operacyjną, która bezpośrednio wpłynęła na produktywność deweloperów.Model szkolenia, który wcześniej wymagał 36 godzin, zakończony w zaledwie 15 godzinOprogramowanie NVMe-oF, oparte na sprzęcie, zmniejszyło również opóźnienie dostępu do pamięci masowej o 35%, co jeszcze bardziej przyspieszyło operacje punktów kontrolnych o dużym zużyciu danych.Dla organizacji oceniających scenariusze biznesowe,Cena MCX631432AN-ADABZespół zauważył również, że zwiększenie przepustowości przez 2,4 razy i możliwość odroczenia dodatkowych przejęć serwerów GPU.MCX631432AN-ADAB na sprzedażZestawy z przełącznikami NVIDIA Spectrum oferowały najbardziej opłacalną drogę do przyszłej skalowania.

Podsumowanie i perspektywy: podstawa przyszłych innowacji w zakresie obciążenia pracą

Wdrożenie tej produkcji dowodzi, żeNVIDIA Mellanox MCX631432AN-ADABjest czymś znacznie więcej niż rutynowym odświeżeniem sieci, to element transformacyjnej infrastruktury, który wykorzystuje cały potencjał nowoczesnych procesorów komputerowych przyspieszanych przez GPU.Połączenie łącznej przepustowości 50 Gb/s, opóźnienie komunikacji zbiorowej poniżej 0,4 ms, i dramatyczne możliwości obciążenia procesora, pozycjonują ten adapter jako idealny wybór dla organizacji działających w rozproszonej AI, HPC,i obciążenia analityczne w czasie rzeczywistym.

W przyszłości zespół fintech bada integrację z NVIDIA DOCA w celu dalszego przyspieszenia programowalności ścieżek danych i wdrożenia zero-touch provisioning dla przyszłych ekspansji klastrów.Oceniają również możliwości telemetryczne adaptera, szczegółowo opisane wArkusz danych MCX631432AN-ADAB stworzenie przewidywalnych modeli zarządzania zatłoczeniami.Rozwiązanie karty adaptera Ethernet MCX631432AN-ADABnadal udowadnia swoją wartość, firma planuje standaryzację na tej platformie dla wszystkich przyszłych inwestycji infrastrukturalnych,przekonany, że zapewnia solidne i skalowalne podstawy dla następnej generacji aplikacji finansowych opartych na sztucznej inteligencji.