NVIDIA Mellanox MCX631432AN-ADAB w akcji: RDMA/RoCE Transport niskiego opóźnienia i optymalizacja przepustowości serwera
July 28, 2026
NVIDIA Mellanox MCX631432AN-ADAB w akcji: RDMA/RoCE Transport niskiego opóźnienia i optymalizacja przepustowości serwera
Temat i wyzwania: wąski gardło sieci w klastrze szkoleń w zakresie sztucznej inteligencji
Wiodąca firma fintech niedawno wdrożyła 64-węzłowy klaster AI oparty na GPU zaprojektowany do szkolenia w zakresie strategii handlowych o wysokiej częstotliwości, przy czym każdy serwer jest wyposażony w wysokiej wydajności pamięć NVMe.,Po uruchomieniu, rzeczywisty przepływ szkoleń spadł znacznie poniżej oczekiwań.Analiza po wdrożeniu wykazała, że komunikacja między węzłami oparta na 10GbE TCP/IP stała się głównym wąskim gardłemOperacje komunikacji zbiorowej All-Reduce wykazywały opóźnienie nawet 4 ̊5 milisekund,podczas gdy koszty procesora dla przetwarzania protokołów sieciowych przekroczyły 40% Zespół pilnie potrzebował rozwiązania sieciowego, które mogłoby zarówno znacząco zmniejszyć opóźnienie komunikacji, jak i odzyskać pojemność obliczeniową procesora.
Rozwiązanie i wdrożenie: Budowanie sieci bez strat RoCE z MCX631432AN-ADAB
Po kompleksowej ocenie technicznej zespół wybrałNVIDIA Mellanox MCX631432AN-ADABKażdy serwer był wyposażony wMCX631432AN-ADAB ConnectX-6 Lx podwójny port 25GbE SFP28Adapter, z obydwoma portami SFP28 podłączonymi do redundantnych przełączników NVIDIA Spectrum-3, aby ustanowić bardzo dostępną architekturę.
Wdrożenie zostało przeprowadzone w trzech różnych fazach:
- Faza 1 Pilot (8 węzłów):Zespół zainstalowałKarta adaptera Ethernet MCX631432AN-ADABna podzbiorze serwerów GPU, konfigurując RoCEv2 z priorytetową kontrolą przepływu (PFC) i wyraźnym powiadamianiem o zatłoczeniu (ECN) w celu utworzenia bezstratnej tkanki Ethernet.NCCL (NVIDIA Collective Communications Library) został ponownie skompilowany z wsparciem RDMA.
- Faza 2 Tuning & Validation:Wykorzystując dane telemetryczne szczegółowe wArkusz danych MCX631432AN-ADAB, zespół dopasował parametry DCB i progi buforu, aby wyeliminować burze przerwy PFC przy zachowaniu niemal zerowej straty pakietów.Specyfikacje MCX631432AN-ADABoptymalizacji moderacji przerwy i głębokości kolejki dla określonego profilu obciążenia pracą.
- Faza 3 Po pomyślnej walidacji pozostałe węzły zostały przeniesione na nowy adapter.Kompatybilny z MCX631432AN-ADABsterowniki w pełni zintegrowane z istniejącym środowiskiem opartym na Ubuntu i stosem Mellanox OFED.
Zespół zauważył, żeRozwiązanie karty adaptera Ethernet MCX631432AN-ADABZapewnił prostą ścieżkę migracji, ponieważ adaptery były w pełni kompatybilne z istniejącą infrastrukturą kabli i przełączników SFP28, eliminując potrzebę kosztownych dodatkowych modernizacji.
Wyniki i korzyści: mierzalna transformacja opóźnienia i przepustowości
Wzrost wyników osiągnięty dziękiNVIDIA Mellanox MCX631432AN-ADABNastępująca tabela podsumowuje kluczowe wskaźniki przed i po modernizacji:
| Metryczny | Wstępna aktualizacja (10GbE TCP/IP) | Po uaktualnieniu (MCX631432AN-ADAB z RoCE) | Poprawa |
|---|---|---|---|
| Wskaźnik opóźnienia całkowitego zmniejszenia (średnia) | 40,7 ms | 0.32 ms | 14.7x zmniejszenie |
| Wykorzystanie procesora sieciowego (na węzeł) | 42% | 9% | 33 pp zwolnione |
| Wykorzystanie GPU (faza ładowania danych) | 61% | 89% | +28% |
| Wydajność szkolenia klastra | 10,8x wartość wyjściowa | 4.3x wartość wyjściowa | 2.4x wzrost |
Oprócz tych ilościowych zysków, zespół zaobserwował poprawę operacyjną, która bezpośrednio wpłynęła na produktywność deweloperów.Model szkolenia, który wcześniej wymagał 36 godzin, zakończony w zaledwie 15 godzinOprogramowanie NVMe-oF, oparte na sprzęcie, zmniejszyło również opóźnienie dostępu do pamięci masowej o 35%, co jeszcze bardziej przyspieszyło operacje punktów kontrolnych o dużym zużyciu danych.Dla organizacji oceniających scenariusze biznesowe,Cena MCX631432AN-ADABZespół zauważył również, że zwiększenie przepustowości przez 2,4 razy i możliwość odroczenia dodatkowych przejęć serwerów GPU.MCX631432AN-ADAB na sprzedażZestawy z przełącznikami NVIDIA Spectrum oferowały najbardziej opłacalną drogę do przyszłej skalowania.
Podsumowanie i perspektywy: podstawa przyszłych innowacji w zakresie obciążenia pracą
Wdrożenie tej produkcji dowodzi, żeNVIDIA Mellanox MCX631432AN-ADABjest czymś znacznie więcej niż rutynowym odświeżeniem sieci, to element transformacyjnej infrastruktury, który wykorzystuje cały potencjał nowoczesnych procesorów komputerowych przyspieszanych przez GPU.Połączenie łącznej przepustowości 50 Gb/s, opóźnienie komunikacji zbiorowej poniżej 0,4 ms, i dramatyczne możliwości obciążenia procesora, pozycjonują ten adapter jako idealny wybór dla organizacji działających w rozproszonej AI, HPC,i obciążenia analityczne w czasie rzeczywistym.
W przyszłości zespół fintech bada integrację z NVIDIA DOCA w celu dalszego przyspieszenia programowalności ścieżek danych i wdrożenia zero-touch provisioning dla przyszłych ekspansji klastrów.Oceniają również możliwości telemetryczne adaptera, szczegółowo opisane wArkusz danych MCX631432AN-ADAB stworzenie przewidywalnych modeli zarządzania zatłoczeniami.Rozwiązanie karty adaptera Ethernet MCX631432AN-ADABnadal udowadnia swoją wartość, firma planuje standaryzację na tej platformie dla wszystkich przyszłych inwestycji infrastrukturalnych,przekonany, że zapewnia solidne i skalowalne podstawy dla następnej generacji aplikacji finansowych opartych na sztucznej inteligencji.

