Przełącznik Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand w akcji – optymalizacja połączeń międzysieciowych o niskim opóźnieniu dla RDMA/HPC

July 13, 2026

najnowsze wiadomości o firmie Przełącznik Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand w akcji – optymalizacja połączeń międzysieciowych o niskim opóźnieniu dla RDMA/HPC

Przełącznik Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand w akcji – optymalizacja połączeń wzajemnych o niskim opóźnieniu dla klastrów RDMA/HPC/AI

W miarę jak klastry szkoleniowe AI powiększają się od tysięcy do dziesiątek tysięcy procesorów graficznych, opóźnienia sieci i kontrola przeciążenia stają się decydującymi czynnikami efektywnego wykorzystania mocy obliczeniowych. Wiodąca światowa organizacja badawcza zajmująca się sztuczną inteligencją wdrożyła niedawno platformęMellanox (NVIDIA Mellanox) MQM9790-NS2Fw celu wsparcia swojego obiektu superkomputerowego nowej generacji, obsługującego wielkoskalowe modele językowe, symulacje dynamiki molekularnej i rozproszone głębokie uczenie się. W tym artykule omówiono wdrożenie w świecie rzeczywistym i szczegółowo opisano, w jaki sposób przełącznik InfiniBand przekształca transport RDMA, komunikację HPC i równoległe struktury szkoleniowe AI.

Tło i wyzwania: od kompromisu w sieci Ethernet do konieczności bezstratnych połączeń wzajemnych

Organizacja początkowo korzystała z sieci Ethernet 100GbE z technologią RoCEv2. Jednak w miarę jak ich węzły graficzne rozrosły się do ponad 1200 serwerów (każdy z 8 procesorami graficznymi NVIDIA H100), napotkali utrzymujące się zakleszczenia PFC, złożone strojenie ECN i sporadyczne spadki pakietów, które powodowały przestoje w treningu. Problemy te wydłużyły średni czas realizacji zadań o ponad 35% i pochłonęły znaczny wysiłek inżynierów przy rozwiązywaniu problemów z siecią. Istniejąca infrastruktura nie była już w stanie zapewnić deterministycznego opóźnienia na poziomie mikrosekund i przepustowości wolnej od zatorów, wymaganych w przypadku masowych operacji typu „wszystko do wszystkich” i „wszystko do wszystkich”.

Rozwiązanie i wdrożenie: ThePrzełącznik InfiniBand MQM9790-NS2Fjako szkielet tkaniny

Po ocenie wielu alternatyw zespół wybrałNVIDIA Mellanox MQM9790-NS2Fjako główny element nowej dwupoziomowej architektury z grzbietem liścia. Każdy stojak na liście jest wyposażony w dwaMQM9790-NS2F 64-portowy OSFP 400 Gb/s NDRprzełączniki, zapewniające 64 porty OSFP na jednostkę i całkowitą zdolność przełączania 25,6 Tb/s. Szybkość NDR na poziomie 400 Gb/s na port w połączeniu z przełączaniem przekrojowym i routingiem adaptacyjnym umożliwia osiągnięcie opóźnień między portami na poziomie poniżej 600 ns – co jest krytycznym wymogiem w przypadku obciążeń intensywnie korzystających z procesora graficznego. We wdrożeniu wykorzystanoRozwiązanie przełącznika InfiniBand MQM9790-NS2Fzintegrowany z oprogramowaniem sprzętowym NVIDIA Quantum-2, zapewniający płynnośćKompatybilny z MQM9790-NS2Fwspółpraca z istniejącymi adapterami ConnectX‑7 i modułami DPU BlueField‑3.

Kluczowe opcje wdrożenia obejmowały:

  • Topologia:Nieblokujące się drzewo tłuszczu z 64-portowymi transceiverami optycznymi OSFP do 400G, zapewniające przepustowość z pełną dwusekcją dla wszystkich węzłów GPU.
  • Kierownictwo:NVIDIA UFM (Unified Fabric Manager) do telemetrii w czasie rzeczywistym, wykrywania zatorów i proaktywnego przekierowywania ścieżek.
  • Zbiorowy rozładunek:SHARPv3 umożliwia przyspieszenie operacji all-reduce, odciążając komunikację z procesorów hosta.

Aby zapewnić płynne przejście, zespół skonsultował się zArkusz danych MQM9790-NS2FISpecyfikacje MQM9790-NS2Fw celu sprawdzenia wymagań dotyczących zasilania i okablowania. Obudowa 1U i nadmiarowe zasilacze idealnie pasują do istniejącej gęstości stelaża, a porty OSFP obsługują zarówno kable DAC, jak i moduły optyczne, oferując elastyczność w przypadku przyszłej rozbudowy.

Zmierzone wyniki i korzyści — wymierne zyski w zakresie wydajności i efektywności

Po pełnym wdrożeniu i optymalizacji organizacja udokumentowała znaczące ulepszenia w wielu wymiarach:

Metryczny Przed (RoCEv2) Po (MQM9790-NS2F)
Średnie opóźnienie w trybie All-Reduce (1 GB) ~18 μs < 8 µs
Opóźnienie ogona (99,9% czasu) > 150 µs < 15 µs
Efektywne wykorzystanie procesora graficznego ~72% ~91%
Czas ukończenia zadania (średnio) Linia bazowa -28% (1,4× szybciej)

Oprócz surowych liczb zespół odnotował niemal zerowe zakłócenia spowodowane przeciążeniami, co znacznie uprościło działanie sieci. Wbudowana telemetria i adaptacyjne routingNVIDIA Mellanox MQM9790-NS2Fumożliwiło automatyczne równoważenie obciążenia na wszystkich 64 portach OSFP, eliminując ręczne podkręcanie ECN. Co więcej,Przełącznik InfiniBand MQM9790-NS2Fzapewnił deterministyczną wydajność nawet przy wykorzystaniu łącza na poziomie 95% – co było osiągnięciem niemożliwym przy poprzedniej konfiguracji Ethernet.

Organizacja zauważyła także, żeCena MQM9790-NS2Famortyzowany w ciągu 5-letniego cyklu życia, został skompensowany zmniejszonym zużyciem energii na port (≈1,5 W na port 400G) i niższymi kosztami okablowania ze względu na większą gęstość portów. Potwierdzili to, ponieważ ogólna dostępność jest już dojrzałaDo sprzedania MQM9790-NS2Fautoryzowanymi kanałami, co ułatwiło udzielanie zamówień, orazArkusz danych MQM9790-NS2Fdostarczył wszystkie niezbędne szczegóły dotyczące instalacji i zgodności.

Podsumowanie i prognozy — plan infrastruktury sztucznej inteligencji nowej generacji

Przyjęcie wwMellanox (NVIDIA Mellanox) MQM9790-NS2Fw tym wielkoskalowym klastrze HPC/AI pokazuje, że specjalnie zaprojektowana sieć InfiniBand nie jest już luksusem, ale koniecznością dla organizacji przesuwających granice sztucznej inteligencji i obliczeń naukowych. Zapewniając stałe opóźnienia poniżej mikrosekundy, bezstratny transport RDMA i przyspieszenie obliczeń w sieci,MQM9790-NS2F 64-portowy OSFP 400 Gb/s NDRPrzełącznik umożliwia centrom danych osiągnięcie niemal liniowej skalowalności do dziesiątek tysięcy procesorów graficznych.

Patrząc w przyszłość, zespół planuje rozszerzyć tkaninę o dodatkowePrzełącznik InfiniBand MQM9790-NS2Fjednostki do obsługi nadchodzących zadań klasy eksaskalowej, w tym modelowania klimatu i genomiki. TheKompatybilny z MQM9790-NS2Fekosystem z przyszłymi generacjami NVIDIA zapewnia ochronę inwestycji. Dla architektów i menedżerów IT oceniających podobne aktualizacje ten rzeczywisty przypadek potwierdza, żeRozwiązanie przełącznika InfiniBand MQM9790-NS2Foferuje sprawdzoną, opłacalną ścieżkę do wysokowydajnej sieci klastrów o niskim opóźnieniu, co stanowi kluczowy czynnik umożliwiający następną dekadę innowacji w zakresie sztucznej inteligencji.