NVIDIA Mellanox MQM9790-NS2F Referencja techniczna: Optymalizacja połączeń między sieciami o niskim opóźnieniu dla klastrów RDMA/HPC/AI
August 24, 2026
NVIDIA Mellanox MQM9790-NS2F Dokumentacja Techniczna: Optymalizacja niskich opóźnień połączeń dla klastrów RDMA/HPC/AI
1. Tło projektu i analiza wymagań
Nowoczesne obciążenia związane z trenowaniem AI i symulacjami HPC charakteryzują się intensywnymi, wszechstronnymi wzorcami komunikacji, które stawiają ekstremalne wymagania przed leżącą u ich podstaw siecią szkieletową. W miarę skalowania klastrów GPU powyżej 1000 węzłów, tradycyjne podejście polegające na wykorzystaniu Ethernet z programowym sterowaniem przepływem okazuje się niewystarczające. Kluczowe wymagania wynikające z tych środowisk obejmują:
- Deterministyczne ultra-niskie opóźnienia: Opóźnienie port-do-port poniżej mikrosekundy w celu minimalizacji czasu ukończenia zadań MPI.
- Bezstratna sieć szkieletowa: Zero utraconych pakietów pod obciążeniem w celu zapobiegania TCP incast i załamaniu wydajności.
- Odciążenie obliczeń w sieci: Redukcja narzutu CPU hosta dla operacji zbiorczych (np. all-reduce, broadcast).
- Skalowalna topologia: Obsługa topologii fat-tree i dragonfly+ z pełną przepustowością bisekcyjną do tysięcy punktów końcowych.
Urządzenie NVIDIA Mellanox MQM9790-NS2F zostało zaprojektowane w celu spełnienia tych wymagań jako przełącznik InfiniBand 400Gb/s NDR z 64 portami OSFP, zapewniając gęstość i wydajność wymaganą dla wdrożeń klasy exascale.
2. Ogólny projekt architektury sieci
Proponowane rozwiązanie wykorzystuje dwupoziomową topologię leaf-spine, która zapewnia równowagę między skalowalnością, kontrolą nadsubskrypcji i prostotą okablowania. Na poziomie leaf, każdy stojak obliczeniowy mieści jedną lub dwie jednostki przełącznika InfiniBand MQM9790-NS2F, zapewniając 64 porty łączności 400Gb/s do serwerów GPU. Na poziomie spine, druga warstwa przełączników MQM9790-NS2F łączy wszystkie przełączniki leaf, tworząc nienblokującą sieć szkieletową.
Dla wdrożeń na dużą skalę przekraczających 2000 węzłów GPU, można zastosować trójpoziomową architekturę folded-Clos, w której MQM9790-NS2F 400Gb/s NDR 64-portowy OSFP służy zarówno jako leaf, jak i spine, aby utrzymać spójną wydajność na wszystkich poziomach. Taka konstrukcja zapewnia, że każdy serwer może komunikować się z każdym innym serwerem z prędkością liniową, z maksymalnie trzema skokami przez przełącznik.
Poniższa tabela podsumowuje typowe parametry skalowania dla dwupoziomowej sieci leaf-spine zbudowanej wokół MQM9790-NS2F:
| Komponent | Specyfikacja | Wartość |
|---|---|---|
| Przełączniki Leaf | MQM9790-NS2F na stojak | 1-2 jednostki |
| Przełączniki Spine | MQM9790-NS2F | N/2 (gdzie N = liczba przełączników Leaf) |
| Maks. punktów końcowych | Serwery GPU na sieć szkieletową | Do 4096 |
| Przepustowość bisekcyjna | Pełna nienblokująca | 51,2 Tb/s na poziom spine |
3. Rola i kluczowe cechy NVIDIA Mellanox MQM9790-NS2F
W ramach tej architektury NVIDIA Mellanox MQM9790-NS2F służy jako podstawowy element budulcowy, zapewniając kilka kluczowych możliwości:
- 400Gb/s NDR na port: Każdy z 64 portów OSFP obsługuje dwukierunkową prędkość 400Gb/s, z korekcją błędów do przodu (FEC) dla niezawodnej łączności dalekiego zasięgu.
- Zintegrowany SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol): Odciąża operacje komunikacji zbiorczej od CPU hosta, zmniejszając opóźnienia MPI all-reduce nawet o 40% w zadaniach na dużą skalę.
- Adaptacyjne routowanie i sterowanie przepływem: Dynamicznie przekierowuje ruch, aby unikać hotspotów, zapewniając przewidywalną wydajność nawet pod obciążeniem złośliwego ruchu.
- Zaawansowana telemetria: Liczniki per-flow i per-port, wraz z monitorowaniem zajętości bufora, zapewniają głęboki wgląd w stan sieci szkieletowej.
Według kartą katalogową MQM9790-NS2F, przełącznik zapewnia opóźnienie cut-through poniżej 100 ns i obsługuje łączną przepustowość przełączania do 51,2 Tb/s. Te specyfikacje czynią go idealnym wyborem zarówno dla nowych wdrożeń, jak i etapowych modernizacji infrastruktury HDR (200Gb/s).
4. Zalecenia dotyczące wdrożenia i skalowalności
Dla organizacji planujących wdrożenie Rozwiązanie przełącznika InfiniBand MQM9790-NS2F, zaleca się następujące wytyczne dotyczące wdrożenia:
- Strategia okablowania: Używaj kabli miedzianych typu direct-attach (DAC) OSFP-do-OSFP do połączeń wewnątrz stojaka (do 3 m) oraz aktywnych kabli optycznych (AOC) lub transceiverów optycznych do połączeń między stojakami i między przełącznikami spine-leaf (do 100 m).
- Redundancja: Wdróż podwójne zasilacze i moduły wentylatorów z możliwością wymiany podczas pracy. Podłącz każdy zasilacz do oddzielnych PDU w celu zapewnienia odporności na awarie.
- Spójność oprogramowania układowego: Upewnij się, że wszystkie przełączniki działają na tej samej wersji oprogramowania układowego NVIDIA, aby uniknąć niedopasowania funkcji. Użyj funkcji automatycznej aktualizacji oprogramowania układowego UFM do aktualizacji wdrożeniowych.
- Skalowalność: Dla klastrów powyżej 4000 węzłów, rozważ trójpoziomową topologię folded-Clos lub dragonfly+ z włączonym adaptacyjnym routowaniem. Ekosystem kompatybilny z MQM9790-NS2F obejmuje szeroką gamę optyki i kabli do obsługi tych topologii.
Przy obliczaniu całkowitego kosztu posiadania, uwzględnij zmniejszoną liczbę poziomów przełączników i uproszczone okablowanie w porównaniu do alternatyw o niższej liczbie portów. Chociaż cena MQM9790-NS2F za jednostkę jest wyższa niż w przypadku przełączników poprzedniej generacji, koszt za port i koszt sieci na GPU są znacznie niższe we wdrożeniach na dużą skalę, co czyni go opłacalnym wyborem dla projektów Exascale.
5. Operacje, monitorowanie i rozwiązywanie problemów
Efektywne zarządzanie siecią NDR wymaga kompleksowego systemu monitorowania i rozwiązywania problemów. NVIDIA Unified Fabric Manager (UFM) zapewnia pojedynczy punkt zarządzania dla całej sieci opartej na NVIDIA Mellanox MQM9790-NS2F, oferując:
- Wizualizacja topologii: Automatyczne wykrywanie i graficzna reprezentacja wszystkich przełączników, połączeń i punktów końcowych.
- Pulpity nawigacyjne wydajności: Widoki w czasie rzeczywistym wykorzystania portów, wskaźników błędów i wskaźników obciążenia.
- Proaktywne alerty: Alarmy oparte na progach dla degradacji połączeń, anomalii temperatury i awarii zasilania.
- Izolacja błędów: Przewodniki rozwiązywania problemów, które identyfikują wadliwe kable, transceiverów lub porty przełączników.
W celu zaawansowanego rozwiązywania problemów, specyfikacje MQM9790-NS2F obejmują szczegółowe monitorowanie bufora i statystyki na poziomie przepływu, które można eksportować za pośrednictwem interfejsu REST API w celu integracji z niestandardowymi stosami monitorowania. Inżynierowie sieciowi powinni również korzystać z wbudowanych narzędzi diagnostycznych przełącznika, takich jak testy pętli zwrotnej i analiza BER (bit error rate), aby zweryfikować integralność połączenia przed wdrożeniem obciążeń produkcyjnych.
Częste problemy napotykane podczas wczesnych wdrożeń obejmują suboptymalne routowanie spowodowane nierównymi prędkościami połączeń lub niedopasowanymi typami kabli. Włączenie adaptacyjnego routowania i weryfikacja, że wszystkie połączenia działają z prędkością 400 Gb/s (z włączonym FEC), rozwiązuje większość anomalii wydajności. Rozwiązanie przełącznika InfiniBand MQM9790-NS2F obejmuje również obsługę redundancji menedżera podsieci, zapewniając, że rekonfiguracja sieci może odbyć się bez ręcznej interwencji w przypadku awarii węzła zarządzającego.
6. Podsumowanie i ocena wartości
Urządzenie MQM9790-NS2F stanowi znaczący postęp w dziedzinie sieci o wysokiej wydajności, oferując przepustowość 400Gb/s NDR, gęstość 64 portów i akcelerację obliczeń w sieci na jednej, łatwej w zarządzaniu platformie 1U. Dla architektów i inżynierów projektujących klastry AI i HPC, ten przełącznik zapewnia sprawdzoną ścieżkę do wydajności exascale, umożliwiając:
- Zmniejszenie o nawet 30% czasu ukończenia zadań dla dużych obciążeń treningowych dzięki odciążeniu SHARPv3.
- Niższy TCO w porównaniu do alternatywnych rozwiązań, dzięki wyższej liczbie portów i zmniejszonej liczbie poziomów przełączników.
- Uproszczone operacje dzięki integracji z UFM i kompleksowej telemetrii dla proaktywnego zarządzania awariami.
- Skalowalność przyszłościowa do obsługi interkonektów GPU i akceleratorów nowej generacji.
Dla organizacji oceniających MQM9790-NS2F do sprzedaży za pośrednictwem sieci partnerskiej NVIDIA, zalecamy zapoznanie się ze szczegółową kartą katalogową MQM9790-NS2F i współpracę z certyfikowanym architektem rozwiązań w celu dostosowania wdrożenia do konkretnych wymagań dotyczących obciążenia i skali. Urządzenie NVIDIA Mellanox MQM9790-NS2F jest gotowe do pełnienia roli szkieletu połączeń o wysokiej wydajności przez następną dekadę odkryć naukowych i innowacji w dziedzinie AI.

