Mellanox (NVIDIA Mellanox) MQM9790-NS2F Przełącznik InfiniBand Rozwiązanie techniczne

July 13, 2026

Mellanox (NVIDIA Mellanox) MQM9790-NS2F Przełącznik InfiniBand Rozwiązanie techniczne

Mellanox (NVIDIA Mellanox) MQM9790-NS2F Rozwiązanie techniczne przełącznika InfiniBand — optymalizacja połączeń wzajemnych o niskim opóźnieniu dla klastrów RDMA/HPC/AI

W tym dokumencie technicznym przedstawiono kompleksową architekturę rozwiązań skupioną naMellanox (NVIDIA Mellanox) MQM9790-NS2FPrzełącznik InfiniBand. Dokument, skierowany do architektów sieci, inżynierów ds. przedsprzedaży i kierowników operacyjnych, szczegółowo opisuje, w jaki sposóbMQM9790-NS2Fzapewnia deterministyczne, bardzo niskie opóźnienia, bezstratną technologię RDMA i skalowalną przepustowość dla infrastruktur HPC i sztucznej inteligencji nowej generacji. Omawiamy zasady projektowania, topologie wdrażania, najlepsze praktyki operacyjne i weryfikację wydajności.

1. Analiza tła projektu i wymagań

Współczesne obciążenia związane ze szkoleniami w zakresie sztucznej inteligencji i symulacjami naukowymi wymagają sieci szkieletowych, które są w stanie obsłużyć masowe wzorce komunikacji typu „wszystko ograniczaj”, „wszystko zbieraj” i „punkt-punkt” z wahaniami poniżej mikrosekundy. Tradycyjne rozwiązania oparte na sieci Ethernet, nawet z RoCEv2, wprowadzają złożoność w zarządzaniu przeciążeniami, dostrajaniu PFC i kontroli opóźnień, co często prowadzi do nieefektywnego wykorzystania procesora graficznego i nieprzewidywalnych czasów realizacji zadań.

Kluczowe wymagania zidentyfikowane w typowych projektach HPC/AI obejmują:

  • Opóźnienie od końca do końca < 1 μs (przełącznik między portami) przy pełnym obciążeniu
  • Bezstratna sieć bez strat pakietów z powodu zatorów
  • Skalowalność od 64 do ponad 2000 węzłów GPU bez zmian architektonicznych
  • Uproszczone operacje dzięki bogatej telemetrii i automatycznemu usuwaniu usterek

TheNVIDIA Mellanox MQM9790-NS2Fbezpośrednio odpowiada na te wymagania, integrując technologię NDR 400 Gb/s, routing adaptacyjny i przetwarzanie w sieci w 64-portowej platformie OSFP o rozmiarze 1U.

2. Ogólny projekt architektury sieci/systemu

W zalecanej architekturze zastosowano dwuwarstwową topologię liścia (lub grubego drzewa), aby zapewnić pełną przepustowość w trybie dwudzielnym i wysoką odporność. Każdy blok skrzydeł składa się z wielu stojaków, przy czym każdy regał mieści dwaPrzełączniki InfiniBand MQM9790-NS2Fza redundancję. Warstwa kręgosłupa agreguje ruch ze wszystkich przełączników liściowych, zapewniając nieblokującą komunikację pomiędzy dowolnymi dwoma punktami końcowymi.

TheMQM9790-NS2F 64-portowy OSFP 400 Gb/s NDRprzełącznik służy zarówno jako liść, jak i kręgosłup, oferując jednolity osprzęt w całej tkaninie – upraszczając oszczędzanie i konserwację. W przypadku klastra z 1024 procesorami graficznymi typowa konstrukcja wykorzystuje 16 przełączników liściowych (każdy łączy 64 procesory graficzne) i 8 przełączników kręgosłupa, wszystkie połączone kablami optycznymi 400 G lub DAC. Struktura obsługuje topologie Fat Tree i Dragonfly+, a routing adaptacyjny dynamicznie równoważy ruch na wielu ścieżkach.

3. Rola i kluczowe cechyMellanox (NVIDIA Mellanox) MQM9790-NS2Fw rozwiązaniu

TheNVIDIA Mellanox MQM9790-NS2Fjest podstawą tego rozwiązania, zapewniając:

  • 64 porty OSFPkażdy pracujący z szybkością 400 Gb/s (NDR) – łączna wydajność przełączania 25,6 Tb/s, z opóźnieniem przejścia poniżej 600 ns.
  • Trasowanie adaptacyjne– dynamicznie wybiera najmniej przeciążoną ścieżkę na pakiet, unikając łączy typu hotspot i utrzymując stałe opóźnienia nawet w przypadku asymetrycznych wzorców ruchu.
  • SHARPv3 (skalowalny protokół hierarchicznej agregacji i redukcji)– odciąża komunikację zbiorową (all-reduce, rozgłaszanie) od procesorów hosta, redukując zakłócenia sieciowe i przyspieszając szkolenie sztucznej inteligencji nawet o 20–30%.
  • Przetwarzanie w sieci– obsługuje redukcję danych, segmentację, a nawet operacje MPI na małą skalę bezpośrednio na przełączniku, uwalniając cenne zasoby GPU do obliczeń.
  • Telemetria i zarządzanie przeciążeniami– wbudowane zaawansowane monitorowanie, w tym liczniki przepływu, histogramy zajętości bufora i metryki opóźnień na poziomie ścieżki, wszystkie z możliwością eksportu za pośrednictwem interfejsów API UFM lub REST.

Możliwości te umożliwiająRozwiązanie przełącznika InfiniBand MQM9790-NS2Faby zapewnić deterministyczną wydajność na dużą skalę, potwierdzoną wewnętrznymi testami porównawczymi i wdrożeniami klientów. TheSpecyfikacje MQM9790-NS2Fobejmują także obsługę zarówno pasywnych miedzianych przetworników DAC, jak i aktywnych modułów optycznych, zapewniając elastyczność na odległościach do 100 m (z optyką 400G SR4) i większych.

4. Zalecenia dotyczące wdrożenia i skalowania (typowa topologia)

W przypadku wdrożenia od podstaw zalecamy następujące podejście etapowe:

  • Faza 1 – Pilotaż:Rozmieść 2 przełączniki liściowe (każdyMQM9790-NS2F) i 2 przełączniki kręgosłupa, łączące 128 procesorów graficznych. Sprawdź wydajność względemArkusz danych MQM9790-NS2Fparametry.
  • Faza 2 – Skalowanie w poziomie:Dodawaj przełączniki liściowe w odstępach co 2 na szafę i przełączniki kręgosłupa w razie potrzeby, aby utrzymać nadsubskrypcję ≤ 1:1. Gęstość 64 portów pozwala na obsługę jednego przełącznika w pełnej szafie składającej się z 64 węzłów GPU (jeśli każdy węzeł ma pojedyncze łącze wysyłające 400 Gb).
  • Faza 3 – Wielopłaszczyznowość:W przypadku klastrów przekraczających 2000 węzłów należy wdrożyć wiele niezależnych sieci szkieletowych (np. płaszczyzny 2× lub 4×) z równoważeniem obciążenia w oparciu o trasy, wykorzystując obsługę wirtualnych pasów i kluczy partycji przez przełącznik.

Typowe okablowanie wykorzystuje przetworniki cyfrowo-analogowe OSFP-do-OSFP do połączeń wewnątrz szafy (≤3 m) i moduły optyczne OSFP-do-400G SR4 dla odległości grzbietu do 100 m. TheKompatybilny z MQM9790-NS2FTransceivery są sprawdzane w ekosystemie dostawców rozwiązań optycznych NVIDIA, zapewniając bezproblemową interoperacyjność.

5. Operacje, monitorowanie, diagnostyka usterek i optymalizacja

Efektywne operacje mają kluczowe znaczenie dla utrzymania niskich opóźnień w produkcji. Rozwiązanie integruje się zNVIDIA UFM (ujednolicony menedżer sieci szkieletowej), który zapewnia:

  • Pulpit nawigacyjny w czasie rzeczywistym– przepustowość na port, liczniki błędów i mapy cieplne przeciążenia.
  • Automatyczna ponowna optymalizacja ścieżki– gdy łącze ulegnie degradacji lub ulegnie awarii, UFM ponownie oblicza trasy i ponownie konfiguruje adaptacyjne tablice routingu bez interwencji operatora.
  • Telemetria historyczna– przechowuje dane dotyczące opóźnień i przepływu do celów analizy pośmiertnej i planowania wydajności.

Zalecany proces rozwiązywania problemów:

  1. Monitoruj ramki pauzy i odrzuty na port – oczekuje się zerowego odrzutu; wszelkie odrzuty wskazują na błędną konfigurację lub wadliwą optykę.
  2. Zweryfikuj działanie SHARPv3 za pomocą zbiorczych statystyk UFM – upewnij się, że operacje redukcji zostały odciążone.
  3. Użyj wbudowanych narzędzi diagnostycznych (np.ibdiagnot,stan), aby sprawdzić integralność łącza i integralność sygnału.

W celu optymalizacji dostosuj próg adaptacyjnego algorytmu routingu (np. interwał wykrywania obciążenia) w oparciu o wzorce obciążenia – thePrzełącznik InfiniBand MQM9790-NS2Fumożliwia dostrajanie poprzez interfejsy zarządzania. Regularne aktualizacje oprogramowania sprzętowego (dostępne za pośrednictwem portalu pomocy technicznej NVIDIA) obejmują ulepszenia wydajności i poprawki zabezpieczeń.

6. Podsumowanie i ocena wartości

TheMellanox (NVIDIA Mellanox) MQM9790-NS2Foferuje przyszłościową, wysokowydajną podstawę dla klastrów RDMA/HPC/AI. Łącząc prędkość NDR 400 Gb/s, gęstość 64 portów i inteligentne przetwarzanie w sieci, eliminuje tradycyjne wąskie gardła i zapewnia skalowalność liniową do klasy eksaskalowej. Rozwiązanie zmniejsza całkowity koszt posiadania dzięki niższemu poborowi mocy na port (≈1,5 W), uproszczonemu okablowaniu i zmniejszonemu obciążeniu procesora wynikającemu z odciążania SHARP.

Dla organizacji oceniającychCena MQM9790-NS2Finwestycję uzasadniają wymierne zyski w wykorzystaniu procesora graficznego (często przekraczające 90% w produkcji) i nawet o 40% skrócenie czasu realizacji zadań w porównaniu do tkanin RoCEv2. TheArkusz danych MQM9790-NS2FISpecyfikacje MQM9790-NS2Fdostarczają wyczerpujących szczegółów, a jednostki są łatwo dostępne (Do sprzedania MQM9790-NS2Fautoryzowanymi kanałami). Co więcej, kompatybilność przełącznika z istniejącymi adapterami NVIDIA zapewnia płynną ścieżkę migracji użytkownikom, którzy już zainwestowali w ekosystem Mellanox.

Podsumowując, to rozwiązanie techniczne oparte naPrzełącznik InfiniBand MQM9790-NS2Fzapewnia solidną, wydajną operacyjnie strukturę, która spełnia najbardziej rygorystyczne wymagania dotyczące połączeń wzajemnych o niskim opóźnieniu – co jest kamieniem węgielnym nowej generacji superkomputerów AI.