Biała księga techniczna przełącznika NVIDIA Mellanox MQM8790-HS2F InfiniBand
August 21, 2026
NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch: Techniczna biała księga optymalizacji niskolatencyjnego połączenia dla klastrów RDMA/HPC/AI
Niniejsza techniczna biała księga jest przeznaczona dla architektów sieci, inżynierów przedsprzedażowych i menedżerów operacyjnych. Koncentruje się na NVIDIA Mellanox MQM8790-HS2F przełączniku InfiniBand 200 Gb/s HDR, zapewniając kompleksowy projekt rozwiązania dla optymalizacji niskolatencyjnego połączenia w klastrach akcelerowanych przez RDMA, wysokowydajnych obliczeniach (HPC) i sztucznej inteligencji (AI). Dokument obejmuje projekt architektury, kluczowe technologie, strategie wdrażania i skalowania, monitorowanie operacji oraz ocenę wartości — oferując powtarzalny schemat dla infrastruktury obliczeniowej nowej generacji intensywnie wykorzystującej dane.
1. Tło projektu i analiza wymagań
W miarę jak parametry modeli AI osiągają bilionowe wielkości, a symulacje HPC wymagają coraz większej rozdzielczości, bazowa sieć ewoluowała z elementu wspierającego do głównego czynnika determinującego wydajność. Rozproszone zadania treningowe, na przykład, mogą spędzać 40–60% czasu pracy na operacjach komunikacji zbiorowej, jeśli połączenie nie ma wystarczającej przepustowości i charakterystyki latencji. Dla zespołów IT przedsiębiorstw oznacza to bezpośrednio wydłużony czas wprowadzenia na rynek inicjatyw AI i niedostateczne wykorzystanie inwestycji w GPU.
Kluczowe wymagania zidentyfikowane podczas szeroko zakrojonych kontaktów z klientami obejmują:
- Bardzo niska i przewidywalna latencja: Przełączanie cut-through poniżej 200 ns dla ruchu MPI i RDMA, z minimalnym jitterem pod obciążeniem.
- Przepustowość bez blokowania: Stała wydajność liniowa na wszystkich portach jednocześnie, eliminująca powstawanie hotspotów i degradację latencji końcowej.
- Obliczenia w sieci: Sprzętowa akceleracja operacji zbiorowych (all-reduce, broadcast, barrier) w celu odciążenia procesorów hosta i zmniejszenia ruchu danych.
- Obsługa skalowalnych topologii: Możliwość budowania topologii fat-tree, torus lub dragonfly+ obejmujących setki do tysięcy węzłów bez nadmiernych warstw przełączników.
- Uproszczone zarządzanie: Zunifikowane monitorowanie sieci, automatyczne wykrywanie topologii i proaktywne wykrywanie błędów w celu zmniejszenia obciążenia operacyjnego.
MQM8790-HS2F jako optymalny element składowy dla tej architektury rozwiązania, a jego wstępna kartą katalogową MQM8790-HS2F potwierdza 40 portów 200 Gb/s HDR, latencję cut-through poniżej 130 ns i obsługę obliczeń w sieci SHARP v3.0 — możliwości, które bezpośrednio odpowiadają powyższym wymaganiom.
2. Ogólny projekt architektury sieci/systemu
Proponowana architektura wykorzystuje dwuwarstwową topologię fat-tree leaf-spine dla klastrów do 1200 węzłów, z opcją rozszerzenia do trzech warstw dla większych wdrożeń. Ta topologia równoważy wydajność, koszt i łatwość zarządzania, zapewniając pełną przepustowość bisekcyjną i deterministyczną latencję w całej sieci.
| Warstwa | Typ urządzenia | Liczba portów (użytych) | Rola łączności |
|---|---|---|---|
| Leaf | MQM8790-HS2F | 32 x 200 Gb/s (16 do węzłów, 16 do spine'ów) | Agreguje ruch węzłów obliczeniowych |
| Spine | MQM8790-HS2F | 40 x 200 Gb/s (wszystkie do przełączników leaf) | Niewblokujące połączenie krzyżowe między leafami |
Każdy przełącznik leaf łączy do 16 węzłów obliczeniowych za pomocą kart hosta NVIDIA ConnectX-6 lub ConnectX-7 HDR, wykorzystując ekosystem optyki kompatybilnymi z MQM8790-HS2F — obejmujący zarówno aktywne kable optyczne (AOC), jak i pasywne miedziane DAC, w zależności od odległości połączenia. Projekt węzłów MQM8790-HS2F 200Gb/s HDR 40-portowych QSFP56 zapewnia dużą gęstość dla agregacji na poziomie szafy, zachowując jednocześnie format 1U dla efektywnego wykorzystania przestrzeni w szafie.
Dla klastrów przekraczających 1200 węzłów zaleca się trójwarstwową topologię z dodatkową warstwą super-spine. W tej konfiguracji rozwiązanie przełącznika InfiniBand MQM8790-HS2F utrzymuje swoją rolę we wszystkich warstwach, upraszczając zarządzanie częściami zamiennymi i konfiguracją — jeden typ przełącznika obsługuje całą sieć, od brzegu do rdzenia.
3. Rola i kluczowe cechy NVIDIA Mellanox MQM8790-HS2F
NVIDIA Mellanox MQM8790-HS2F służy jako podstawowy element przełączający w tej architekturze, dostarczając następujące wyróżniające możliwości, które bezpośrednio napędzają optymalizację niskolatencyjnego połączenia:
- Prędkość portu HDR 200 Gb/s: Podwaja przepustowość poprzedniej generacji EDR (100 Gb/s), zachowując wsteczną kompatybilność z HDR100 (100 Gb/s) dla środowisk o mieszanej prędkości, chroniąc wcześniejsze inwestycje.
- Przełączanie cut-through z latencją poniżej 130 ns: Minimalizuje czas, jaki pakiety spędzają w przełączniku, co jest kluczowe dla wrażliwych na latencję operacji RDMA i wzorców komunikacji zbiorowej.
- Obliczenia w sieci SHARP v3.0: Odciąża operacje redukcji od procesorów hosta do sieci przełączającej, zmniejszając ruch danych nawet o 30% i przyspieszając wydajność all-reduce dla treningu AI nawet 2-krotnie.
- Routing adaptacyjny i kontrola zatorów: Dynamicznie rozdziela ruch między wieloma ścieżkami, aby unikać hotspotów, a flagi zatorów i kontrola przepływu oparta na kredytach zapewniają bezstratne działanie — warunek wstępny dla wydajności RDMA.
- Zintegrowana telemetria i diagnostyka: Zapewnia granularny wgląd w obłożenie bufora na port, wskaźniki błędów łącza i wzorce ruchu, umożliwiając proaktywną optymalizację i szybką izolację błędów.
Zgodnie ze szczegółowymi specyfikacje MQM8790-HS2F, przełącznik obsługuje warianty przepływu powietrza do przodu i do tyłu, dostosowując się do różnych projektów chłodzenia centrum danych. Jego podwójne redundantne zasilacze i moduły wentylatorów z możliwością wymiany podczas pracy dodatkowo zwiększają niezawodność i łatwość serwisowania.
4. Zalecenia dotyczące wdrożenia i rozbudowy (z typową topologią)
Dla zrównoważonego i opłacalnego wdrożenia początkowego zaleca się następujące najlepsze praktyki:
- Łączność węzeł-leaf: Używaj kabli 200 Gb/s HDR (miedziane DAC dla ≤3 m, AOC dla ≤30 m) z kompatybilnymi z MQM8790-HS2F złączami QSFP56. Upewnij się, że karty hosta są skonfigurowane dla tej samej prędkości łącza i ustawień FEC co porty przełącznika.
- Łączność leaf-spine: Wdróż kable AOC 200 Gb/s lub nadajniki-odbiorniki światłowodowe wielomodowe na odległości do 100 m. MQM8790-HS2F automatycznie negocjuje parametry łącza, upraszczając wdrożenie.
- Planowanie nadsubskrypcji: Dla ogólnych obciążeń AI/HPC, współczynnik nadsubskrypcji 2:1 (dwa węzły obliczeniowe na łącze uplink 200 Gb/s) zapewnia optymalny stosunek kosztu do wydajności. Dla obciążeń zoptymalizowanych pod kątem latencji lub intensywnie korzystających z pamięci masowej, rozważ nadsubskrypcję 1:1 (pełną).
- Ścieżka rozbudowy: Podczas dodawania nowych szaf po prostu wdrażaj dodatkowe przełączniki leaf i podłączaj je do istniejących przełączników spine. W przypadku znaczącego zwiększenia pojemności (podwojenie liczby węzłów) zaktualizuj warstwę spine do wyższego radiksu lub dodaj warstwę super-spine.
Oceniając cenę MQM8790-HS2F i całkowity koszt posiadania, należy wziąć pod uwagę, że zunifikowana architektura — wykorzystująca ten sam typ przełącznika we wszystkich warstwach sieci — zmniejsza zapasy części zamiennych o około 70% w porównaniu do podejść wieloskładnikowych. To uproszczenie przyspiesza reakcję na incydenty i minimalizuje przestoje podczas awarii sprzętu.
5. Monitorowanie operacji, rozwiązywanie problemów i optymalizacja
Skuteczne zarządzanie środowiskiem przełącznika InfiniBand MQM8790-HS2F wymaga systematycznego podejścia do monitorowania, diagnostyki i dostrajania wydajności.
Najlepsze praktyki monitorowania:
- Wdróż NVIDIA Unified Fabric Manager (UFM) do scentralizowanego wglądu w sieć, w tym map topologii, map cieplnych wykorzystania poszczególnych łączy i histogramów latencji w czasie rzeczywistym.
- Monitoruj liczniki błędów na port — zwłaszcza błędy CRC, błędy symboli i zdarzenia rozłączenia łącza — aby wcześnie wykryć degradujące się optykę lub kable. Ustaw pułapki SNMP dla predefiniowanych progów, aby umożliwić proaktywne utrzymanie.
- Śledź wydajność operacji zbiorowych SHARP za pomocą zintegrowanych liczników wydajności przełącznika, identyfikując możliwości optymalizacji wzorców komunikacji zbiorowej na poziomie aplikacji.
Rozwiązywanie typowych problemów:
- Błędy CRC łącza na określonych portach: Sprawdź prawidłowe osadzenie kabla i czystość złączy optycznych. Jeśli błędy się utrzymują, wymień kabel lub nadajnik-odbiornik. kartą katalogową MQM8790-HS2F zawiera szczegółowe progi diagnostyczne dla poszczególnych portów.
- Nieoczekiwane skoki latencji: Sprawdź hotspoty zatorów za pomocą analizy przepływu ruchu UFM. Routing adaptacyjny może wymagać rekonfiguracji dla niektórych wzorców ruchu — eksperymentuj z różnymi algorytmami routingu (minimalny vs. nieminimalny).
- Problemy z partycjonowaniem sieci: Upewnij się, że klucze partycji (PKey) i konfiguracje menedżera podsieci IPoIB są prawidłowe. Wbudowany menedżer podsieci przełącznika zapewnia automatyczne wykrywanie sieci, ale ręczne dostosowania mogą być konieczne w środowiskach wielodostępnych.
Wskazówki dotyczące optymalizacji wydajności:
- Dla obciążeń treningowych AI włącz SHARP v3.0 i skonfiguruj biblioteki komunikacji zbiorowej (NCCL, OpenMPI), aby korzystały z możliwości odciążania przełącznika. Może to zmniejszyć latencję all-reduce nawet o 2x dla dużych rozmiarów wiadomości.
- Dla aplikacji HPC wrażliwych na latencję rozważ wyłączenie routingu adaptacyjnego, aby wymusić deterministyczny wybór ścieżki, poświęcając pewną różnorodność ścieżek na rzecz przewidywalnej latencji.
- Okresowo przeglądaj i aktualizuj oprogramowanie układowe przełącznika, ponieważ NVIDIA regularnie publikuje ulepszenia wydajności i poprawki bezpieczeństwa. Zapoznaj się z kartą katalogową MQM8790-HS2F w celu uzyskania macierzy zgodności wersji.
6. Podsumowanie i ocena wartości
NVIDIA Mellanox MQM8790-HS2F oferuje przekonującą propozycję wartości dla organizacji budujących lub modernizujących klastry RDMA/HPC/AI. Dostarczając 200 Gb/s na port, latencję poniżej 130 ns i akcelerację obliczeń w sieci w obudowie 1U, 40-portowej, przełącznik spełnia najbardziej rygorystyczne wymagania połączeń nowoczesnych obciążeń intensywnie wykorzystujących dane.
Kluczowe czynniki wartości obejmują:
- Skalowalność wydajności: Niewblokująca architektura fat-tree zbudowana wokół węzłów MQM8790-HS2F 200Gb/s HDR 40-portowych QSFP56 skaluje się od 200 do ponad 10 000 węzłów bez fundamentalnych zmian topologii.
- Efektywność operacyjna: Jeden typ przełącznika we wszystkich warstwach sieci zmniejsza zapasy części zamiennych, upraszcza szkolenie i przyspiesza rozwiązywanie problemów.
- Ochrona inwestycji: Wsteczna kompatybilność z HDR100 i EDR pozwala na stopniowe modernizacje, podczas gdy format i gęstość portów przełącznika są zgodne z przyszłymi planami rozwoju 400G (NDR).
- Sprawdzony ekosystem: Głęboka integracja z adapterami NVIDIA ConnectX, DPU BlueField i platformą zarządzania UFM zapewnia przewidywalność wydajności od końca do końca.
Dla organizacji gotowych do wdrożenia, MQM8790-HS2F na sprzedaż za pośrednictwem globalnej sieci autoryzowanych dystrybutorów NVIDIA obejmuje kompleksowe opcje wsparcia, w tym części zamienne na miejscu, zaawansowaną wymianę i subskrypcje aktualizacji oprogramowania układowego. Szczegółowe specyfikacje MQM8790-HS2F i projekty referencyjne są dostępne za pośrednictwem portalu dokumentacji technicznej NVIDIA, a konsultacje dotyczące niestandardowych topologii są oferowane dla dużych wdrożeń typu brownfield lub greenfield.

