NVIDIA Mellanox 920-9B110-00FH-0D0 Odniesienie techniczne: Optymalizowane łącze o niskim opóźnieniu dla RDMA/HPC/AI

August 25, 2026

NVIDIA Mellanox 920-9B110-00FH-0D0 Odniesienie techniczne: Optymalizowane łącze o niskim opóźnieniu dla RDMA/HPC/AI

NVIDIA Mellanox 920-9B110-00FH-0D0 Referencja Techniczna: Zoptimizowany Interkonekt o Niskim Opóźnieniu dla Klastrów RDMA/HPC/AI przy 200 Gb/s HDR

1. Tło Projektu i Analiza Wymagań

W miarę jak klastry HPC i AI stale się rozwijają, rozproszone szkolenia i obciążenia symulacji naukowych wymagają coraz bardziej rygorystycznej przepustowości sieci, opóźnień i skalowalności. Jednak nie każdy klaster wymaga infrastruktury 400 Gb/s NDR — znaczna liczba środowisk produkcyjnych jest już znormalizowana na 200 Gb/s HDR i poszukuje ulepszeń wydajności w ramach kontrolowanego budżetu. Typowe wymagania obejmują:

  • Deterministyczne niskie opóźnienia: Komunikacja zbiorcza MPI musi utrzymywać opóźnienie port-do-port poniżej mikrosekundy, zapobiegając wpływowi opóźnień końcowych na zbieżność treningu.
  • Bezstratna sieć: Zerowe upuszczenia pakietów w warunkach przeciążenia, aby zapewnić wydajność RDMA i uniknąć załamania wydajności.
  • Odciążenie obliczeń w sieci: Odciążenie operacji zbiorczych, takich jak All-Reduce, do sieci, aby zwolnić zasoby CPU/GPU hosta.
  • Płynna skalowalność: Obsługa nienblokującego rozszerzenia od setek do tysięcy węzłów, z kompatybilnością z istniejącymi kablami HDR i transceiverami optycznymi.

Aby sprostać tym wymaganiom, rozwiązanie to przyjmuje NVIDIA Mellanox 920-9B110-00FH-0D0 jako podstawowy element budulcowy — przełącznik InfiniBand 200 Gb/s HDR, który równoważy wydajność, gęstość i opłacalność dla wdrożeń średnich i dużych.

2. Ogólny Projekt Architektury Sieci

Proponowane rozwiązanie wykorzystuje dwupoziomową topologię leaf-spine, która zapewnia skalowalną, nienblokującą sieć o przewidywalnych opóźnieniach i uproszczonym okablowaniu. Na poziomie leaf, każdy stojak obliczeniowy jest wyposażony w jeden 920-9B110-00FH-0D0 InfiniBand switch OPN (Numer Porządkowy), oferujący 40 portów łączności 200 Gb/s HDR do serwerów GPU za pomocą kabli miedzianych typu direct-attach (DAC) OSFP-do-OSFP lub aktywnych kabli optycznych (AOC). Na poziomie spine, druga warstwa przełączników MQM8790-HS2F — platforma krzemowa stanowiąca podstawę 920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDR — łączy wszystkie przełączniki leaf, tworząc sieć typu fat-tree o pełnej przepustowości bisekcji.

Dla większych klastrów przekraczających 1500 węzłów, można zaimplementować trójpoziomową architekturę folded-Clos, gdzie 920-9B110-00FH-0D0 służy zarówno jako leaf, jak i spine, aby utrzymać spójną wydajność na wszystkich poziomach. Poniższa tabela podsumowuje kluczowe parametry skalowania dla dwupoziomowej sieci HDR zbudowanej wokół tego przełącznika:

Komponent Specyfikacja Wartość
Przełączniki Leaf 920-9B110-00FH-0D0 1 na stojak
Przełączniki Spine 920-9B110-00FH-0D0 N/2 (N = liczba przełączników leaf)
Maks. punktów końcowych Serwery GPU Do 1600 (radix 40-portowy)
Przepustowość bisekcji Pełne nienblokowanie 8,0 Tb/s na poziom spine

3. Rola i Kluczowe Cechy NVIDIA Mellanox 920-9B110-00FH-0D0

W ramach tej architektury NVIDIA Mellanox 920-9B110-00FH-0D0 służy jako podstawowy element przełączający, zapewniając kilka kluczowych możliwości:

  • 40 portów 200 Gb/s HDR: Każdy port OSFP obsługuje dwukierunkowe 200 Gb/s z korekcją błędów do przodu (FEC) dla niezawodnej łączności o rozszerzonym zasięgu.
  • Zintegrowany SHARPv2 (Scalable Hierarchical Aggregation and Reduction Protocol): Odciąża operacje komunikacji zbiorczej, zmniejszając opóźnienia MPI All-Reduce nawet o 30% w typowych obciążeniach HPC.
  • Adaptacyjne routowanie i kontrola przeciążeń: Dynamicznie przekierowuje ruch, aby unikać hotspotów, zapewniając przewidywalną wydajność w warunkach niekorzystnych wzorców ruchu.
  • Zaawansowana telemetria: Liczniki per-flow i per-port, wraz z monitorowaniem zajętości bufora, zapewniają głęboki wgląd w stan sieci.

Zgodnie z kartą danych 920-9B110-00FH-0D0, przełącznik zapewnia opóźnienie cut-through poniżej 200 ns i obsługuje łączną przepustowość przełączania do 8,0 Tb/s. Specyfikacje 920-9B110-00FH-0D0 podkreślają również podwójne redundantne zasilacze i moduły wentylatorów z możliwością wymiany podczas pracy, zapewniając dostępność na poziomie 99,999% dla krytycznych obciążeń.

4. Zalecenia dotyczące Wdrożenia i Skalowalności

Dla organizacji planujących wdrożenie rozwiązania 920-9B110-00FH-0D0 InfiniBand switch OPN, zaleca się następujące wytyczne dotyczące wdrożenia:

  • Strategia okablowania: Używaj kabli DAC OSFP-do-OSFP do połączeń wewnątrz stojaka (do 3 m) oraz kabli AOC lub transceiverów optycznych do połączeń między stojakami i między leaf-spine (do 100 m). Sprawdź, czy wszystkie kable są kompatybilne z 920-9B110-00FH-0D0 zgodnie z macierzą kompatybilności NVIDIA.
  • Redundancja: Wdróż podwójne zasilacze podłączone do oddzielnych PDU. Użyj co najmniej dwóch przełączników spine na leaf, aby wyeliminować pojedyncze punkty awarii.
  • Zarządzanie oprogramowaniem układowym: Upewnij się, że wszystkie przełączniki działają na identycznych wersjach oprogramowania układowego NVIDIA. Użyj funkcji automatycznej aktualizacji oprogramowania układowego UFM do aktualizacji bez przestojów.
  • Ścieżka skalowania: Dla klastrów powyżej 1600 węzłów, przejdź do trójpoziomowej topologii folded-Clos lub wykorzystaj dragonfly+ z adaptacyjnym routowaniem. 920-9B110-00FH-0D0 obsługuje do 64 przełączników w jednej sieci pod jednym menedżerem podsieci.

Przy obliczaniu całkowitego kosztu posiadania, uwzględnij zmniejszoną liczbę poziomów przełączników i uproszczone okablowanie w porównaniu do alternatyw o niższym radix. Chociaż cena 920-9B110-00FH-0D0 za jednostkę jest wyższa niż przełączników EDR (100 Gb/s), koszt za port jest znacznie niższy niż NDR, co czyni go optymalnym wyborem dla świadomych kosztów wdrożeń HDR.

5. Operacje, Monitorowanie i Rozwiązywanie Problemów

Efektywne zarządzanie siecią HDR wymaga kompleksowego systemu monitorowania i rozwiązywania problemów. Unified Fabric Manager (UFM) firmy NVIDIA zapewnia pojedynczy punkt zarządzania dla całej NVIDIA Mellanox 920-9B110-00FH-0D0, oferując:

  • Wizualizacja topologii: Automatyczne wykrywanie i graficzna reprezentacja wszystkich przełączników, połączeń i punktów końcowych.
  • Pulpity nawigacyjne wydajności: Widoki w czasie rzeczywistym wykorzystania portów, wskaźników błędów i wskaźników przeciążenia.
  • Proaktywne alerty: Alarmy oparte na progach dla degradacji połączeń, anomalii temperatury i awarii zasilania.
  • Izolacja błędów: Kierowane przepływy pracy rozwiązywania problemów, które identyfikują wadliwe kable, transceivery lub porty przełączników.

W celu zaawansowanego rozwiązywania problemów, wykorzystaj wbudowane narzędzia diagnostyczne przełącznika, w tym testy loopback i analizę BER (bit error rate), aby zweryfikować integralność połączenia przed wdrożeniem obciążeń produkcyjnych. Typowe problemy napotykane we wczesnych wdrożeniach obejmują suboptymalne routowanie spowodowane nierównymi prędkościami połączeń lub niedopasowanymi typami kabli. Włączenie adaptacyjnego routowania i weryfikacja, że wszystkie połączenia działają z prędkością 200 Gb/s (z włączonym FEC), rozwiązuje większość anomalii wydajności. 920-9B110-00FH-0D0 InfiniBand switch OPN obsługuje również redundantne konfiguracje menedżerów podsieci, zapewniając, że rekonfiguracja sieci odbywa się bez ręcznej interwencji w przypadku awarii węzła zarządzającego.

6. Podsumowanie i Ocena Wartości

920-9B110-00FH-0D0 oferuje przekonującą propozycję wartości dla organizacji budujących lub rozszerzających klastry HPC i AI oparte na HDR. Zapewnia 40 portów 200 Gb/s HDR z opóźnieniem poniżej 200 ns, odciążeniem SHARPv2 i zarządzaniem klasy korporacyjnej — wszystko w opłacalnej platformie 1U. Kluczowe punkty wartości obejmują:

  • Wydajność: Zmniejszenie czasu ukończenia zadań o nawet 35% w przypadku obciążeń intensywnie komunikacyjnych dzięki odciążeniu SHARPv2 i adaptacyjnemu routowaniu.
  • Efektywność kosztowa: Niższy TCO w porównaniu do alternatyw NDR, z kosztami za port zoptymalizowanymi dla wdrożeń w skali HDR.
  • Prostota operacyjna: Głęboka integracja z UFM dla zunifikowanego zarządzania, proaktywnego monitorowania i automatycznego przełączania awaryjnego.
  • Ochrona inwestycji: Pełna kompatybilność z istniejącymi kablami HDR, optyką i stosami oprogramowania, umożliwiająca etapowe modernizacje bez zakłócania produkcji.

Dla organizacji oceniających 920-9B110-00FH-0D0 na sprzedaż za pośrednictwem partnerów kanałowych NVIDIA, zalecamy zapoznanie się ze szczegółową kartą danych 920-9B110-00FH-0D0 i współpracę z certyfikowanym architektem rozwiązań w celu walidacji projektu pod kątem specyficznych wymagań dotyczących obciążenia i skali. NVIDIA Mellanox 920-9B110-00FH-0D0 jest gotowy do produkcji już dziś, oferując zrównoważoną, wysokowydajną podstawę interkonektu dla następnej generacji innowacji HPC i AI.