NVIDIA Mellanox 920-9B210-00FN-0D0 Referencja techniczna: 400Gb/s NDR Optymalizacja łącza międzyłącza niskiego opóźnienia

August 26, 2026

NVIDIA Mellanox 920-9B210-00FN-0D0 Referencja techniczna: 400Gb/s NDR Optymalizacja łącza międzyłącza niskiego opóźnienia

NVIDIA Mellanox 920-9B210-00FN-0D0 Dokumentacja Techniczna: Optymalizacja sieci o niskim opóźnieniu 400 Gb/s NDR dla klastrów RDMA/HPC/AI

1. Tło projektu i analiza wymagań

W miarę jak klastry treningowe AI przekraczają 4000 GPU, a symulacje HPC zbliżają się do wydajności exascale, sieci napotykają bezprecedensowe wymagania dotyczące przepustowości, opóźnień i determinizmu. Przejście z 200 Gb/s HDR na 400 Gb/s NDR nie jest już opcjonalne dla organizacji celujących w modele o bilionie parametrów lub symulacje pogody na skalę kilometrową – jest to strategiczna konieczność. Kluczowe wymagania zidentyfikowane w wiodących wdrożeniach badawczych i korporacyjnych obejmują:

  • Bardzo niskie deterministyczne opóźnienie: Opóźnienie port-do-port poniżej 100 ns w celu zminimalizowania narzutu komunikacji MPI i all-to-all.
  • Bezstratna sieć w skali: Zero utraconych pakietów podczas zatorów na tysiącach punktów końcowych, zapewniające przewidywalną wydajność RDMA.
  • Odciążenie obliczeń w sieci: Odciążenie operacji zbiorczych (all-reduce, all-to-all, broadcast) do sieci w celu maksymalizacji wykorzystania GPU.
  • Skalowalność o wysokim współczynniku radix: Obsługa dużych topologii fat-tree i dragonfly+ z pełną przepustowością bisekcji do 8000+ węzłów.
  • Ochrona inwestycji: Bezproblemowa kompatybilność z istniejącymi kablami, optyką i narzędziami do zarządzania HDR w celu umożliwienia etapowych modernizacji.

Aby sprostać tym wymaganiom, to rozwiązanie przyjmuje NVIDIA Mellanox 920-9B210-00FN-0D0 jako podstawowy element budulcowy – przełącznik InfiniBand 400 Gb/s NDR, który zapewnia gęstość, wydajność i inteligencję wymaganą do wdrożeń klasy exascale.

2. Ogólny projekt architektury sieci

Proponowane rozwiązanie wykorzystuje dwupoziomową topologię leaf-spine, która zapewnia skalowalną, nieblokującą sieć z deterministycznymi opóźnieniami i uproszczonym okablowaniem. Na poziomie leaf, każdy stojak obliczeniowy jest wyposażony w jedną lub dwie jednostki InfiniBand switch OPN 920-9B210-00FN-0D0, oferujące 64 porty łączności 400 Gb/s NDR do serwerów GPU za pomocą kabli miedzianych bezpośredniego połączenia (DAC) OSFP-to-OSFP lub aktywnych kabli optycznych (AOC). Na poziomie spine, druga warstwa przełączników 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR łączy wszystkie przełączniki leaf, tworząc sieć fat-tree z pełną przepustowością bisekcji.

Dla klastrów przekraczających 5000 węzłów można wdrożyć trójpoziomową architekturę folded-Clos, w której 920-9B210-00FN-0D0 służy zarówno jako leaf, jak i spine, aby utrzymać spójną wydajność na wszystkich poziomach. Przełącznik obsługuje do 64 przełączników w jednej sieci pod jednym menedżerem podsieci, umożliwiając zunifikowane sterowanie dużymi topologiami.

Poniższa tabela podsumowuje kluczowe parametry skalowania dla dwupoziomowej sieci NDR zbudowanej wokół 920-9B210-00FN-0D0:

Składnik Specyfikacja Wartość
Przełączniki Leaf 920-9B210-00FN-0D0 1–2 na stojak
Przełączniki Spine 920-9B210-00FN-0D0 N/2 (N = liczba przełączników leaf)
Maks. punktów końcowych Serwery GPU Do 4096 (radix 64-portowy)
Przepustowość bisekcji Pełna nieblokująca 51,2 Tb/s na poziom spine

3. Rola i kluczowe cechy NVIDIA Mellanox 920-9B210-00FN-0D0

W ramach tej architektury NVIDIA Mellanox 920-9B210-00FN-0D0 służy jako podstawowy element przełączający, zapewniając kilka kluczowych możliwości, które bezpośrednio odpowiadają wymaganiom zidentyfikowanym w Sekcji 1:

  • 64 porty 400 Gb/s NDR: Każdy port OSFP obsługuje dwukierunkowe 400 Gb/s z korekcją błędów do przodu (FEC) dla niezawodnej łączności o rozszerzonym zasięgu. Agregowana przepustowość przełączania wynosząca 51,2 Tb/s zapewnia wystarczający zapas nawet dla najbardziej intensywnych komunikacyjnie obciążeń.
  • Bardzo niskie opóźnienie cut-through: Opóźnienie port-do-port poniżej 100 ns, zgodnie z dokumentacją w arkuszem danych 920-9B210-00FN-0D0, zapewnia minimalny narzut dla operacji MPI i RDMA.
  • Zintegrowany SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol): Odciąża operacje zbiorcze od procesorów hosta, zmniejszając opóźnienie all-reduce o nawet 40% i all-to-all o nawet 35% w dużych zadaniach.
  • Adaptacyjne routowanie i kontrola zatorów: Dynamicznie przekierowuje ruch, aby unikać punktów gorących, zapewniając przewidywalną wydajność w przypadku niekorzystnych wzorców ruchu. Zaawansowana telemetria zapewnia widoczność dla poszczególnych przepływów i portów w celu proaktywnego zarządzania.
  • Kompleksowe zarządzanie: Pełna integracja z NVIDIA Unified Fabric Manager (UFM) w celu zapewnienia bezobsługowego udostępniania, monitorowania stanu i automatycznego przełączania awaryjnego.

specyfikacji 920-9B210-00FN-0D0 podkreślają również podwójne redundantne zasilacze, moduły wentylatorów z możliwością wymiany podczas pracy i obsługę redundantnych konfiguracji menedżerów podsieci, zapewniając dostępność na poziomie 99,999% dla krytycznych obciążeń.

4. Zalecenia dotyczące wdrożenia i skalowalności

Dla organizacji planujących wdrożenie rozwiązania InfiniBand switch OPN 920-9B210-00FN-0D0, zaleca się następujące wytyczne dotyczące wdrożenia:

  • Strategia okablowania: Używaj kabli DAC OSFP-to-OSFP do połączeń wewnątrz stojaka (do 3 m) oraz kabli AOC lub transceiverów optycznych do połączeń między stojakami i między spine-leaf (do 100 m). Sprawdź, czy wszystkie kable są kompatybilne z 920-9B210-00FN-0D0 zgodnie z macierzą kompatybilności NVIDIA, aby uniknąć problemów z integralnością sygnału.
  • Redundancja: Wdróż podwójne zasilacze podłączone do oddzielnych PDU. Użyj co najmniej dwóch przełączników spine na leaf, aby wyeliminować pojedyncze punkty awarii. W przypadku krytycznych obciążeń rozważ redundancję N+1 na poziomie spine.
  • Zarządzanie oprogramowaniem układowym: Upewnij się, że wszystkie przełączniki działają na identycznych wersjach oprogramowania układowego NVIDIA. Użyj funkcji automatycznej aktualizacji oprogramowania układowego UFM do aktualizacji bez przestojów. Zweryfikuj kompatybilność oprogramowania układowego z adapterami hosta i kablami przed wdrożeniem.
  • Ścieżka skalowania: Dla klastrów powyżej 4096 węzłów przejdź do trójpoziomowej topologii folded-Clos lub wykorzystaj dragonfly+ z adaptacyjnym routowaniem. 920-9B210-00FN-0D0 obsługuje do 64 przełączników w jednej sieci, z wieloma sieciami połączonymi przez bramy dla większych wdrożeń.
  • Walidacja wydajności: Przed wdrożeniem produkcyjnym przeprowadź kompleksowe testy obciążeniowe przy użyciu narzędzi takich jak OpenFabrics Enterprise Distribution (OFED) performance benchmarks, aby zweryfikować wydajność sieci w porównaniu ze specyfikacjami z arkuszem danych 920-9B210-00FN-0D0.

Przy obliczaniu całkowitego kosztu posiadania uwzględnij zmniejszoną liczbę poziomów przełączników i uproszczone okablowanie w porównaniu z alternatywami o niższym współczynniku radix. Chociaż cena 920-9B210-00FN-0D0 jest wyższa niż przełączników HDR, koszt za port i koszt sieci na GPU są znacznie niższe w dużych wdrożeniach, co czyni go opłacalnym wyborem dla projektów exascale.

5. Operacje, monitorowanie i rozwiązywanie problemów

Skuteczne zarządzanie siecią NDR wymaga kompleksowego systemu monitorowania i rozwiązywania problemów. NVIDIA UFM zapewnia pojedynczy punkt widzenia dla całej sieci opartej na NVIDIA Mellanox 920-9B210-00FN-0D0, oferując:

  • Wizualizacja topologii: Automatyczne wykrywanie i graficzna reprezentacja wszystkich przełączników, połączeń i punktów końcowych z aktualizacjami statusu w czasie rzeczywistym.
  • Pulpity nawigacyjne wydajności: Widoki wykorzystania portów, wskaźników błędów, wskaźników zatorów i zajętości bufora w całej sieci w czasie rzeczywistym.
  • Proaktywne alerty: Alarmy oparte na progach dla degradacji połączeń, anomalii temperatury, awarii zasilaczy i zużycia kabli.
  • Izolacja błędów: Prowadzone przepływy pracy rozwiązywania problemów, które identyfikują wadliwe kable, transceiverów lub porty przełączników, skracając średni czas do rozwiązania (MTTR).
  • Analiza historyczna: Analiza trendów i planowanie pojemności w oparciu o historyczne dane dotyczące wydajności, umożliwiające proaktywne decyzje dotyczące skalowania.

W celu zaawansowanego rozwiązywania problemów wykorzystaj wbudowane narzędzia diagnostyczne przełącznika, w tym testy pętli zwrotnej, analizę BER (bit error rate) i monitorowanie diagnostyczne modułów optycznych (DOM). Typowe problemy napotykane we wczesnych wdrożeniach NDR obejmują suboptymalne routowanie spowodowane nierównymi prędkościami połączeń, niedopasowanymi typami kabli lub niespójnościami oprogramowania układowego. Włączenie adaptacyjnego routowania, weryfikacja, czy wszystkie połączenia działają z prędkością 400 Gb/s z włączonym FEC, oraz zapewnienie spójnego oprogramowania układowego na wszystkich przełącznikach rozwiązuje większość anomalii wydajności.

Inżynierowie sieciowi powinni również ustalić podstawowy poziom specyfikacji 920-9B210-00FN-0D0 podczas fazy walidacji, w tym oczekiwane opóźnienia, przepustowość i wskaźniki błędów. Odchylenia od tego poziomu podstawowego mogą być wykorzystywane jako wczesne wskaźniki potencjalnych problemów. InfiniBand switch OPN 920-9B210-00FN-0D0 obsługuje również kompleksowe logowanie zdarzeń za pośrednictwem syslog i SNMP, umożliwiając integrację z istniejącymi stosami monitorowania centrum danych.

6. Podsumowanie i ocena wartości

920-9B210-00FN-0D0 oferuje przekonującą propozycję wartości dla organizacji budujących lub rozszerzających klastry HPC i AI oparte na NDR. Zapewnia 64 porty 400 Gb/s NDR z opóźnieniem poniżej 100 ns, odciążeniem SHARPv3, zarządzaniem klasy korporacyjnej i pełną kompatybilnością z istniejącym ekosystemem HDR – wszystko w kompaktowej platformie 1U. Kluczowe punkty wartości obejmują:

  • Wydajność: Redukcja opóźnień komunikacji all-to-all o nawet 75% i opóźnień all-reduce o nawet 40% dzięki odciążeniu SHARPv3 i przepustowości NDR.
  • Efektywność kosztowa: Niższy koszt sieci na GPU w porównaniu z alternatywami HDR w dużych wdrożeniach, wynikający z wyższego współczynnika radix i zmniejszonej liczby warstw przełączników.
  • Prostota operacyjna: Głęboka integracja z UFM w celu zunifikowanego zarządzania, automatycznego udostępniania, proaktywnego monitorowania i szybkiego rozwiązywania problemów.
  • Ochrona inwestycji: Pełna kompatybilność z istniejącymi kablami, optyką i stosami oprogramowania HDR, umożliwiająca etapowe modernizacje bez zakłócania obciążeń produkcyjnych.
  • Przyszłościowa skalowalność: Obsługa trójpoziomowych topologii folded-Clos i dragonfly+, zapewniająca skalowalność sieci do 8000+ węzłów w miarę wzrostu zapotrzebowania na moc obliczeniową.

Dla organizacji oceniających 920-9B210-00FN-0D0 do sprzedaży za pośrednictwem partnerów kanałowych NVIDIA, zalecamy zapoznanie się ze szczegółowym arkuszem danych 920-9B210-00FN-0D0 i skontaktowanie się z certyfikowanym architektem rozwiązań w celu walidacji projektu pod kątem konkretnych wymagań dotyczących obciążeń i skali. NVIDIA Mellanox 920-9B210-00FN-0D0 jest gotowy do produkcji, oferując wysokowydajną, skalowalną podstawę łączności dla następnej generacji innowacji w dziedzinie AI i HPC.