Rozwiązanie techniczne dotyczące transceivera optycznego dla centrum danych NVIDIA Mellanox MMA4Z00-NS

August 19, 2026

Rozwiązanie techniczne dotyczące transceivera optycznego dla centrum danych NVIDIA Mellanox MMA4Z00-NS

NVIDIA Mellanox MMA4Z00-NS Techniczne Rozwiązanie Transceivera Optycznego dla Centrum Danych: Równoważenie Przepustowości i Odległości w Połączeniach Wewnątrz-Raku i Między-Pomieszczeniami

1. Tło Projektu i Analiza Wymagań

W miarę jak klastry treningowe sztucznej inteligencji skalują się od tysięcy do dziesiątek tysięcy GPU, sieci centrow danych stają przed bezprecedensowymi wyzwaniami w zakresie gęstości przepustowości i odległości fizycznej jednocześnie. Biorąc za przykład typowe centrum obliczeniowe AI (inteligentne centrum obliczeniowe), jego węzły obliczeniowe GPU są rozmieszczone w wielu szafach na tej samej podłodze, a także w dwóch głównych serwerowniach na sąsiednich piętrach. Wymagania sieciowe są rygorystyczne: zapewnienie pełnej przepustowości linii 800G między wszystkimi węzłami obliczeniowymi, obsługa zarówno InfiniBand (dla bezpośredniej komunikacji GPU), jak i Ethernet (dla sieci pamięci masowej i zarządzania), oraz pokrycie odległości połączeń od 5 metrów (wewnątrz-raku) do 80 metrów (między-pomieszczeniami) bez wprowadzania wąskich gardeł w tłumaczeniu protokołów.

Tradycyjne podejścia projektowe zazwyczaj opierają się na mieszance różnych typów transceiverów: 800G SR8 dla połączeń wewnątrz-raku o krótkim zasięgu (do 50 m przez OM4) i jednomodowych rozwiązań 800G DR8/FR8 dla dłuższych połączeń między-pomieszczeniami. Jednak ta strategia wielu SKU generuje znaczące obciążenie operacyjne w zarządzaniu zapasami, testowaniu kwalifikacyjnym i dostarczaniu części zamiennych. Ponadto, wyższy koszt i zużycie energii przez optykę jednomodową sprawiają, że są one suboptymalne dla wdrożeń na dużą skalę i o dużej gęstości. NVIDIA Mellanox MMA4Z00-NS został oceniony jako potencjalne rozwiązanie jednej platformy zdolne do ujednolicenia obu domen odległości, przy jednoczesnym zachowaniu elastyczności protokołów i efektywności kosztowej.

2. Ogólny Projekt Architektury Sieci/Systemu

Proponowana architektura przyjmuje topologię spine-leaf, z węzłami obliczeniowymi GPU podłączonymi do przełączników leaf za pomocą portów OSFP 800G, a przełączniki leaf połączone z przełącznikami spine za pomocą tego samego typu transceivera w celu zachowania spójności. Kluczową decyzją architektoniczną było standaryzacja na jednym modelu transceivera optycznego—NVIDIA Mellanox MMA4Z00-NS—we wszystkich segmentach połączeń, od wewnątrz-raku po między-pomieszczeniami, wykorzystując jego ulepszony DSP i budżet mocy optycznej do rozszerzenia efektywnego zasięgu poza standardową specyfikację 50 metrów.

Aby zmaksymalizować integralność sygnału na rozszerzonych odległościach, architektura zawiera kilka zasad projektowych:

  • Optymalizacja Infrastruktury Światłowodowej: Użycie wysokiej jakości światłowodu wielomodowego OM4 (minimalna efektywna szerokość pasma modowego ≥ 4700 MHz·km) dla wszystkich połączeń, ze złączami MPO-12 APC w celu zminimalizowania strat wtrąceniowych i odbicia wstecznego. Strukturalne ścieżki okablowania są zaprojektowane tak, aby unikać ciasnych zagięć i nadmiernych przeskoczeń przez panele krosowe.
  • Rezerwa Budżetu Połączenia: Budżet strat architektonicznych jest utrzymywany poniżej 3,0 dB dla wszystkich połączeń, zapewniając odpowiedni margines dla MMA4Z00-NS do pracy bez błędów nawet na 80 metrach. Osiąga się to poprzez ograniczenie liczby sparowanych par złączy do maksymalnie czterech na połączenie.
  • Przekazywanie Niezależne od Protokołu: Przełączniki leaf (NVIDIA Spectrum-4 dla Ethernet i Quantum-2 dla InfiniBand) są skonfigurowane do rozpoznawania trybu pracy MMA4Z00-NS 2x400G InfiniBand/Ethernet, umożliwiając dynamiczne przypisywanie protokołu na port bez zmian sprzętowych.

Architektura obsługuje zarówno wdrożenia w jednej szafie, jak i w wielu szafach, z MMA4Z00-NS służącym jako uniwersalny aktywator warstwy fizycznej we wszystkich zakresach odległości.

3. Rola NVIDIA Mellanox MMA4Z00-NS i Kluczowe Cechy

W sercu tego rozwiązania, NVIDIA Mellanox MMA4Z00-NS działa jako zunifikowany mostek warstwy fizycznej, eliminując potrzebę stosowania wielu typów transceiverów. Jego kluczowe cechy techniczne istotne dla tej architektury obejmują:

Cecha Korzyść dla tej Architektury
Operacja 800G OSFP SR8 Umożliwia 8×100G PAM4 przez światłowód wielomodowy; zoptymalizowany dla zasięgu 5–80m z dostrajaniem DSP
Tryb podziału 2×400G Obsługuje MMA4Z00-NS 2x400G InfiniBand/Ethernet dla elastycznego wykorzystania portów i płynnej migracji z infrastruktury 400G
Zaawansowany DSP z wyrównaniem Dostrajanie adaptacyjne na połączenie kompensuje niedoskonałości światłowodu, rozszerzając użyteczny zasięg poza opublikowane typowe wartości
Niskie zużycie energii (< 12W) Obsługuje dużą gęstość portów (do 64 portów na przełącznik) bez przekraczania budżetów mocy/termicznych
Szeroka kompatybilność Potwierdzona kompatybilność MMA4Z00-NS z przełącznikami NVIDIA Spectrum, Quantum i przełącznikami OSFP innych producentów dzięki zgodności z MSA

Szczegółowa karta katalogowa MMA4Z00-NS zawiera kompleksowe specyfikacje optyczne i elektryczne, w tym charakterystykę nadajnika i odbiornika, które zostały wykorzystane do walidacji obliczeń budżetu połączenia dla wszystkich segmentów tego wdrożenia. Specyfikacje MMA4Z00-NS potwierdzają typową moc nadawania od -2,5 dBm do 4,0 dBm i czułość odbiornika -6,5 dBm (BER 5E-8), zapewniając zapas mocy optycznej niezbędny do osiągnięcia celu 80 metrów.

Funkcjonalnie, transceiver MMA4Z00-NS 800G OSFP SR8 działa poprzez agregację ośmiu linii sygnałów elektrycznych 100G PAM4 z ASIC przełącznika, konwersję ich na sygnały optyczne i transmisję przez równoległy światłowód wielomodowy za pośrednictwem interfejsu MPO-12. Po stronie odbiorczej, zintegrowany DSP wykonuje odzyskiwanie zegara i danych, wyrównanie i multipleksowanie z powrotem do domeny elektrycznej. Ten potok przetwarzania jest kluczowy dla utrzymania integralności sygnału na rozszerzonych odległościach, gdzie dyspersja modalna i tłumienie w przeciwnym razie pogorszyłyby wydajność.

4. Zalecenia dotyczące Wdrożenia i Skalowania (Z Typową Topologią)

Dla optymalnego wdrożenia NVIDIA Mellanox MMA4Z00-NS, zaleca się następującą topologię i wytyczne dotyczące okablowania:

Typowa Topologia – Skalowanie Trójpoziomowe:

  • Poziom 1 (Wewnątrz-Rak, ≤15m): Bezpośrednie kable krosowe MPO-12 między węzłami obliczeniowymi GPU a przełącznikami na górze szafy (TOR). MMA4Z00-NS jest zainstalowany na obu końcach. Nie jest wymagane dodatkowe kondycjonowanie.
  • Poziom 2 (Między-Rak, 15–45m): Wstępnie zakończone kable magistralne MPO biegnące przez tace nad głową, łączące przełączniki TOR z przełącznikami agregacyjnymi leaf. Dopuszczalne są maksymalnie dwa panele krosowe.
  • Poziom 3 (Między-Pomieszczeniami, 45–80m): Okablowanie strukturalne ze wzmocnionymi magistralami MPO, z użyciem złączy z polerowaniem kątowym i minimalnym spawaniem. Każde połączenie jest testowane pod kątem strat wtrąceniowych i odbicia przed uruchomieniem.

Lista kontrolna wdrożenia:

  • Zweryfikuj wszystkie połączenia światłowodowe za pomocą reflektometru optycznego w dziedzinie czasu (OTDR) i miernika mocy, aby potwierdzić straty poniżej 3,0 dB.
  • Skonfiguruj porty przełącznika do pożądanego protokołu (InfiniBand lub Ethernet) i zweryfikuj, że MMA4Z00-NS automatycznie negocjuje prawidłowy tryb pracy zgodnie z karta katalogowa MMA4Z00-NS.
  • Dla środowisk mieszanych 400G/800G, włącz tryb podziału 2×400G na wybranych portach, umożliwiając MMA4Z00-NS 2x400G InfiniBand/Ethernet obsługę dwóch połączeń 400G z jednego transceivera.
  • Wdrażaj etapowo: zacznij od pojedynczej szafy, zweryfikuj wskaźniki BER i opóźnień, a następnie rozszerz na połączenia między-rakowe i między-pomieszczeniowe.

Dla skalowania na dużą skalę poza 80 metrów, architektura zaleca stosowanie aktywnych kabli optycznych (AOC) lub rozwiązań jednomodowych tylko dla najdłuższych połączeń szkieletowych, zachowując jednocześnie rozwiązanie transceivera MMA4Z00-NS 800G OSFP SR8 dla zdecydowanej większości połączeń leaf-to-spine i compute-to-leaf.

5. Operacje, Monitorowanie, Rozwiązywanie Problemów i Optymalizacja

MMA4Z00-NS jest zaprojektowany z myślą o prostocie operacyjnej, z kompleksowym wsparciem cyfrowego monitorowania diagnostycznego (DDM) za pośrednictwem interfejsu I²C. Kluczowe praktyki operacyjne obejmują:

  • Monitorowanie w czasie rzeczywistym: Śledź temperaturę, napięcie zasilania, moc optyczną nadawania/odbioru i prąd polaryzacji lasera. Platformy zarządzania siecią NVIDIA mogą generować alerty po zbliżeniu się do progów, umożliwiając proaktywne utrzymanie.
  • Marginesowanie Połączeń: Użyj możliwości dostrajania DSP do przeprowadzania testów marginesowania połączeń podczas instalacji i jako części kwartalnych kontroli stanu. MMA4Z00-NS obsługuje dostosowania wyrównania na żądanie za pomocą oprogramowania układowego, które może kompensować stopniowe starzenie się światłowodu lub degradację złączy.
  • Izolacja Błędów: Jeśli połączenie doświadcza wysokiego BER lub zdarzeń utraty sygnału, dane DDM z obu końców połączenia powinny być porównane. Typowe tryby awarii obejmują brudne/zanieczyszczone złącza MPO (czyścić za pomocą czyścików typu kartridżowego), nadmierne straty z powodu zagięcia (sprawdzić fizyczne prowadzenie) lub degradację nadajnika (sprawdzić trendy prądu polaryzacji i mocy optycznej).
  • Aktualizacje Oprogramowania Układowego: NVIDIA okresowo wydaje aktualizacje oprogramowania układowego, które mogą poprawić algorytmy wyrównania i zwiększyć kompatybilność. Upewnij się, że wszystkie jednostki MMA4Z00-NS mają najnowszą wersję oprogramowania układowego zgodnie z zaleceniami producenta.

W celu optymalizacji wydajności, architektura zaleca wykonanie bazowego skanowania wszystkich połączeń w trybach 800G i 2×400G, rejestrując statystyki mocy optycznej i BER. Ta baza służy jako punkt odniesienia dla przyszłego rozwiązywania problemów i planowania pojemności. Ponadto, MMA4Z00-NS dostępny w sprzedaży poprzez znormalizowaną globalną dystrybucję zapewnia szybkie pozyskanie jednostek zapasowych, minimalizując przestoje w przypadku awarii.

6. Podsumowanie i Ocena Wartości

NVIDIA Mellanox MMA4Z00-NS stanowi przekonujące, zunifikowane rozwiązanie optyczne dla nowoczesnych centrów danych AI, które muszą równoważyć wysoką przepustowość z różnymi odległościami fizycznymi. Standaryzując jeden typ transceivera dla połączeń wewnątrz-raku i między-pomieszczeniami, architektura zmniejsza złożoność zapasów, usprawnia procesy kwalifikacyjne i upraszcza konserwację, jednocześnie wykorzystując zaawansowane możliwości DSP i optyczne modułu do rozszerzenia zasięgu poza tradycyjne limity SR8.

Kluczowe wyniki wartości:

  • Uproszczenie Zapasy: Jeden SKU zastępuje wiele typów transceiverów, zmniejszając koszty utrzymania zapasów o szacunkowo 60%.
  • Efektywność Kosztowa: Infrastruktura światłowodowa wielomodowa jest znacznie tańsza niż infrastruktura jednomodowa, a cena MMA4Z00-NS za port jest znacznie niższa niż równoważnych alternatyw DR8/FR8.
  • Elastyczność Gotowa na Przyszłość: Tryb podziału 2×400G zapewnia ścieżkę migracji dla środowisk, które nie są jeszcze w pełni gotowe na 800G, podczas gdy tryb 800G obsługuje dzisiejsze klastry GPU nowej generacji.
  • Odporność Operacyjna: Solidne DDM, proaktywne alerty i parametry DSP z możliwością dostrajania w terenie zapewniają, że połączenia pozostają w specyfikacji przez cały okres ich eksploatacji.

Dla architektów sieci, inżynierów rozwiązań i zespołów operacyjnych, MMA4Z00-NS stanowi praktyczny, wysokowydajny i opłacalny kamień węgielny do budowy skalowalnych sieci AI, które mogą obejmować szafy i pomieszczenia bez kompromisów. Kompleksowa karta katalogowa MMA4Z00-NS i wspierająca dokumentacja techniczna są dostępne w celu ułatwienia planowania integracji i walidacji wdrożenia.