NVIDIA Mellanox 920-9B210-00FN-0D0 w praktyce: Budowanie niskolatencyjnej sieci NDR dla modeli MoE o bilionie parametrów
August 27, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 w praktyce: Budowa tkaniny NDR o niskim opóźnieniu dla modeli MoE o parametrze bilion
Temat i wyzwanie: Kiedy przeszkodą w szkoleniu staje się "wszystko dla wszystkich"
Wiodąca organizacja badawcza sztucznej inteligencji niedawno skalowała swój duży klaster szkoleniowy dla modeli językowych z 1024 na 4096 GPU NVIDIA H100, z ambitnym celem zmniejszenia czasu szkolenia dla 1.8-trilionowy model rzadkości MoE (mieszanka ekspertów) od miesięcy do poniżej dwóch tygodniJednakże, podczas wstępnej walidacji, the team discovered that their existing 200Gb/s HDR network was experiencing severe congestion during the all-to-all communication phase—a characteristic pattern of MoE architectures—causing GPU utilization to plummet from an expected 85% to just 52%, znacznie poniżej progu niezbędnego do dotrzymania terminu szkolenia.
Analiza sieci wykazała, że komunikacja zbiorowa "wszystko do wszystkich" stanowiła ponad 40% śladu komunikacyjnego modelu MOE, a wraz ze wzrostem liczby ekspertów,ruch stał się coraz bardziej rozdrobniony i rozbityIstniejąca sieć HDR, po uruchomieniu mechanizmów kontroli zatłoczenia, doświadczyła dramatycznego wzrostu czasu opóźnienia, pozostawiając znaczną część procesorów graficznych w stanie nieaktywności i oczekiwania.Organizacja pilnie potrzebowała tkanki sieciowej zdolnej do dostarczania deterministycznej opóźnienia poniżej mikrosekundy, transport bez strat i ogromna skalowalność bez blokowaniaNVIDIA Mellanox 920-9B210-00FN-0D0Został zaprojektowany właśnie dla tego wyzwania.
Rozwiązanie i wdrażanie: Optymalizowana dla MoE architektura NDR Leaf-Spine
Organizacja wdrożyła dwustopniowy tkaninę liści-kręgosłupa zbudowaną wokół920-9B210-00FN-0D0 InfiniBand Switch OPN. w każdym rack komputerowy, dwa920-9B210-00FN-0D0 MQM9790-NS2Fw warstwie liści, zapewniając łączność 400Gb/s do 64 serwerów H100 z dwoma portami za pośrednictwem aktywnych kabli optycznych OSFP-OSFP.16 dodatkowych przełączników 920-9B210-00FN-0D0 połączonych ze sobą, tworząc w pełni niezablokowaną tkaninę fat-tree o łącznej szerokości pasma biesekcji wynoszącej 51,2 Tb/s.
Głównym elementem tego rozwiązania jest zintegrowana technologia SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol).łączność "wszystko do wszystkich" została wyładowana bezpośrednio na przełącznik., z przełącznikami wykonującymi redukcję i redystrybucję danych w sieci.drastyczne zmniejszenie kosztów komunikacji, które dotyczyły poprzedniego wdrożenia HDR.Artykuł 920-9B210-00FN-0D0podkreśla opóźnienie pod 100 ns, które zostało zwalidowane podczas fazy dowodu koncepcji i okazało się kluczowe dla rygorystycznych wymogów dotyczących opóźnienia obciążenia roboczego MoE.
W sprawieSpecyfikacje 920-9B210-00FN-0D0z uwzględnieniem podwójnie nadmiernego zasilania i wentylatorów wymienialnych na gorąco zapewnił zespołowi pewność, że osiągnie cel 99,999% dostępności.920-9B210-00FN-0D0 zgodnyW tym celu system obejmował wszystkie optyki i kable OSFP, które zostały już zakwalifikowane, eliminując opóźnienia w zakupie i uproszczając harmonogram wdrożenia.
Wyniki i wymierne korzyści: od wąskiego gardła do umożliwiającego
Po pełnym wdrożeniu struktury NDR i ponownym uruchomieniu szkolenia w Ministerstwie Edukacji, organizacja mierzyła transformacyjne ulepszenia w wielu wymiarach:
- Odzyskanie wykorzystania GPU:Średnie wykorzystanie GPU wzrosło z 52% do 89%, a maksymalne wykorzystanie osiągnęło 94% w fazach o wysokiej intensywności obliczeniowej, co jest bezpośrednim wynikiem wyeliminowania blokad wywołanych przez sieć.
- Zmniejszenie czasu opóźnienia:Czas potrzebny na pełną wymianę wszystkich na 4,096 procesorów graficznych spadł z 180 ms do poniżej 45 ms, co oznacza 75% poprawę, która bezpośrednio przekłada się na szybsze iteracje szkoleniowe.
- Czas zakończenia pracy:Przewidywany termin szkolenia dla modelu 1.8T MoE został skrócony z 14 dni do zaledwie 9 dni - przyspieszenie o 36%, co znacząco skróciło zarówno czas wprowadzania na rynek, jak i koszty obliczeń w chmurze.
- Efektywność operacyjna:Przy 64 portach na przełącznik liczba wymaganych przełączników kręgosłupa została zmniejszona o 37% w porównaniu z 40-portem HDR, uproszczając okablowanie i zmniejszając zużycie energii na stojak o 28%.
Z punktu widzenia całkowitego kosztu własności, zespół finansowy organizacji zauważył, że podczas gdy920-9B210-00FN-0D0 cenaW przypadku, gdy koszty sieciowe na procesor HDR były wyższe niż w przypadku alternatyw HDR, koszty sieciowe na procesor GPU zmniejszyły się w rzeczywistości ze względu na wyższy radix i zmniejszoną liczbę warstw przełączników.w połączeniu z dramatycznym wzrostem wydajności, sprawiło, że modernizacja NDR była wyraźnym sukcesem biznesowym.920-9B210-00FN-0D0 Rozwiązanie InfiniBand Switch OPNZintegrowane z istniejącym systemem NVIDIA UFM, zapewniając scentralizowaną widoczność i automatyczne ostrzeganie, które zmniejszyło koszty operacyjne o 40%.
Podsumowanie i perspektywy: Fundacja NDR na rzecz nowej generacji obciążeń roboczych Ministerstwa Edukacji
W sprawieNVIDIA Mellanox 920-9B210-00FN-0D0okazało się być transformacyjne rozwiązanie tej AI organizacji badawczej potrzebne do uwolnienia pełnego potencjału jego 4,096-GPU H100 klastra.i SHARPv3 w sieci komputerowej, przełączenie umożliwiło im skalowanie z 1024 do 4096 procesorów graficznych bez naruszania wydajności lub możliwości zarządzania - osiąg, który byłby niemożliwy z poprzednią infrastrukturą HDR.
Z perspektywy przyszłości, organizacja planuje rozszerzyć do 8192 GPU w ciągu najbliższych 18 miesięcy, wykorzystując920-9B210-00FN-0D0 do sprzedażydla organizacji oceniających inwestycje w sieci sztucznej inteligencji i HPC nowej generacji,920-9B210-00FN-0D0 oferuje sprawdzone, gotowe do produkcji rozwiązanie, które spełnia obietnicę optymalizacji połączeń RDMA o niskim opóźnieniu w skali egz.

