NVIDIA Mellanox 920-9B210-00FN-0D0 w praktyce: Budowanie niskolatencyjnej sieci NDR dla klastrów AI z bilionami parametrów
August 26, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 w praktyce: Budowanie tkaniny NDR o niskim opóźnieniu dla klastrów sztucznej inteligencji o parametrach bilionów
Temat i wyzwanie: Kiedy HDR spełnia modele z bilionami parametrów
Wiodąca organizacja badawcza sztucznej inteligencji niedawno skalowała swój duży klaster szkoleniowy dla modeli językowych z 1024 do 4096 GPU NVIDIA H100, mając na celu skompresję harmonogramu szkolenia do 1.8-trilionowy model rzadkości MoE (mieszanka ekspertów) od miesięcy do poniżej dwóch tygodniJednakże podczas wstępnej walidacji zespół zaobserwował poważne zatłoczenie w fazie komunikacji all-to-all na istniejącej tkance HDR o prędkości 200 Gb/s.W związku z tym wykorzystanie procesora GPU spadło z oczekiwanych 85% do zaledwie 52% o wiele poniżej progu wymaganego do osiągnięcia ambitnego terminu szkolenia..
Analiza sieci wykazała, że operacje zbiorowe "wszystko do wszystkich", które są nieodłącznie związane z architekturami MoE,Wykorzystując systemy HDR, które zasycają linki HDR i uruchamiają mechanizmy kontroli zatłoczenia, które dodatkowo zwiększają opóźnienie.Organizacja potrzebowała tkaniny, która mogła dostarczyć deterministyczne,opóźnienie poniżej mikrosekundy w tysiącach punktów końcowych, zapewniając jednocześnie przepustowość przepustową do absorpcji wybuchów ruchu bez załamania wydajnościTo właśnie wyzwanie, z którym boryka sięNVIDIA Mellanox 920-9B210-00FN-0D0został zaprojektowany w celu rozwiązania problemu.
Rozwiązanie i wdrażanie: tkanina NDR 400Gb/s dla sztucznej inteligencji ekzaskalowej
Organizacja wdrożyła920-9B210-00FN-0D0 InfiniBand Switch OPNNa warstwie liści każdy stojak otrzymał dwa920-9B210-00FN-0D0 MQM9790-NS2Fprzełączniki, zapewniające 128 portów 400 Gb/s łączności do 64 serwerów H100 z dwoma portami na rack za pośrednictwem aktywnych kabelów optycznych OSFP-OSFP.16 dodatkowych przełączników 920-9B210-00FN-0D0 połączonych ze sobą, tworząc nieblokowane drzewo tłuszczowe o pełnej szerokości pasma biesekcji wynoszącej 51,2 Tb/s na warstwę kręgosłupa.
To, co czyniło to rozwiązanie szczególnie atrakcyjnym, to zintegrowana technologia SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol).łączność "wszystko do wszystkich" została wyładowana bezpośrednio na przełącznik., z przełącznikami wykonującymi redukcję i redystrybucję danych w sieci.drastyczne zmniejszenie kosztów komunikacji, które dotyczyły poprzedniego wdrożenia HDR.
Zgodnie zArtykuł 920-9B210-00FN-0D0, przełącznik zapewnia opóźnienie przekraczania poniżej 100 ns, co zostało zweryfikowane podczas fazy dowodu koncepcji.920-9B210-00FN-0D0 zgodnyW tym celu firma opracowała system, w którym wszystkie optyki i kable OSFP zostały już zakwalifikowane, co eliminowało opóźnienia w udzielaniu zamówień.Specyfikacje 920-9B210-00FN-0D0W tym podwójnie nadmierne źródła zasilania i wentylatory do wymiany na gorąco dały zespołowi pewność, że osiągnie cel 99,999% dostępności dla klastra produkcyjnego.
Wyniki i wymierne korzyści: od wąskiego gardła do umożliwiającego
Po wdrożeniu pełnej struktury NDR i ponownym rozpoczęciu szkolenia w Ministerstwie Edukacji, organizacja mierzyła transformacyjne ulepszenia w wielu wymiarach:
- Odzyskanie wykorzystania GPU:Średnie wykorzystanie GPU wzrosło z 52% do 89%, a maksymalne wykorzystanie osiągnęło 94% w fazach o wysokiej intensywności obliczeniowej, co jest bezpośrednim wynikiem wyeliminowania blokad wywołanych przez sieć.
- Zmniejszenie czasu opóźnienia:Czas potrzebny na pełną wymianę wszystkich na 4,096 procesorów graficznych spadł z 180 ms do poniżej 45 ms, co oznacza 75% poprawę, która bezpośrednio przekłada się na szybsze iteracje szkoleniowe.
- Czas zakończenia pracy:Przewidywany termin szkolenia dla modelu 1.8T MoE został skrócony z 14 dni do zaledwie 9 dni - przyspieszenie o 36%, co znacząco skróciło zarówno czas wprowadzania na rynek, jak i koszty obliczeń w chmurze.
- Efektywność operacyjna:Przy 64 portach na przełącznik liczba wymaganych przełączników kręgosłupa została zmniejszona o 37% w porównaniu z 40-portem HDR, uproszczając okablowanie i zmniejszając zużycie energii na stojak o 28%.
Z punktu widzenia całkowitego kosztu własności, zespół finansowy organizacji zauważył, że podczas gdy920-9B210-00FN-0D0 cenaW wyniku zastosowania nowej technologii, w której koszty sieciowania na procesor HDR były wyższe niż w przypadku alternatywy HDR, koszty sieciowania na procesor GPU faktycznie spadły ze względu na wyższy radix i zmniejszoną liczbę warstw przełącznikowych.w połączeniu z dramatycznym wzrostem wydajności, sprawiło, że modernizacja NDR była wyraźnym sukcesem biznesowym.920-9B210-00FN-0D0 Rozwiązanie InfiniBand Switch OPNZintegrowane z istniejącym systemem NVIDIA UFM, zapewniając scentralizowaną widoczność i automatyczne ostrzeganie, które zmniejszyło koszty operacyjne o 40%.
Podsumowanie i perspektywy: Fundacja NDR dla sztucznej inteligencji nowej generacji
W sprawieNVIDIA Mellanox 920-9B210-00FN-0D0okazało się być transformacyjne rozwiązanie tej AI organizacji badawczej potrzebne do uwolnienia pełnego potencjału jego 4,096-GPU H100 klastra.i SHARPv3 w sieci komputerowej, przełączenie umożliwiło im skalowanie z 1024 do 4096 procesorów graficznych bez naruszania wydajności lub możliwości zarządzania - osiąg, który byłby niemożliwy z poprzednią infrastrukturą HDR.
Z perspektywy przyszłości, organizacja planuje rozszerzyć do 8192 GPU w ciągu najbliższych 18 miesięcy, wykorzystując920-9B210-00FN-0D0 do sprzedażydla organizacji oceniających inwestycje w sieci sztucznej inteligencji i HPC nowej generacji,920-9B210-00FN-0D0 oferuje sprawdzone, gotowe do produkcji rozwiązanie, które spełnia obietnicę optymalizacji połączeń RDMA o niskim opóźnieniu w skali egz.

