NVIDIA Mellanox 920-9B110-00FH-0D0 w praktyce: optymalizacja tkanin RDMA o niskim opóźnieniu dla klastrów HPC i AI
August 25, 2026
NVIDIA Mellanox 920-9B110-00FH-0D0 w praktyce: optymalizacja tkanin RDMA o niskim opóźnieniu dla klastrów HPC i AI
Temat i wyzwanie: Kiedy wydajność HDR spełnia rzeczywistość budżetową
Średnie laboratorium badawcze AI niedawno stanęło przed znanym wyzwaniem: ich istniejąca tkanina EDR InfiniBand 100Gb/s stawała się wąskim gardłem dla rozwijającego się klastra GPU,który wzrósł z 128 do 512 węzłów NVIDIA A100Czasy szkolenia dla dużych modeli transformatorów zwiększyły się o ponad 40% z powodu zatłoczenia sieci podczas całkowitych operacji redukcyjnych.i zespół potrzebował aktualizacji, która mogłaby zapewnić znaczne zyski wydajności bez wydatków kapitałowych wymaganych do pełnego wdrożenia NDR 400Gb/s.
Laboratorium oceniło kilka opcji i określiło 200Gb/s HDR jako idealną równowagę między wydajnością a kosztami.zaawansowane sterowanie zatłoczeniami, a także bezproblemowej integracji z istniejącymi kablami i nadajnikami kompatybilnymi z HDR.NVIDIA Mellanox 920-9B110-00FH-0D0Wprowadzono przełącznik specjalnie zaprojektowany dla środowisk, w których HDR zapewnia dużą przepustowość bez nadmiernego zaopatrzenia.
Rozwiązanie i wdrożenie: optymalizowana kosztowo tkanina HDR
Laboratorium wdrożyło920-9B110-00FH-0D0 InfiniBand Switch OPNKażdy rack obliczeniowy otrzymał jeden przełącznik oparty na MQM8790-HS2F, czyli platformę krzemową leżącą u podstaw urządzenia.920-9B110-00FH-0D0 MQM8790-HS2F¢zapewnienie 40 portów o łączności 200Gb/s do serwerów GPU za pośrednictwem kabli bezpośredniego podłączenia OSFP-OSFP.tworzenie nieblokowanej tkaniny tłuszczowej z pełną szerokością pasma biesekcji.
To, co uczyniło to wdrożenie szczególnie skutecznym, to zintegrowana technologia SHARPv2 (Scalable Hierarchical Aggregation and Reduction Protocol),które bezpośrednio wyładowały operacje łączności zbiorowej na tkankę przełącznikaW praktyce oznaczało to, że operacje całkowitego redukcji, które wcześniej zużywały znaczne cykle procesora hosta i szerokość pasma sieci,W tym celu należy zwrócić uwagę na to, że w wielu przypadkach procesy wykonywania pracy są wykonywane w jednym przejściu przez całą tkaninę..
Zgodnie zArtykuł 920-9B110-00FH-0D0, przełącznik zapewnia opóźnienie przekraczania poniżej 200ns, które ściśle odpowiada wymaganiom wydajności laboratorium.920-9B110-00FH-0D0 zgodnyW tym celu system obejmował wszystkie typy kabli i optyki, które już były standaryzowane, eliminując konieczność kosztownych wysiłków w zakresie ponownego okablowania.
Wyniki i wymierne korzyści: od wąskiego gardła do umożliwiającego
Po wdrożeniu laboratorium mierzyło poprawę w kilku kluczowych wymiarach:
- Zmniejszenie czasu zakończenia pracy:Iteracje treningowe dla modelu 13B-parametru zmniejszyły się o 35%, a całkowita redukcja opóźnienia spadła z 12 μs do poniżej 5 μs dla typowych wielkości zbiorowych.
- Użycie sieci:Średnie wykorzystanie tkaniny wzrosło z 58% do 83% bez wywołania zatłoczenia, dzięki adaptacyjnym mechanizmom kierowania i kontroli zatłoczenia.
- Wydajność energetyczna i chłodzenia:W porównaniu z poprzednią tkaniną EDR, nowa infrastruktura HDR zmniejszyła zużycie energii w porcie o 30%, co pozwoliło laboratorium dodać więcej węzłów obliczeniowych bez przekraczania budżetu energii centrum danych.
Z punktu widzenia całkowitego kosztu własności920-9B110-00FH-0D0 cenaW związku z powyższym, wyniki badań w ramach programu NDR były znacznie niższe niż w przypadku alternatyw NDR, co umożliwiło laboratorium modernizację całej struktury w ramach istniejącego budżetu.Specyfikacje 920-9B110-00FH-0D0Podkreślił również podwójne nadmierne zasilanie i moduły wentylatorów do wymiany na gorąco, które przyczyniły się do osiągnięcia celu laboratorium w zakresie 99,999% dostępności do prac szkoleniowych w produkcji.
Inżynierowie sieci zauważyli, że920-9B110-00FH-0D0 Rozwiązanie InfiniBand Switch OPNZintegrowany z Unified Fabric Manager (UFM) firmy NVIDIA, zapewniając scentralizowaną widoczność stanu tkaniny i automatyczne ostrzeganie.Znacząco zmniejszyło to czas poświęcony na rozwiązywanie problemów i proaktywną konserwację, co pozwala zespołowi skupić się na optymalizacji swoich szkoleń, a nie zarządzaniu siecią.
Podsumowanie i perspektywy: Prawidłowa Fundacja HDR
W sprawieNVIDIA Mellanox 920-9B110-00FH-0D0okazał się być właściwym wyborem dla tego laboratorium badawczego, dostarczając wydajność HDR 200Gb/s przy strukturze kosztów, która miała sens biznesowy.możliwości obliczeniowe w sieci, i solidne funkcje zarządzania, laboratorium przekształciło swoją sieć z wąskiego gardła wydajności w skalowalną podstawę przyszłego wzrostu.
W przyszłości, laboratorium planuje skalować swój klaster do 1024 węzłów w ciągu najbliższych 18 miesięcy.mają pewność, że ich sieć może rosnąć wraz z ich zdolności obliczeniowychW przypadku organizacji oceniających opcje infrastruktury HDR,920-9B110-00FH-0D0 do sprzedażyDzięki partnerom kanałowym NVIDIA oferuje przekonujące, sprawdzone w produkcji rozwiązanie, które zrównoważa wydajność, gęstość i koszty.

