NVIDIA Mellanox MCX653105A-HDAT w akcji: RDMA/RoCE Transport niskiego opóźnienia i optymalizacja przepustowości serwera

July 29, 2026

najnowsze wiadomości o firmie NVIDIA Mellanox MCX653105A-HDAT w akcji: RDMA/RoCE Transport niskiego opóźnienia i optymalizacja przepustowości serwera

NVIDIA Mellanox MCX653105A-HDAT w akcji: RDMA/RoCE Transport niskiego opóźnienia i optymalizacja przepustowości serwera

Temat i wyzwania: wąski gardło sieci w klastrze AI/HPC

Duże przedsiębiorstwo technologiczne niedawno wdrożyło klaster z przyspieszeniem GPU o 128 węzłów do szkolenia wielkich modeli językowych (LLM),z każdym węzłem wyposażonym w osiem NVIDIA H100 GPU i wysokiej wydajności pamięci masowej NVMeJednak po skalowaniu poza 32 węzły, klaster doświadczył dramatycznego pogorszenia wydajności.Podczas gdy stack sieciowy TCP/IP zużył ponad 45% zasobów procesora na węzełSieć zbudowana na wielu połączeniach 25GbE stała się głównym wąskim gardłem, poważnie ograniczając wykorzystanie GPU i przedłużając cykle szkoleniowe znacznie poza dopuszczalne ramy czasowe.Zespół pilnie potrzebował rozwiązania zdolnego do zapewnienia zarówno ultra niskiego opóźnienia, jak i ogromnej przepustowości przy jednoczesnym obniżeniu obciążenia procesorami sieciowymi..

Rozwiązanie i wdrożenie: Transformacja tkaniny za pomocą MCX653105A-HDAT

Po wyczerpującej ocenie technicznej zespół wybrałNVIDIA Mellanox MCX653105A-HDATKażdy węzeł GPU był wyposażony wKarta sieciowa PCIe MCX653105A-HDAT ConnectX adapter, skonfigurowane z podwójnym portem 100GbE zapewniającym 200 Gb/s łącznej przepustowości na serwer.

Wdrożenie zostało przeprowadzone w czterech ustrukturyzowanych etapach:

  • Faza 1 Każdy serwer otrzymałKarta adaptera MCX653105A-HDAT Ethernet, z obydwoma portami QSFP28 podłączonymi do podwójnych redundantnych przełączników liści NVIDIA Spectrum-4.
  • Faza 2 RoCEv2 Konfiguracja:Zespół umożliwił RoCEv2 w całej tkance, starannie dostosowując parametry Priority Flow Control (PFC) i Explicit Congestion Notification (ECN), aby ustanowić bezstratne środowisko Ethernet.Zaawansowane funkcje zarządzania zatłoczeniami są szczegółowo opisane wArkusz danych MCX653105A-HDATbyły kluczowe dla osiągnięcia optymalnego przydziału buforu.
  • Faza 3 Optymalizacja NCCL:NVIDIA Collective Communications Library (NCCL) została skonfigurowana w celu wykorzystania możliwości RDMA adaptera,z niestandardowymi regułami sterowania ruchem zaprogramowanymi w wbudowanych silnikach przetwarzania adaptera w celu optymalizacji dla specyficznych wzorców całkowitego redukcji i całkowitego gromadzenia obciążenia pracy LLM.
  • Etap 4 Validacja i dopracowanie:Wykorzystując dane telemetryczne uzyskane przezSpecyfikacje MCX653105A-HDAT, zespół zwalidował konfigurację, dopasował ustawienia moderacji przerwy i ustanowił metryki wyników podstawowych do ciągłego monitorowania.

W szczególności, adapter okazał się byćKompatybilny z MCX653105A-HDATz istniejącą infrastrukturą kablowania, ponieważ porty QSFP28 obsługiwały zarówno optyki 100GbE, jak i 25GbE, umożliwiając zgrabną migrację bez zakłócającej wymiany kabli.Zespół wykorzystał również możliwości wielo-głośników adaptera, aby obsłużyć zarówno obliczenia, jak i funkcje pamięci masowej na tym samym porcie fizycznym..

Wyniki i korzyści: wymierne zyski w wydajności szkoleniowej

Poprawa wynikówNVIDIA Mellanox MCX653105A-HDATNajważniejsze wskaźniki wydajności przed i po aktualizacji są podsumowane poniżej:

Metryczny Wstępna aktualizacja (25GbE TCP/IP) Po modernizacji (MCX653105A-HDAT z RoCE) Poprawa
All-Reduce Latency (128 węzłów) 9.2 ms 0.28 ms 32.8x zmniejszenie
Wykorzystanie procesora sieciowego (na węzeł) 47% 6% 41 pp odzyskane
Wykorzystanie GPU (faza szkolenia) 58% 94% +36% wzrost
Wydajność szkolenia klastra 10,9x wartość wyjściowa 50,7x wartość wyjściowa 3x wzrost

Oprócz tych ilościowych osiągnięć zespół odnotował znaczące korzyści operacyjne.dramatycznie przyspieszające cykle iteracji modeluProgramująca się ścieżka danych adaptera umożliwiała dostosowanie ruchu do priorytetowych przepływów, zapewniając, że krytyczny ruch komunikacji zbiorowej nigdy nie doświadcza sporu.Dla organizacji oceniających zwrot z inwestycji,Cena MCX653105A-HDATZespół zauważył, że zwiększenie przepustowości 3x i możliwość odroczenia dodatkowych nabyć serwerów GPU o co najmniej 12 miesięcy.MCX653105A-HDAT na sprzedażZestawy z przełącznikami NVIDIA Spectrum-4 oferowały najbardziej korzystne ekonomicznie dla wdrożenia pełnego klastra.

Podsumowanie i perspektywy: Fundacja dla infrastruktury sztucznej inteligencji nowej generacji

Wdrażanie tego rozwiązania na skalę produkcyjną potwierdza, żeNVIDIA Mellanox MCX653105A-HDATjest elementem przekształcającym nowoczesne klastry AI i HPC. Połączenie 200 Gb/s łącznej szerokości pasma, zbiorowego opóźnienia komunikacji poniżej 0,3 milisekundy,Zapewnia to organizacjom możliwość osiągnięcia niemal liniowej skalowalności dla obciążeń pracy przyspieszonych przez GPU./ Jako koniec do końcaRozwiązanie karty adaptera MCX653105A-HDAT Ethernet, eliminuje wąski gardło sieci, które historycznie ograniczało efektywność rozproszonego szkolenia.

W przyszłości przedsiębiorstwo bada integrację z NVIDIA DOCA w celu wdrożenia dodatkowej programowalności ścieżek danych w celu optymalizacji specyficznej obciążenia.Wykorzystują one również zaawansowaną telemetrię adaptera, szeroko udokumentowaną wArkusz danych MCX653105A-HDAT stworzenie modeli prognozowania wydajności i zautomatyzowanych strategii ograniczania zatłoczenia.NVIDIA Mellanox MCX653105A-HDATstał się kamieniem węgielnym ich mapy drogowej infrastruktury sztucznej inteligencji, zapewniając solidną, skalowalną podstawę dla następnej generacji rozwoju i wdrażania modelu fundacji.