NVIDIA Mellanox MCX653106A-HDAT w Akcji: Transport RDMA/RoCE o Niskich Opóźnieniach i Optymalizacja Przepustowości Serwera

July 30, 2026

najnowsze wiadomości o firmie NVIDIA Mellanox MCX653106A-HDAT w Akcji: Transport RDMA/RoCE o Niskich Opóźnieniach i Optymalizacja Przepustowości Serwera
NVIDIA Mellanox MCX653106A-HDAT w akcji: RDMA/RoCE Transport niskiego opóźnienia i optymalizacja przepustowości serwera
Temat i wyzwania: wąski gardło sieci dostawcy chmury hiperskałowej

A major hyperscale cloud provider operating a 256-node cluster for distributed AI training and real-time analytics began experiencing severe network performance degradation as their infrastructure scaledIstniejąca tkanina oparta na 25GbE TCP/IP wykazywała opóźnienia All-Reduce przekraczające 6 milisekund w 128 węzłach,podczas gdy wykorzystanie procesora do przetwarzania sieci pochłaniało ponad 40% mocy obliczeniowej każdego serweraTen wąski gardło ograniczyło wykorzystanie GPU do zaledwie 55%, znacząco przedłużając cykle szkoleniowe i zmniejszając zdolność generowania przychodów.Zespół potrzebował rozwiązania, które mogłoby zapewnić zarówno mikrosekundowe opóźnienie, jak i ogromną szerokość pasma, zapewniając jednocześnie programowalność potrzebną do optymalizacji ruchu specyficznego dla obciążenia.

Rozwiązanie i wdrożenie: Transformacja tkaniny za pomocą MCX653106A-HDAT

Po przeprowadzeniu szczegółowej oceny technicznej dostawca wybrałNVIDIA Mellanox MCX653106A-HDATKażdy węzeł serwera został wyposażony wMCX653106A-HDAT ConnectX adapter PCIe karta sieciowa, skonfigurowane z podwójnym portem 100GbE, zapewniającym 200 Gb/s łącznej przepustowości na węzeł.

  • Faza 1 Pilot (8 węzłów):Zespół zainstalowałKarta adaptera MCX653106A-HDAT EthernetNa podzbiorze serwerów GPU, konfigurowanie RoCEv2 z PFC i ECN w celu ustanowienia bezstratnej tkanki Ethernet.
  • Faza 2 Validacja i dostosowanie:Zastosowanie danych telemetrycznych udokumentowanych wArkusz danych MCX653106A-HDAT, zespół zatwierdził konfigurację, dopracował parametry DCB i zoptymalizował ustawienia komunikacji zbiorowej NCCL.Zaawansowane funkcje programowalności adaptera umożliwiły niestandardowe sterowanie ruchem dla specyficznych wzorców całkowitego obciążenia.
  • Faza 3 Po pomyślnej walidacji cały klaster został przeniesiony na nowy adapter.Kompatybilny z MCX653106A-HDATcharakter rozwiązania zapewniał bezproblemową integrację z istniejącymi serwerami i dystrybucjami Linux.
  • Faza 4 Optymalizacja ciągła:Zespół wykorzystał telemetrię w linii adaptera i programowalną ścieżkę danych do wdrożenia polityk routingu świadomych obciążenia roboczego, dodatkowo optymalizując wydajność dla zadań szkoleniowych sztucznej inteligencji.

Zespół zauważył, żeRozwiązanie karty adaptera MCX653106A-HDAT Ethernetzapewnił prostą ścieżkę migracji, ponieważ porty QSFP56 obsługiwały zarówno optyki 100GbE, jak i 25GbE, umożliwiając płynne przejście bez zakłócania istniejącej łączności.

Wyniki i korzyści: mierzalna transformacja wydajności i wydajności
Metryczny Wstępna aktualizacja (25GbE TCP/IP) Po uaktualnieniu (MCX653106A-HDAT z RoCE) Poprawa
Wszystkie zmniejszenie opóźnienia (256 węzłów) 60,8 ms 0.22 ms 30.9* zmniejszenie
Wykorzystanie procesora sieciowego (na węzeł) 43% 5% 38 pp odzyskane
Wykorzystanie GPU (faza szkolenia) 55% 93% +38% wzrost
Wydajność szkolenia klastra 2.1x wartość wyjściowa 6.4x wartość wyjściowa 3.0* wzrost

Oprócz tych ilościowych zysków dostawca odnotował znaczne korzyści operacyjne.drastyczne przyspieszenie czasu wprowadzania nowych usług sztucznej inteligencji na rynekProgramująca się ścieżka danych adaptera umożliwiała dostosowanie ruchu do priorytetowych przepływów, zapewniając, że krytyczny ruch komunikacji zbiorowej nigdy nie doświadcza sporu.Dla organizacji oceniających zwrot z inwestycji,Cena MCX653106A-HDATZespół zauważył również, że w przypadku większej liczby serwerów, niż w przypadku większej liczby serwerów, w przypadku większej liczby serwerów, niż w przypadku większej liczby serwerów, w przypadku większej liczby serwerów, niż w przypadku większej liczby serwerów.MCX653106A-HDAT na sprzedażZestawy z przełącznikami NVIDIA Spectrum-4 oferowały najkorzystniejsze ekonomiczne rozwiązania do rozmieszczenia na dużą skalę.

Dostawca wykorzystał również kompleksowe możliwości telemetrii szczegółowo opisane wSpecyfikacje MCX653106A-HDATtworzenie modelowych modeli wydajności i zautomatyzowanych strategii ograniczania zatłoczenia, zwiększając w ten sposób skuteczność operacyjną.

Podsumowanie i perspektywy: Fundacja infrastruktury sztucznej inteligencji w hiperskali

Wdrożenie w skali produkcyjnej pokazuje, żeNVIDIA Mellanox MCX653106A-HDATjest transformatywnym elementem nowoczesnej infrastruktury AI i chmury.i kompleksowe obciążenia sprzętowe umożliwiają niemal liniowe skalowanie dla obciążeń pracy przyspieszonych przez GPU/ Jako koniec do końcaRozwiązanie karty adaptera MCX653106A-HDAT Ethernet, eliminuje wąski gardło sieci, które historycznie ograniczało efektywność rozproszonego szkolenia i dostarczanie usług w chmurze.

Patrząc w przyszłość,dostawca chmury bada rozszerzoną integrację z NVIDIA DOCA w celu wdrożenia dodatkowej programowalności ścieżek danych w celu optymalizacji specyficznej obciążenia pracy w wielu środowiskach najemcówWykorzystują również telemetrię wewnętrzną adaptera, szeroko udokumentowaną wArkusz danych MCX653106A-HDAT opracowanie nowej generacji zautomatyzowanych systemów zarządzania wydajnością.NVIDIA Mellanox MCX653106A-HDATstał się podstawą ich planu działania w zakresie infrastruktury sztucznej inteligencji, zapewniając solidną, skalowalną platformę dla następnej generacji szkoleń w zakresie modeli podstaw i usług analitycznych w czasie rzeczywistym.