RDMA/RoCE Transport o niskiej opóźnieniu i usprawnienie przepustowości serwera
April 28, 2026
W tym dokumencie technicznym architekci, inżynierowie przedsprzedażowi i kierownictwo operacyjne otrzymują kompleksowy projekt odniesienia oparty naNVIDIA Mellanox MCX631432AN-ADABRozwiązanie rozwiązuje nowoczesne wyzwania związane z centrami danych, a mianowicie koszty CPU związane ze starymi stackami sieciowymi, niespójne opóźnienie pamięci masowej i niewykorzystana przepustowość 25GbEKarta adaptera Ethernet MCX631432AN-ADABjako kamień węgielny wysokowydajnej, zbieżnej tkaniny RDMA/RoCE.
1. Analiza tła i wymagań projektu
Konwencjonalne sieci centrów danych opierają się na TCP/IP zarówno dla ruchu obliczeniowego, jak i pamięci masowej, zmuszając procesor do przetwarzania każdego pakietu.NVMe-over-fabrics (NVMe-oF), lub obciążeń szkoleniowych AI, to oparte na oprogramowaniu podejście stwarza trzy podstawowe problemy: wysoki i zmienny opóźnienie (często przekraczające 50 μs w przypadku operacji przechowywania),znaczący podatek od procesorów (30-60% w przypadku przetwarzania sieci)Ponieważ 25GbE staje się standardową prędkością warstwy dostępu, nieefektywność ta nie jest już akceptowana.Wymagania docelowe dla tego rozwiązania to:: opóźnienie w przechowywaniu danych od końca do końca poniżej 5 μs, mniej niż 10% wykorzystania procesora do sieci I/O i pełne wykorzystanie dwustronnych portów 25GbE na serwer.
2Ogólne projektowanie architektury sieci/systemów
Zaproponowana architektura przyjmuje topologię dwustopniowego leaf-spine z bezstratnym Ethernetem na warstwie 2. Węzły obliczeniowe i pamięci masowej są równomiernie rozmieszczone między przełącznikami leaf,każdy z nich skonfigurowany z PFC (Priority Flow Control) i ECN (Explicit Congestion Notification) umożliwiającymi RoCEv2Kluczową decyzją architektoniczną jest wdrożenieMCX631432AN-ADAB ConnectX-6 Lx podwójny port 25GbE SFP28Dedykowany kolej priorytetowy oparty na DSCP jest przydzielany dla ruchu RoCE, oddzielony od ruchu IP najlepszego wysiłku.Centralne zarządzanie wykorzystuje NVIDIA's Cumulus Linux lub SONiC do konfiguracji przełącznika, podczas gdy orkiestracja po stronie hosta wykorzystuje NVIDIA OFED stack.
3. Rola i kluczowe cechy NVIDIA Mellanox MCX631432AN-ADAB
W ramach tego rozwiązaniaMCX631432AN-ADABW przypadku serwerów komodytów, które są dostępne w systemie serwisowym, funkcjonuje jako kluczowy czynnik umożliwiający przekształcenie serwerów komodytów w węzły o niskim opóźnieniu i wysokiej przepustowości.Arkusz danych MCX631432AN-ADAB, adapter zawiera kilka zaawansowanych możliwości:
- Wyładowanie RDMA sprzętu:Maszyna pełnego stanu RoCEv2 w krzemu, eliminująca oprogramowanie przetwarzające transport.
- Dwóchport 25GbE SFP28:Wspiera zarówno aktywne okablowanie optyczne, jak i DAC, z niezależnym przetwarzaniem PPS na port.
- Interfejs PCIe 4.0 x16:Dostarcza do 200 Gbps dwukierunkowej przepustowości, nie pozostawiając wąskiego gardła między adapterem a pamięcią hosta.
- Wyładowanie szyfrowania w linii:Przetwarzanie IPsec i TLS z prędkością linii, krytyczne dla sieci pamięci masowej zero-trust.
- Przyspieszenie NVMe-oF:Oprogramowanie oparte na sprzęcie do tworzenia kolejek poleceń i umieszczania danych specjalnie zoptymalizowane dla NVMe/TCP i NVMe/RoCE.
Według urzędnikaSpecyfikacje MCX631432AN-ADABW połączeniu z biblioteką open-source RDMACM, adapter zapewnia opóźnienie sprzętowe poniżej 800ns i obsługuje do 200 milionów wiadomości na sekundę.Aplikacje mogą przechodzić z gniazd TCP na czasowniki RDMA z minimalnymi zmianami koduDla organizacji oceniających to rozwiązanie ważne jest, aby zauważyć, żeKompatybilny z MCX631432AN-ADABLista serwerów obejmuje wszystkie główne platformy OEM (Dell PowerEdge, HPE ProLiant, Lenovo ThinkSystem i Supermicro) z certyfikowanymi sterownikami dla RHEL, Ubuntu, Rocky Linux i Windows Server.
4. Zalecenia dotyczące wdrażania i skalowania
Typowe wdrożenie na poziomie racków następuje w ten sposób: każdy węzeł obliczeniowy lub pamięci masowej otrzymuje jedenRozwiązanie karty adaptera Ethernet MCX631432AN-ADAB, z podwójnymi portami skonfigurowanymi w aktywnym-aktywnym połączeniu LACP w celu redundancji lub jako oddzielne ścieżki tkanin (jedna do listy A, jedna do listy B).
- Każdy serwer → dwa łącza 25GbE → dwa oddzielne przełączniki liści (wspierające failover bez trafienia).
- Przełączniki liści → 100GbE uplinks → dwa przełączniki kręgosłupa dla pełnej siatki bez blokowania.
- Dedykowane oznakowanie DSCP (np. 46) dla ruchu RoCE we wszystkich przełącznikach z włączeniem PFC w danej klasie.
W przypadku skalowania powyżej 200 serwerów zalecamy rozmieszczenie oddzielnego klastra RoCE odpowiednio do przechowywania i obliczania lub użycie zasady QoS, aby zapewnić priorytetowe traktowanie przechowywania RoCE.Buffer dostosowanie w przełącznikach liści jest również krytyczneW przypadku portów 25GbE rozmiary współdzielonych buforów powinny wzrosnąć do 12MB, aby wchłonąć mikrowybuchy bez utraty pakietów.MCX631432AN-ADAB na sprzedażkatalogów sprzedawców w celu ustalenia cen objętościowych orazCena MCX631432AN-ADABwęzły zazwyczaj amortyzuje się w ciągu sześciu miesięcy ze względu na oszczędności CPU i zwiększenie wydajności pamięci masowej.
5. Operacje, monitorowanie i dostosowywanie wydajności
Po wdrożeniu następujące narzędzia i praktyki zapewniają trwałe niskie opóźnienie:
- Monitorowanie ze strony hosta:Użycie
mlx_perfa takżeetol -Sw celu śledzenia liczników RDMA w kolejce, retransmisji PCIe i znaków zatłoczenia RoCE. - Telemetria przełącznika:Włączenie histogramów monitorowania PFC i oznakowania ECN w celu wykrycia blokady linii przed jej wpływem na produkcję.
- Zalecenia dotyczące tuningu:Zestaw
irqrównoważeniew celu izolowania rdzeni procesora dla kolejek zakończenia RDMA; zwiększenie maksymalnego rozmiaru żądania odczytu PCIe do 4096 bajtów; wyłączenie ECN w kolejce najlepszego wysiłku w celu uniknięcia fałszywych sygnałów zatłoczenia. - Cykl życia oprogramowania stałego i sterownika:Podpisz się na NVIDIA OFED notatki o wydaniu;Karta adaptera Ethernet MCX631432AN-ADABobsługuje aktualizację oprogramowania stacjonarnego bez ponownego uruchamiania hosta z powodu podwójnych banków obrazów.
W celu rozwiązywania problemów wbudowane w adapter liczniki błędów (np. błędy symboli, awarie lokalnej integralności łącza) zapewniają szybką diagnozę.Kompatybilny z MCX631432AN-ADABmacierzy interoperacyjności utrzymywanej przez NVIDIA.
6Podsumowanie i ocena wartości
W sprawieNVIDIA Mellanox MCX631432AN-ADAB- oparte rozwiązanie zapewnia wymierną wartość w trzech wymiarach: wydajność, koszty całkowitego użytkowania i prostotę operacyjną.przetwarzanie protokołów pamięci masowej i pamięci masowej z procesora do adaptera, organizacje osiągają opóźnienie NVMe-oF poniżej 5 μs, uwalniając jednocześnie ponad 40% cykli procesora do logiki aplikacji.i dojrzały NVIDIA OFED stos oprogramowania zmniejsza ryzyko integracjiW przypadku architektów planujących wdrożenie 25GbE na zielonym polu lub modernizację istniejącej infrastruktury TCP, to rozwiązanie techniczneMCX631432AN-ADAB ConnectX-6 Lx podwójny port 25GbE SFP28przedstawia sprawdzoną, skalowalną i zabezpieczoną inwestycjami drogę do sukcesu RDMA/RoCE.

