Mellanox (NVIDIA Mellanox) 980-9I45J-00H010 Urządzenie sieciowe Rozwiązanie techniczne

July 17, 2026

Mellanox (NVIDIA Mellanox) 980-9I45J-00H010 Urządzenie sieciowe Rozwiązanie techniczne

Mellanox (NVIDIA Mellanox) 980-9I45J-00H010 Rozwiązanie techniczne urządzenia sieciowego.

1Analiza tła i wymagań projektu

W miarę jak cyfrowa transformacja przedsiębiorstw wchodzi w najgłębszą fazę, sieci centrów danych stają w obliczu bezprecedensowej presji wydajności i złożoności operacyjnej.Powszechne wykorzystanie klastrów szkoleniowych w zakresie sztucznej inteligencji, wysokiej wydajności baz danych, rozproszonego pamięci masowej i architektury mikroserwisów ujawniła ograniczenia tradycyjnych trójstopniowych topologii sieci pod względem przepustowości, opóźnienia,i zarządzalnośćW nowoczesnych centrach danych, w których ruch wschód-zachód stanowi ponad 75% całkowitej przepustowości, wąskie gardła sieci często stają się głównym ograniczeniem skalowalności biznesu.

Aby sprostać tym wyzwaniom, szeroko zakrojony zespół ds. infrastruktury internetowej określił jasne wymagania dotyczące modernizacji sieci: po pierwsze,osiągnięcie opóźnienia przełączania poniżej 10 mikrosekund w celu wspierania kontroli ryzyka w czasie rzeczywistym i systemów zaleceń online; po drugie, zbudowanie bezstratnego środowiska sieciowego, które utrzymuje zerową stratę pakietów dla ruchu RoCE nawet w scenariuszach zatłoczenia; i po trzecie,ustanowienie jednolitego ram obserwacyjności operacyjnej, które skraca czas lokalizacji usterek do poniżej 15 minut;Po kilku rundach oceny technicznej i walidacji POC zespół ostatecznie wybrałMellanox (NVIDIA Mellanox) 980-9I45J-00H010jako podstawowe urządzenie sieciowe do budowy nowej generacji sieci centrów danych, która zapewnia wysoką niezawodność i prostotę operacyjną.

2Ogólne projektowanie architektury sieci/systemów

Rozwiązanie to wykorzystuje dwuetapową architekturę Spine-Leaf, skupioną wokół980-9I45J-00H010, zaprojektowany w celu maksymalizacji przepustowości wschodu-zachodnia, jednocześnie uproszczając skomplikowanie trasy warstwy 3.980-9I45J-00H010Jednostki tworzące w pełni połączoną matrycę, podczas gdy warstwa Leaf łączy się z odpowiednimi przełącznikami ToR w oparciu o typy serwerów (przetwarzanie, pamięć masowa i przyspieszone przez GPU).Wszystkie linki Spine-Leaf są skonfigurowane na 100GbE lub 200GbE, wykorzystując ECMP do bilansowania obciążeń na poziomie przepływu. Architektura ta obsługuje również współistnienie sieci Overlay (VXLAN) i sieci Underlay,Ułatwienie płynnego rozwoju w kierunku wdrożeń hybrydowych wielobłęczy w przyszłości.

Na samolocie sterującym,rozwiązanie zaleca scentralizowany sterownik SDN pracujący w połączeniu z rozproszonymi protokołami BGP EVPN, aby umożliwić zautomatyzowaną dystrybucję zasad sieci i izolację najemcówW tym samym czasie, P4 programowalny rurociąg i silnik przyspieszenia przepływu wbudowany w980-9I45J-00H010rezerwacja dużej elastyczności dla przyszłych niestandardowych funkcji płaszczyzny danych, takich jak telemetria sieciowa w zakresie pasmowym.

3. Rola i kluczowe cechy "Mellanox (NVIDIA Mellanox) 980-9I45J-00H010" w rozwiązaniu

W ramach tej architekturyNVIDIA Mellanox 980-9I45J-00H010służy podwójnej roli rdzenia przełączania Spine i źródła zegara w całej sieci.

  • Ultra-niskie determiniowe opóźnienie:Wykorzystując przekierowywanie przecinkowe i dynamiczne planowanie buforu wyjściowego, urządzenie utrzymuje opóźnienie portu poniżej mikrosekundy nawet w 64-bajtówkach scenariuszy małych pakietów,zapewnienie deterministycznych gwarancji sieciowych dla handlu o wysokiej częstotliwości i wnioskowania AI w czasie rzeczywistym.
  • Inteligentna kontrola korków:Poprzez adaptacyjne algorytmy PFC (Priority Flow Control) i ECN (Explicit Congestion Notification) działające w połączeniu z pętlą zwrotną telemetryczną,980-9I45J-00H010 centrum danych sieć dużych prędkościmożliwość zapewnienia zerowej straty pakietów dla ruchu RoCEv2 we wszystkich warunkach obciążenia.
  • Projektowanie wysokiej dostępności i redundancji:Podwójnie redundantne zasilanie i wentylatory do wymiany na gorąco, redundantna architektura N+1 oraz ISSU (In-Service Software Upgrade) umożliwiają aktualizacje oprogramowania układowego i rozbudowy kart linii bez przerwy w obsłudze.
  • Głęboka programowalność:Support for P4 language and the Broadcom DNX family of programmable forwarding engines allows network architects to customize packet processing pipelines and introduce new protocol extensions without hardware replacement.
  • Kompleksowa telemetria i obserwacyjność:Wsparcie na poziomie sprzętowym dla telemetrii strumieniowej, w tym głębokości kolejki, wykorzystania buforu i pomiarów opóźnienia na przepływ,wprowadza bezpośrednio do istniejących stacków monitorowania organizacji Prometheus i ELK.

W połączeniu te cechy tworzą980-9I45J-00H010 produkt sieciowyurządzenie jest również w pełni kompatybilne z systemem sterowania prędkością.980-9I45J-00H010 zgodnyW celu zwiększenia efektywności technologii, które są dostępne w wielu krajach, należy zapewnić, aby systemy sieciowe, w tym systemy sieciowe, były dostępne dla wszystkich użytkowników.

4. Zalecenia dotyczące wdrażania i rozszerzania (w tym typowe opisy topologii)

W przypadku nowych wdrożeń Greenfield zalecamy rozpoczęcie od minimum czterech980-9I45J-00H010Każda jednostka Spine łączy się z każdym przełącznikiem Leaf za pośrednictwem dwóch lub czterech łączy 100GbE/200GbE, tworząc topologię pełnej siatki.Przełączniki liści powinny być grupowane w pods w oparciu o strefy funkcjonalne: podsługa obliczeniowa dla serwerów ogólnego przeznaczenia, podsługa pamięci masowej dla klastrów NVMe-oF i Ceph oraz podsługa akceleratora dla serwerów GPU obsługujących obciążenia szkoleniowe AI.Takie podejście do planowania strefy minimalizuje ruch między podłożami i upraszcza projektowanie polityki QoS.

W przypadku skalowania, dodatkowe980-9I45J-00H010urządzenie obsługuje porty do 128 x 100GbE na podwozie,zapewniając duże pole do wzrostuW przypadku środowisk brownfield,980-9I45J-00H010można wdrożyć jako poziom agregacji "super-spine" nad istniejącymi starszymi przełącznikami rdzeniowymi, stopniowo migrując ruch do nowej tkanki przy zachowaniu kompatybilności wstecznej.

Szczegółowe parametry wdrażania, w tym profile alokacji buforu, progi PFC i oznakowania ECN, powinny być określone wArkusz danych 980-9I45J-00H010, który zawiera kompleksowe wytyczne dotyczące dostrojenia urządzenia do specyficznych cech obciążenia pracą.Planowanie partii HPC, i replikacji bazy danych.

5. Zalecenia dotyczące monitorowania operacji, rozwiązywania problemów i optymalizacji

Aby w pełni wykorzystać możliwości operacyjne980-9I45J-00H010 rozwiązanie produktu sieciowego, zalecamy wdrożenie trzystopniowego systemu monitorowania:

  • Poziom 1 Widoczność w czasie rzeczywistymRozmieszczanie strumieniowych zbiorników telemetrycznych, które konsumują dane oparte na gRPC z urządzenia co 100 milisekund.Liczba klatek w przerwie PFCTe wskaźniki powinny być wizualizowane na niestandardowych pulpach grafańskich z automatyczną polityką ostrzegania.
  • Poziom 2  Proaktywna ocena stanu zdrowia:Zaplanuj codzienne automatyczne skrypty do zapytania o wewnętrzne dzienniki diagnostyczne urządzenia, czujniki temperatury i stan zasilania.Na przykład tendencja wzrostowa korekt FEC (Forward Error Correction), należy uruchomić karnet konserwacyjny, zanim ulegnie zaostrzeniu wydajności.
  • Poziom 3 ¢ Głębokie badania pakietów i analiza sądowa:Umożliwienie pobierania próbek w trybie sFlow lub IPFIX z konfigurowalnymi prędkościami w celu przechwytywania przepływów ruchu do analizy offline.Dane te można powiązać z dziennikami aplikacji w celu zidentyfikowania wzorców mikro-wybuchów lub problemów z hałasami sąsiadów, które mogą nie być widoczne tylko dzięki licznikom agregatów.

W celu rozwiązywania konkretnych problemów wbudowane w urządzenie możliwości przechwytywania i odzwierciedlania pakietów pozwalają operatorom na izolowanie problematycznych przepływów bez wpływu na ruch produkcyjny./Specyfikacje 980-9I45J-00H010zawierają szczegółowe krzywe wydajności dla różnych rozmiarów pakietów i wzorców mieszania, służące jako odniesienie odniesienia, z którym można porównać rzeczywistą wydajność.

Zalecenia dotyczące optymalizacji koncentrują się na dwóch obszarach: a) dopracowanie algorytmu hashingu ECMP w celu uniknięcia polaryzacji, zwłaszcza gdy przełączniki liści mają asymetryczną liczbę linków;oraz b) dostosowanie zegarków monitorujących PFC w celu zapobiegania rozprzestrzenianiu się trwałych burz w całej tkance..980-9I45J-00H010 cena, uwzględnione w całkowitych kosztach posiadania wraz z tymi zyskami w zakresie efektywności operacyjnej, wykazuje przekonującą wartość dla organizacji poszukujących zarówno wydajności, jak i zarządzalności.

6Podsumowanie i ocena wartości

W sprawieMellanox (NVIDIA Mellanox) 980-9I45J-00H010stanowi zbieżne rozwiązanie dla podwójnych wymagań sieci o wysokiej wydajności i usprawnionych operacjach.umożliwia to centrom danych obsługę nowych obciążeń prac AI/ML przy jednoczesnym zmniejszeniu kosztów operacyjnychArchitektura przedstawiona w niniejszym dokumencie została zweryfikowana w środowiskach produkcyjnych obsługujących ponad 5 PB dziennego ruchu, co potwierdza jej skalowalność i solidność.

W przypadku organizacji oceniających infrastrukturę sieciową nowej generacji980-9I45J-00H010oferuje przyszłościowe podstawy, które dostosowują się do zmieniających się wymagań aplikacji, nie naruszając prostoty operacyjnej.lub poprawa MTTR, wartość dostarczana przez to980-9I45J-00H010 rozwiązanie produktu sieciowegoUrządzenie jest obecnie dostępne za pośrednictwem autoryzowanych partnerów NVIDIA Mellanox, z980-9I45J-00H010 na sprzedażzapasy ustawione tak, aby spełniały harmonogramy szybkiego wdrażania.