Bitget App
Trade smarter
Kup kryptoRynkiHandelFuturesEarnAICentrumWięcej
Ming-Chi Kuo: Nvidia wznawia projekt optymalizacji chipów do wnioskowania Rubin CPX

Ming-Chi Kuo: Nvidia wznawia projekt optymalizacji chipów do wnioskowania Rubin CPX

华尔街见闻华尔街见闻2026/09/01 11:01
Pokaż oryginał
Przez:华尔街见闻

Znany analityk Ming-Chi Kuo przeprowadził badania, z których wynika, że Nvidia wznawia prace nad chipem do wstępnego ładowania AI "Rubin CPX", którego masowa produkcja planowana jest na początek 2027 roku. Nowa wersja będzie wyposażona w 168 GB pamięci HBM4, pobór mocy wyniesie 2300 watów, a wydajność obliczeniowa będzie zbliżona do standardowego Rubin GPU. Ten chip wykorzystuje niezależną, modułową ramę i warstwową architekturę połączeń; jest wdrażany w stosunku 1:1 z Rubin GPU, skupiając się na wstępnym ładowaniu oraz generowaniu KV Cache, co pozwala na obniżenie kosztów długiego kontekstowego wnioskowania.

Nvidia po cichu wznowiła projekt chipów, który wcześniej uznano za porzucony przez rynek, a jego celem jest bezpośrednie obniżenie kosztów AI w fazie prefillingu (Prefill).

Najświeższe badania branżowe znanego analityka Guo Mingchi pokazują, Nvidia wznowiła projekt GPU przyspieszających fazę prefillingu AI o nazwie „Rubin CPX”, dokonując znacznych zmian w projektowaniu produktu. Według obecnych planów, nowa wersja Rubin CPX ma wejść do produkcji w pierwszym kwartale 2027 roku.

Wznowienie projektu jasno sygnalizuje: Nvidia intensyfikuje działania mające na celu rozwiązanie problemów z wydajnością i kosztami fazy prefillingu w AI. Wraz z rosnącą długością kontekstu w dużych modelach, faza prefillingu musi przetwarzać ogromne ilości danych wejściowych i generować KV Cache, a jej efektywność bezpośrednio wpływa na całkowite koszty i opłacalność wdrożenia AI.

Guo Mingchi wskazuje, że obecnie ponad 50% obciążenia związanego z inferencją AI pochodzi z obsługi wejściowego kontekstu oraz budowy KV Cache.

Specyfikacja chipów znacznie zmodyfikowana, moc obliczeniowa zbliżona do standardowego Rubin

Rdzeń nowej wersji Rubin CPX znacznie różni się od wcześniejszego projektu.

Jeśli chodzi o moc obliczeniową i pobór energii, wydajność nowego CPX zbliża się do standardowego Rubin GPU, a maksymalny pobór prądu pojedynczej karty również sięga 2300 watów. W zakresie pamięci nowy CPX korzysta z 168GB pamięci HBM4, co stanowi wyraźny upgrade w stosunku do poprzednich 128GB GDDR7, choć nadal jest mniej niż 288GB HBM4 w standardowym Rubin GPU.

Według Guo Mingchi, całkowita pojemność HBM4 w tacce obliczeniowej z 8 kartami CPX wynosi około 1,34TB, co wystarcza do większości długich obciążeń prefillingu i odpowiadającym potrzebom KV Cache. To oznacza, że Rubin CPX nie dąży jedynie do wyższej uniwersalnej mocy obliczeniowej, lecz został specjalnie zaprojektowany pod kątem pojemności pamięci i efektywności prefillingu w scenariuszach z długim kontekstem.

Od wspólnego racka do niezależnej instalacji, elastyczność konfiguracji

Architektura racka to także główny punkt tej zmiany.

W poprzednim projekcie CPX miał dzielić rack z Rubin GPU; nowa wersja przewiduje niezależne racki MGX ETL, co umożliwia klientom samodzielną rozbudowę mocy obliczeniowej CPX w zależności od potrzeb.

Konkretnie klienci mają możliwość wyboru instalacji z 64, 128, 192 lub 256 GPU CPX. Każde 64 GPU CPX składają się na jeden moduł racka, obejmujący 8 tacek obliczeniowych, z których każda ma 8 GPU CPX wraz z tacą switcha.

Modułowa konstrukcja oznacza, że klienci nie muszą kupować dużych racków Rubin według stałych wymiarów, tylko mogą elastycznie powiększać moc CPX zgodnie z rzeczywistym zapotrzebowaniem prefillingu.

Warstwowa konstrukcja sieci, niższe koszty wdrożenia prefillingu

Rubin CPX zastosował warstwową architekturę interkoneksji, wybierając kompromis między wydajnością a kosztami.

Wewnątrz pojedynczej tacy obliczeniowej 8 GPU CPX rozbudowuje się poprzez NVLink (Scale-up). Każde GPU CPX oferuje przepustowość NVLink na poziomie 1–1,5TB/s, co jest niższe niż 3,6TB/s w standardowym Rubin GPU.

Na poziomie Scale-out między tacami oraz wewnątrz modułu racka CPX posługuje się Spectrum-6 Ethernet (L1, full copper); do połączeń między rackami służą switche Spectrum-6 oraz światłowodowe linki OSFP.

W porównaniu do całkowitego oparcia się na wysokiej przepustowości GPU, taka warstwowa architektura lepiej optymalizuje koszty dla scenariuszy prefillingu.

Synergia z Rubin GPU, cel: długie konteksty inferencji

Rubin CPX nie jest uniwersalnym GPU do samodzielnej pracy, lecz przyspieszaczem prefillingu przeznaczonym do współpracy z Vera Rubin NVL72.

Według Guo Mingchi, Nvidia poleca wdrażanie CPX i Rubin GPU w proporcji 1:1: CPX realizuje obliczenia prefillingu i generuje KV Cache, który jest następnie przesyłany przez Ethernet RDMA do Rubin GPU, gdzie następuje dalsze dekodowanie.

Pod względem pozycjonowania produktowego, Rubin CPX nie zastępuje standardowego Rubin GPU, lecz umożliwia dalszy podział procesu inferencji AI, delegując prefill i dekodowanie oddzielnym GPU.

Guo Mingchi określa to jako „najbardziej opłacalne rozwiązanie dla długich kontekstów prefillingu”. Wraz ze wzrostem okna kontekstu w modelach AI, rosną też obliczenia i wielkość KV Cache w fazie prefillingu. Restart projektu CPX przez Nvidia oznacza próbę dalszego obniżenia kosztów inferencji w długich kontekstach poprzez dedykowany sprzęt i heterogeniczne wdrożenia.

0
0

Zastrzeżenie: Treść tego artykułu odzwierciedla wyłącznie opinię autora i nie reprezentuje platformy w żadnym charakterze. Niniejszy artykuł nie ma służyć jako punkt odniesienia przy podejmowaniu decyzji inwestycyjnych.

PoolX: Stakuj, aby zarabiać
Nawet ponad 10% APR. Zarabiaj więcej, stakując więcej.
Stakuj teraz!

Może Ci się również spodobać

Citadel: Amerykańskie akcje mogą doświadczyć „taktycznego okna spadkowego” we wrześniu; zaleca się sprzedaż przy wzrostach i kupowanie zabezpieczeń po niskich cenach

Główny strateg ds. akcji w Citadel Securities ostrzega, że wraz z wyczerpaniem pozytywnych efektów wyników kwartalnych amerykańskich spółek, sezonowym osłabieniem popytu detalicznego i na wykup akcji, a także kumulacją wygasających dużych opcji i powrotem licznych ryzyk makroekonomicznych, we wrześniu rośnie taktyczne ryzyko spadku na amerykańskim rynku akcji. Biorąc pod uwagę obecnie niskie koszty zabezpieczenia, zaleca on inwestorom „redukcję pozycji przy wzrostach i kupowanie ochrony po niskiej cenie”, czekając na bardziej sprzyjający moment do inwestycji w połowie października.

华尔街见闻2026/09/01 12:06

Globalny rynek obligacji traci stabilność: co oznacza powrót 10-letniej japońskiej rentowności do poziomu 3%? Analizy wielu ekspertów

Rentowności japońskich obligacji rządowych gwałtownie wzrosły na całej linii, a rentowność benchmarkowych 10-letnich obligacji po raz pierwszy od 1996 roku osiągnęła poziom 3%.

智通财经2026/09/01 11:56
Globalny rynek obligacji traci stabilność: co oznacza powrót 10-letniej japońskiej rentowności do poziomu 3%? Analizy wielu ekspertów