Ming-Chi Kuo: Mulit na inumpisahan muli ng Nvidia ang proyekto ng inference prefill optimization chip na Rubin CPX
Ayon sa isang kilalang analyst na si Ming-Chi Kuo, ipinakita ng kanyang pananaliksik na muling inilunsad ng NVIDIA ang kanilang AI inference prefill chip na “Rubin CPX”, na inaasahang magsisimula ng mass production sa unang bahagi ng 2027. Ang bagong bersyon ay gumagamit ng 168GB HBM4 memory, may power consumption na 2300 watts, at may computational capacity na halos kapantay ng standard Rubin GPU. Ang chip na ito ay gawa sa independent modular rack at layered interconnect design, at magde-deploy kasama ang Rubin GPU sa 1:1 ratio. Ituon nito ang prefill at KV Cache generation upang mapababa ang gastos sa long-context inference.
Tahimik na muling sinimulan ng Nvidia ang isang proyekto sa chip na dati nang inakalang iniwan na ng merkado, na ang layunin ay harapin ang mataas na gastusin sa prefill (paunang pagsingit) na bahagi ng AI inference.
Ayon sa pinakabagong ulat sa industriya ng kilalang analyst na si Ming-Chi Kuo, muling binuhay ng Nvidia ang proyekto ng AI inference prefill acceleration GPU na “Rubin CPX,” at nagkaroon ng malaking pagbabago sa disenyo ng produkto. Ayon sa kasalukuyang plano, inaasahang magsisimula ang produksyon ng bagong Rubin CPX sa unang quarter ng 2027.
Ang pagbuhay muli sa proyekto ay nagpapahiwatig ng malinaw na mensahe: Lalo pang pinapalakas ng Nvidia ang pagsisikap para solusyunan ang bottleneck sa prefill na performance at gastos sa phase ng AI inference. Sa patuloy na pagtaas ng haba ng context ng malalaking modelo, kailangang iproseso sa prefill phase ang malaking dami ng input na impormasyon at buuin ang KV Cache, na ang efficiency ay direktang nakakaapekto sa kabuuang gastusin at ekonomikong deployment ng AI inference.
Ayon kay Ming-Chi Kuo, mahigit sa 50% ng AI inference workload ay nagmumula sa pagproseso ng context input at pagtatayo ng KV Cache.
Malaking Pagbabago sa Specs ng Chip, Computing Power Malapit sa Standard na Rubin
Ang pangunahing specs ng bagong Rubin CPX ay nagkaroon ng kapansin-pansin na pagbabago kumpara sa naunang bersyon.
Sa bahagi ng computing power at power consumption, halos umabot na ang performance ng bagong CPX sa standard na Rubin GPU, na may pinakamataas na single card consumption na 2300 watts din. Sa memorya naman, ginamit ng bagong CPX ang 168GB HBM4 na VRAM, na mas mataas kaysa sa dating 128GB GDDR7, ngunit mas mababa sa 288GB HBM4 ng standard na Rubin GPU.
Ayon kay Ming-Chi Kuo, ang kabuuang kapasidad ng HBM4 sa 8-card CPX computing tray ay humigit-kumulang 1.34TB, na sumasapat na sa karamihan ng mahahabang context prefill workloads at kaukulang KV Cache. Ibig sabihin, hindi lang mas mataas na general computing power ang habol ng Rubin CPX, kundi dinisenyo ito muli para mas angkop sa scenarios na malaki ang kailangan sa VRAM capacity at prefill efficiency.
Mula Shared Rack Patungong Independent Deployment, Mas Flexible na Configuration
Binibigyang-diin din ang pagbabago sa rack architecture sa pagkakataong ito.
Sa naunang plano, balak paghatian ng CPX at Rubin GPU ang isang rack; ngunit ngayon, gagamit ng independent na MGX ETL rack ang bagong bersyon, kaya maaaring pangasiwaan ng mga kliyente ang expansion ng CPX computing power ayon sa totoong pangangailangan.
Mas detalyado, maaari ngayong pumili ang mga kliyente ng deployment scale na 64, 128, 192 o 256 CPX GPUs. Bawat 64 CPX GPU ay bumubuo ng isang rack module na may 8 computing trays, bawat tray ay may 8 CPX GPUs at may kasamang isang switching tray.
Ibig sabihin ng modular design, hindi na kailangang bumili ng malaking Rubin rack, maaaring dagdagan ang CPX compute ayon sa kinakailangang prefill workload.
Hierarchical Interconnection Design, Mas Mababa ang Gastos sa Prefill Deployment
Sa interconnection architecture, hierarchical design ang ginamit ng Rubin CPX, na nagsasakripisyo sa pagitan ng performance at gastos.
Sa loob ng isang computing tray, ang 8 CPX GPU ay nakakonect gamit ang NVLink para sa Scale-up expansion. Ang bawat CPX GPU ay may NVLink bandwidth na nasa 1 hanggang 1.5TB/s, mas mababa sa 3.6TB/s ng standard na Rubin GPU.
Sa pagitan ng trays at loob ng rack module para sa Scale-out, gumagamit ang CPX ng Spectrum-6 Ethernet na L1 copper links; para naman sa cross-rack modules, gumagamit ng Spectrum-6 switch at OSFP fiber links ang koneksyon.
Kumpara sa mga solusyon na puro high-bandwidth GPU interconnection, mas nakatutok ang ganitong hierarchical design sa optimization ng gastos para sa prefill scenarios.
Coordinated sa Rubin GPU, Target sa Mahahabang Context Inference
Hindi standalone general-purpose GPU ang Rubin CPX, kundi ito ay prefill accelerator na ipapares sa Vera Rubin NVL72.
Ayon kay Ming-Chi Kuo, inirerekomenda ng Nvidia na i-deploy ang CPX at Rubin GPU sa 1:1 ratio: ang CPX ang bahala sa prefill calculation at pagbuo ng KV Cache, tapos ang KV Cache ay ipapasa sa Rubin GPU sa pamamagitan ng Ethernet RDMA na siyang bahalang magpatuloy sa decoding.
Sa product positioning, hindi layunin ng Rubin CPX na palitan ang standard Rubin GPU kundi hatiin pa lalo ang AI inference workflow para ang magkaibang GPU ay mag-focus sa prefill at decoding.
Itinuturing ito ni Ming-Chi Kuo bilang “pinakamahusay na cost-performance solution para sa long-context prefill.” Habang lumalaki ang context window ng AI models, tumataas din ang prefill computation at laki ng KV Cache, kaya ang muling pagbubuhay ng CPX project ng Nvidia ay tila pagkilos para mapababa pa ang gastos sa long-context inference gamit ang dedicated hardware at heterogeneous deployment.
Disclaimer: Ang nilalaman ng artikulong ito ay sumasalamin lamang sa opinyon ng author at hindi kumakatawan sa platform sa anumang kapasidad. Ang artikulong ito ay hindi nilayon na magsilbi bilang isang sanggunian para sa paggawa ng mga desisyon sa investment.
Baka magustuhan mo rin

Salesforce (CRM.US) nanguna sa pinakabagong pagpopondo ng “AI+HR” unicorn HiBob, nag-invest ng tunay na kapital upang pabulaanan ang “SaaS end-of-days theory”
Nag-invest ang Salesforce sa kumpanya ng human resources software na HiBob sa halagang $3.2 bilyon.

Citadel: Maaaring makaranas ang US stock market ng isang “tactical down window” sa Setyembre, inirerekomenda ang pagbawas ng posisyon kapag mataas at pagbili ng proteksyon sa mababang halaga
Nagbabala ang Chief Equity Strategist ng Citadel Securities na habang lumalabas na ang positibong kinita ng mga kumpanya sa U.S. stock market para sa ikalawang quarter, pumapasok ang retail at buyback demand sa panahong mahina, at may malakihang pag-expire ng mga options at pagbalik ng macroeconomic risks, tumataas ang panganib ng taktikal na pagbaba ng U.S. stocks sa Setyembre. Dahil mababa ang kasalukuyang gastos sa hedging, inirerekomenda niya sa mga mamumuhunan na "magbenta habang mataas, bumili ng proteksyon kapag mababa ang presyo," at maghintay ng mas mahusay na pagkakataon para sa positibong posisyon pagdating ng kalagitnaan ng Oktubre.
Ang “pundasyon” ng pandaigdigang pamilihan ng bono ay lumuluwag: Ano ang ibig sabihin ng pagbabalik ng 10-taong kita ng Japan sa 3%? Paliwanag mula sa ilang eksperto
Ang mga kita mula sa Japanese government bonds ay tumaas sa lahat ng maturities, kung saan ang benchmark na 10-year government bond yield ay umabot sa 3% na antas sa unang pagkakataon mula noong 1996.

