Bitget App
Trade smarter
Acheter des cryptosMarchésTradingFuturesEarnAICommunautéPlus
Guo Mingqi : Nvidia relance le projet de puce d’optimisation de préchargement d’inférence Rubin CPX

Guo Mingqi : Nvidia relance le projet de puce d’optimisation de préchargement d’inférence Rubin CPX

华尔街见闻华尔街见闻2026/09/01 11:01
Afficher le texte d'origine
Par:华尔街见闻

Selon une enquête du célèbre analyste Ming-Chi Kuo, Nvidia relance sa puce d’inférence AI pré-remplissage « Rubin CPX », dont la production en série est prévue pour début 2027. La nouvelle version utilise une mémoire HBM4 de 168GB, avec une consommation de 2300 watts et des performances proches du GPU Rubin standard. Cette puce adopte une conception modulaire indépendante de rack et d'interconnexion hiérarchisée, et sera déployée en collaboration 1:1 avec le GPU Rubin, se concentrant sur le pré-remplissage et la génération de KV Cache afin de réduire le coût des inférences contextuelles longues.

Nvidia a discrètement relancé un projet de puce que le marché considérait comme abandonné, ciblant spécifiquement l'étape de préremplissage (Prefill) à coût élevé dans l'inférence IA.

Selon la dernière enquête industrielle du célèbre analyste Ming-Chi Kuo, Nvidia a redémarré le projet GPU d’accélération de préremplissage pour l’inférence AI, dénommé "Rubin CPX", tout en procédant à d’importants ajustements de conception. D’après la planification actuelle, la nouvelle version de Rubin CPX devrait entrer en production au premier trimestre 2027.

La relance de ce projet envoie un signal clair : Nvidia mise fortement sur la résolution des goulets d’étranglement en termes de performance et de coût lors de l’étape de préremplissage dans les tâches d’inférence IA. Avec l’allongement continu du contexte des grands modèles, la phase de préremplissage doit traiter de grands volumes d'informations et générer un KV Cache, son efficacité impactant directement le coût global de l’inférence IA et la viabilité économique du déploiement.

D’après Ming-Chi Kuo, plus de 50% de la charge de travail en inférence IA provient actuellement du traitement du contexte d'entrée et de la construction du KV Cache.

Ajustement majeur des spécifications des puces, puissance de calcul proche du Rubin standard

Les spécifications principales du nouveau Rubin CPX diffèrent nettement par rapport à la version précédente.

En termes de performance et de consommation, le nouveau CPX offre une puissance presque équivalente au GPU Rubin standard, avec une consommation maximale par carte atteignant également 2300 watts. Côté mémoire, le nouveau CPX adopte 168Go de mémoire HBM4, une amélioration notable par rapport aux 128Go de GDDR7 de la version précédente, bien que toujours inférieure aux 288Go de HBM4 du GPU Rubin standard.

Selon Ming-Chi Kuo, la capacité totale de HBM4 sur un plateau de calcul CPX à 8 cartes est d’environ 1,34To, suffisant pour la plupart des charges préremplissage à long contexte et leurs besoins de KV Cache correspondants. Cela signifie que le Rubin CPX ne poursuit pas simplement une puissance de calcul plus élevée, mais a été repensé pour optimiser la capacité mémoire et l’efficacité du préremplissage dans les scénarios de long contexte.

Passage du rack partagé au déploiement indépendant, configuration plus flexible

L’architecture des racks est également un axe majeur de cette révision.

Dans la version précédente, le CPX devait partager son rack avec le GPU Rubin ; la nouvelle version opte pour des racks indépendants MGX ETL, permettant aux clients d’étendre la capacité CPX selon leurs besoins réels.

Concrètement, les clients peuvent choisir un déploiement de 64, 128, 192 ou 256 GPU CPX. Chaque module de rack de 64 GPU CPX inclut huit plateaux de calcul, chacun équipé de 8 GPU CPX et d’un plateau de switch.

La conception modulaire implique que les clients ne sont pas limités à acquérir de grands racks Rubin fixes, mais peuvent ajuster librement la puissance CPX selon les besoins réels de la charge de préremplissage.

Architecture d’interconnexion hiérarchisée, réduction des coûts de déploiement du préremplissage

Côté architecture d’interconnexion, Rubin CPX utilise une conception hiérarchique pour trouver un compromis entre performance et coût.

À l’intérieur d’un seul plateau de calcul, les 8 GPU CPX sont interconnectés via NVLink pour une extension Scale-up. Chaque GPU CPX dispose d’une bande passante NVLink comprise entre 1 et 1,5To/s, inférieur aux 3,6To/s d’un GPU Rubin standard.

Pour l’extension Scale-out entre les plateaux et à l’intérieur du module de rack, le CPX emploie un lien tout cuivre L1 Ethernet Spectrum-6 ; pour les connexions entre modules de racks, l’interconnexion passe par des switches Spectrum-6 de chaque module via des liens optiques OSFP.

Par rapport aux solutions reposant seulement sur une interconnexion GPU haut débit, cette architecture hiérarchisée vise d’avantage l’optimisation des coûts pour les scénarios de préremplissage.

Synergie avec Rubin GPU, ciblant l’inférence à long contexte

Rubin CPX n’est pas un GPU universel indépendant mais sert d'accélérateur de préremplissage en complément de Vera Rubin NVL72.

D’après Ming-Chi Kuo, Nvidia recommande un déploiement avec un ratio 1:1 entre CPX et Rubin GPU : le CPX réalise le calcul de préremplissage et génère le KV Cache, qui est ensuite transféré via RDMA Ethernet au Rubin GPU, chargé du décodage subséquent.

En termes de positionnement produit, l’objectif principal du Rubin CPX n’est pas de remplacer le GPU Rubin standard, mais de subdiviser davantage le processus d’inférence IA, chaque GPU gérant respectivement les tâches de préremplissage ou de décodage.

Ming-Chi Kuo le définit comme "la meilleure solution qualité/prix pour le préremplissage à long contexte". Avec l’élargissement constant de la fenêtre de contexte des modèles IA, le volume de calcul pour le préremplissage ainsi que l’échelle du KV Cache continuent de croître. Le redémarrage de CPX par Nvidia vise probablement à abaisser encore les coûts du long contexte, grâce à du matériel spécialisé et des déploiements hétérogènes.

0
0

Avertissement : le contenu de cet article reflète uniquement le point de vue de l'auteur et ne représente en aucun cas la plateforme. Cet article n'est pas destiné à servir de référence pour prendre des décisions d'investissement.

PoolX : Bloquez vos actifs pour gagner de nouveaux tokens
Jusqu'à 12% d'APR. Gagnez plus d'airdrops en bloquant davantage.
Bloquez maintenant !

Vous pourriez également aimer

La situation tendue entre les États-Unis et l'Iran ravive les inquiétudes liées à l'inflation, le Brent grimpe à 95 dollars, les marchés obligataires mondiaux subissent de fortes ventes, et le marché actions coréen chute de 4 %.

Les affrontements militaires entre les États-Unis et l'Iran reprennent, les prix du pétrole montent en flèche, les inquiétudes liées à l’inflation et les attentes de hausse des taux d’intérêt s’intensifient. Les rendements des obligations majeures telles que les bons du Trésor américain, japonais et australien atteignent leur plus haut niveau depuis dix, voire plusieurs dizaines d’années. L’indice composite sud-coréen a élargi sa baisse à 4 %, SK Hynix et Samsung Electronics chutant de plus de 4 % chacun. Le Brent a augmenté de 1 % pour atteindre 95,61 dollars le baril, le prix du diesel grimpe à son plus haut niveau depuis plus de quatre mois, et le prix du gaz naturel européen atteint son niveau le plus élevé depuis 2023.

华尔街见闻2026/09/02 05:36

Le prix du changement de direction chez Apple est fixé : Ternus mise 75 % de ses actions sur le S&P 500, tandis que Cook réduit son salaire pour assurer une transition en douceur.

Le nouveau PDG d’Apple, John Ternus, aura une rémunération totale cible d’environ 58 millions de dollars pour l’exercice 2027, dont jusqu’à 55 millions de dollars d’actions dont 75 % sont directement liés à la performance de l’indice S&P 500. Tim Cook, devenu président exécutif, aura une rémunération totale cible d’environ 47 millions de dollars, dont 45 millions de dollars d’actions, dont la moitié dépendra de la performance du marché.

华尔街见闻2026/09/02 04:06