Го Мінцзі: Nvidia відновила проєкт оптимізації чіпів для підготовки інференції Rubin CPX
Відомий аналітик Ґо Мінчі провів дослідження, яке показує, що Nvidia відновила розробку AI-чіпа для попереднього заповнення "Rubin CPX", очікується масове виробництво на початку 2027 року. Нова версія оснащена 168 ГБ HBM4-пам’яті, споживання потужності становить 2300 Вт, а обчислювальні можливості наближаються до стандартного Rubin GPU. Цей чіп використовує незалежний модульний стелаж і багаторівневу архітектуру з’єднання, разом зі стандартним Rubin GPU розгортаються у співвідношенні 1:1, спеціалізуються на попередньому заповненні та генерації KV Cache, щоб знизити вартість інференсу з довгим контекстом.
Nvidia тихо перезапустила проект чіпів, який раніше вважався покинутим ринком, спрямований на зниження витрат на AI-інференцію на етапі попередньої заповнення (Prefill).
Відомий аналітик Мін Чі Куо у своїх останніх галузевих дослідженнях повідомив, Nvidia перезапустила проект прискорювачів GPU Rubin CPX для попередньої заповнення AI-інференції та значно скорегувала дизайн продукту. Згідно з поточними планами, нова версія Rubin CPX має розпочати виробництво у першому кварталі 2027 року.
Перезапуск проекту є чітким сигналом: Nvidia посилює зусилля для вирішення вузьких місць продуктивності та витрат на етапі попереднього заповнення AI-інференції. З розширенням довжини контексту великих моделей, етап попереднього заповнення обробляє великий обсяг вхідної інформації та генерує KV Cache, а його ефективність прямо впливає на загальні витрати та економіку розгортання AI-інференції.
Мін Чі Куо зазначає, що зараз понад 50% навантаження на AI-інференцію походить від обробки контексту вводу та створення KV Cache.
Специфікація чіпа значно змінена, обчислювальна потужність наближається до стандартного Rubin
Ключові специфікації нової версії Rubin CPX суттєво відрізняються від попередньої схеми.
Щодо обчислювальної потужності та енергоспоживання, нова версія CPX вже наближається до стандартного Rubin GPU, максимальна потужність кожної карти також досягає 2300 ват. Щодо пам’яті, нова версія CPX використовує 168GB HBM4 відеопам’яті — суттєве оновлення порівняно з попередніми 128GB GDDR7, але все ж менше, ніж 288GB HBM4 у стандартному Rubin GPU.
За словами Мін Чі Куо, об’єм HBM4 у 8-картковому CPX обчислювальному лотку становить близько 1.34TB, що дозволяє обробляти більшість навантажень на попереднє заповнення з довгим контекстом та відповідні вимоги до KV Cache. Це означає, що Rubin CPX створений не просто для більшої універсальної обчислювальної потужності, а спеціально адаптований до сценаріїв з довгим контекстом, де важливі об’єм відеопам’яті та ефективність попереднього заповнення.
Від спільного стійкового розміщення до незалежного розгортання, більш гнучка конфігурація
Архітектура стійки також стала фокусом цієї корекції.
У попередній схемі CPX планувалося розміщувати разом зі стандартним Rubin GPU у спільному стійці; нова версія пропонує незалежну стійку MGX ETL, що дозволяє клієнтам окремо масштабувати потужність CPX відповідно до фактичних потреб.
Конкретно, клієнт може обрати розгортання 64, 128, 192 або 256 CPX GPU. Кожні 64 CPX GPU формують модуль стійки із 8 обчислювальних лотків, у кожному лотку встановлено 8 CPX GPU та один лоток комутатора.
Модульний дизайн означає, що клієнти не зобов’язані купувати великі стійки Rubin, а можуть гнучко масштабувати потужність CPX залежно від фактичного навантаження на попереднє заповнення.
Багаторівнева інтерконект-архітектура, зниження витрат на розгортання попереднього заповнення
Щодо архітектури інтерконекту, Rubin CPX реалізує багаторівневий дизайн, балансуючи між продуктивністю та витратами.
Всередині одного обчислювального лотка 8 CPX GPU розширюються через NVLink. Пропускна здатність NVLink кожної CPX GPU становить від 1 до 1.5TB/s, що менше, ніж 3.6TB/s у стандартного Rubin GPU.
На рівні розширення між лотками та всередині модулів стійки, CPX використовує Spectrum-6 Ethernet мідний L1-канал; між модулями стійки — через комутатори Spectrum-6 та OSFP оптичний канал.
Порівняно з повним покладанням на високошвидкісне GPU-з’єднання, така багаторівнева архітектура зосереджена на оптимізації витрат для сценаріїв попереднього заповнення.
Взаємодія зі стандартним Rubin GPU, зосередження на інференції з довгим контекстом
Rubin CPX — це не самостійний універсальний GPU, а прискорювач для попереднього заповнення, який використовується разом із Vera Rubin NVL72.
За словами Мін Чі Куо, Nvidia рекомендує розгорнути CPX та Rubin GPU у співвідношенні 1:1: CPX відповідає за обчислення на етапі попереднього заповнення та створення KV Cache, після чого через RDMA Ethernet передає KV Cache Rubin GPU для подальшого декодування.
З погляду позиціонування продукту, Rubin CPX не має на меті замістити стандартний Rubin GPU, а скоріше сегментує процес AI-інференції: різні GPU виконують завдання попереднього заповнення та декодування окремо.
Мін Чі Куо називає це “найкращим співвідношенням ціни та продуктивності для попереднього заповнення з довгим контекстом”. З розширенням вікна контексту AI-моделей, обсяги обчислень та масштаб KV Cache на етапі попереднього заповнення постійно збільшуються, і перезапуск проекту CPX Nvidia, ймовірно, є спробою подальшого зниження витрат на інференцію з довгим контекстом за допомогою спеціалізованого обладнання та гетерогенних розгортань.
Відмова від відповідальності: зміст цієї статті відображає виключно думку автора і не представляє платформу в будь-якій якості. Ця стаття не повинна бути орієнтиром під час прийняття інвестиційних рішень.
Вас також може зацікавити
Samsung опублікувала дорожню карту наступного покоління зберігання даних: продуктивність HBM5 у 2 рази вища за HBM4E, а прискорення продуктивності zHBM зросло у 8 разів
Базова технологія чіпів HBM5 підвищена до 2 нанометрів, з метою досягти у два рази вищої продуктивності порівняно з HBM4E, із підвищенням продуктивності на ват на 20% та зниженням термічного опору на 20%. Масове виробництво очікується у 2028 році. Абсолютно нова архітектура zHBM має на меті забезпечити продуктивність у 8 разів вищу за HBM4E, із потрійним збільшенням продуктивності на ват та зі зниженням термічного опору на 75-90%. Очікується, що випуск відбудеться після 2029 року.
Anthropic запускає Fable 5.1: зниження цін до 75%, посилені можливості програмування та наукових досліджень
Основна зміна в Fable 5.1 полягає у значному зниженні плати за "кеш-хіт" на 75%. Компанія заявила, що це призведе до значного зменшення загальних витрат. Окрім зниження цін, нова модель також оптимізована і призначена для виконання тих самих завдань з меншими витратами токенів. Крім того, відкрито можливість зберігати дані у власному хмарному середовищі клієнта, щоб задовольнити вимоги підприємств з високими стандартами щодо суверенності даних.

