Bitget App
Giao dịch thông minh hơn
Mua CryptoThị trườngGiao dịchFutures‌EarnAIQuảng trườngThêm
Guo Mingqi: Nvidia khởi động lại dự án chip tối ưu hóa tiền xử lý suy luận Rubin CPX

Guo Mingqi: Nvidia khởi động lại dự án chip tối ưu hóa tiền xử lý suy luận Rubin CPX

华尔街见闻华尔街见闻2026/09/01 11:01
Hiển thị bản gốc
Theo:华尔街见闻

Cuộc khảo sát của nhà phân tích nổi tiếng Kuo Ming-Chi cho thấy Nvidia đã khởi động lại chip AI suy luận dự đoán trước “Rubin CPX”, dự kiến sẽ bắt đầu sản xuất hàng loạt vào đầu năm 2027. Phiên bản mới sử dụng bộ nhớ HBM4 168GB, công suất tiêu thụ 2300 watt, hiệu năng gần bằng GPU Rubin tiêu chuẩn. Chip này áp dụng thiết kế mô-đun độc lập và kết nối phân tầng, phối hợp triển khai theo tỷ lệ 1:1 với Rubin GPU, chuyên dùng cho dự đoán trước và tạo KV Cache, nhằm giảm chi phí suy luận ngữ cảnh dài.

Nvidia lặng lẽ khởi động lại một dự án chip từng được thị trường cho là đã bị từ bỏ, với mục tiêu tập trung vào giai đoạn prefill (điền trước) của AI inference – vốn có chi phí cao.

Theo khảo sát mới nhất từ nhà phân tích nổi tiếng Ming-Chi Kuo, Nvidia đã tái khởi động dự án GPU tăng tốc prefill inference AI “Rubin CPX” và tiến hành điều chỉnh lớn về thiết kế sản phẩm. Theo kế hoạch hiện tại, phiên bản mới của Rubin CPX dự kiến sẽ được sản xuất vào quý 1 năm 2027.

Việc tái khởi động dự án lần này phát đi một tín hiệu rõ ràng: Nvidia đang tăng cường giải quyết những điểm nghẽn về hiệu năng và chi phí ở giai đoạn prefill của AI inference. Khi độ dài ngữ cảnh của mô hình lớn tăng lên, giai đoạn prefill phải xử lý lượng lớn thông tin đầu vào và tạo KV Cache, hiệu suất của nó sẽ ảnh hưởng trực tiếp đến tổng chi phí inference AI và tính kinh tế khi triển khai.

Ming-Chi Kuo cho biết, hiện nay hơn 50% khối lượng công việc inference AI xuất phát từ xử lý ngữ cảnh đầu vào và khởi tạo KV Cache.

Thông số chip được điều chỉnh lớn, hiệu năng gần tiệm cận Rubin tiêu chuẩn

Các thông số lõi của Rubin CPX mới đã thay đổi rõ rệt so với phương án trước đây.

Về hiệu năng và mức tiêu thụ điện năng, phiên bản mới của CPX gần như đạt đến hiệu suất của Rubin GPU tiêu chuẩn, với mức tiêu thụ điện tối đa mỗi card cũng đạt 2300W. Ở bộ nhớ, Rubin CPX mới sử dụng 168GB HBM4, nâng cấp đáng kể so với 128GB GDDR7 trước đó nhưng vẫn thấp hơn mức 288GB HBM4 trên Rubin GPU tiêu chuẩn.

Theo Ming-Chi Kuo, tổng dung lượng HBM4 của khay tính toán 8 card CPX vào khoảng 1,34TB, đáp ứng phần lớn các khối lượng công việc prefill ngữ cảnh dài và yêu cầu về KV Cache. Điều này có nghĩa là Rubin CPX không đơn thuần chỉ nâng cao hiệu năng tính toán toàn diện, mà được thiết kế lại tập trung vào dung lượng bộ nhớ lớn và tối ưu hiệu năng prefill cho những trường hợp sử dụng ngữ cảnh dài.

Chuyển từ giá đỡ dùng chung sang triển khai độc lập, cấu hình linh hoạt hơn

Kiến trúc giá đỡ cũng là điểm nhấn trong đợt điều chỉnh này.

Ở phương án cũ, CPX dự kiến chia sẻ giá đỡ cùng với Rubin GPU; phiên bản mới sẽ áp dụng giá đỡ MGX ETL độc lập, cho phép khách hàng mở rộng riêng biệt hiệu năng tính toán CPX theo nhu cầu thực tế.

Cụ thể, khách hàng có thể lựa chọn quy mô triển khai 64, 128, 192 hoặc 256 GPU CPX. Mỗi 64 GPU CPX hình thành một mô-đun giá đỡ, bao gồm 8 khay tính toán (mỗi khay gắn 8 GPU CPX), kèm một khay switch trao đổi dữ liệu.

Thiết kế dạng mô-đun đồng nghĩa khách hàng không cần mua nguyên giá đỡ Rubin quy mô lớn, mà có thể linh hoạt bổ sung hiệu năng CPX phù hợp với tải prefill thực tế.

Thiết kế liên kết phân tầng, giảm chi phí triển khai prefill

Về kiến trúc liên kết, Rubin CPX áp dụng thiết kế phân tầng, cân bằng giữa hiệu năng và chi phí.

Bên trong một khay tính toán, 8 GPU CPX được nâng cấp (Scale-up) qua NVLink. Băng thông NVLink của mỗi GPU CPX từ 1-1,5TB/s, thấp hơn mức 3,6TB/s của Rubin GPU tiêu chuẩn.

Ở tầng Scale-out giữa các khay và trong cụm mô-đun giá đỡ, CPX sử dụng kết nối Spectrum-6 Ethernet dây đồng L1; liên kết giữa các mô-đun giá đỡ sẽ qua switch Spectrum-6 trên mỗi mô-đun, kết nối bởi đường truyền cáp quang OSFP.

So với các phương án phụ thuộc hoàn toàn vào liên kết GPU băng thông cao, kiến trúc phân tầng này nhấn mạnh tối ưu chi phí cho các tình huống prefill.

Phối hợp cùng Rubin GPU, nhắm vào inference ngữ cảnh dài

Rubin CPX không phải là GPU đa năng chạy độc lập, mà đóng vai trò tăng tốc prefill và đi kèm với Vera Rubin NVL72.

Theo Ming-Chi Kuo, Nvidia khuyến nghị triển khai CPX và Rubin GPU theo tỷ lệ 1:1: CPX phụ trách tính toán giai đoạn prefill và tạo KV Cache, sau đó truyền KV Cache cho Rubin GPU qua mạng RDMA Ethernet để giải mã tiếp theo.

Về định vị sản phẩm, Rubin CPX không phải thay thế Rubin GPU tiêu chuẩn, mà là giúp quá trình AI inference được phân tách hơn, các GPU khác nhau đảm nhận tác vụ prefill và decoding riêng biệt.

Ming-Chi Kuo đánh giá đây là "giải pháp tối ưu nhất về chi phí-hiệu năng cho prefill ngữ cảnh dài". Khi cửa sổ ngữ cảnh của mô hình AI tiếp tục được mở rộng, tính toán và quy mô KV Cache của prefill ngày càng tăng, việc Nvidia tái khởi động dự án CPX lần này chính là nỗ lực giảm chi phí inference ngữ cảnh dài thông qua phần cứng chuyên dụng và phương thức triển khai dị thể.

0
0

Tuyên bố miễn trừ trách nhiệm: Mọi thông tin trong bài viết đều thể hiện quan điểm của tác giả và không liên quan đến nền tảng. Bài viết này không nhằm mục đích tham khảo để đưa ra quyết định đầu tư.

PoolX: Khóa để nhận token mới.
APR lên đến 12%. Luôn hoạt động, luôn nhận airdrop.
Khóa ngay!

Bạn cũng có thể thích

Goldman Sachs: Năm chủ đề tranh luận quan trọng về ngành bán dẫn

Goldman Sachs đã đưa ra năm chủ đề cốt lõi xoay quanh sức mạnh tính toán AI, thiết bị bán dẫn, lưu trữ, chip mô phỏng và phần mềm EDA. Họ cho rằng, chi tiêu vốn cho AI vẫn duy trì sức bền mạnh, chu kỳ tăng trưởng WFE dự kiến sẽ kéo dài đến năm 2028, nguồn cung và cầu DRAM, NAND tiếp tục căng thẳng, chu kỳ phục hồi của chip mô phỏng có thể kéo dài hơn; đồng thời, chip AI tùy chỉnh và Agentic AI tăng tốc thâm nhập, hứa hẹn mở ra không gian tăng trưởng mới cho chuỗi ngành.

华尔街见闻2026/09/01 16:31

Trước báo cáo tài chính của Dell Technologies (DELL.US), phe mua và phe bán quyết liệt tranh giành, thị trường quyền chọn đặt cược biến động lớn khoảng 11%, giao dịch quyền chọn bán tăng mạnh.

Dell Technologies sẽ công bố báo cáo tài chính quý vào thứ Ba sau khi thị trường chứng khoán Mỹ đóng cửa. Trước thời điểm công bố kết quả kinh doanh, các nhà đầu tư rõ ràng đã tăng cược vào khả năng biến động mạnh của giá cổ phiếu.

智通财经2026/09/01 16:21
Trước báo cáo tài chính của Dell Technologies (DELL.US), phe mua và phe bán quyết liệt tranh giành, thị trường quyền chọn đặt cược biến động lớn khoảng 11%, giao dịch quyền chọn bán tăng mạnh.

Bị “cướp bát cơm” làm Howmet (HWM.US) hoảng loạn! Citigroup, Bernstein khẳng định bị đánh giá sai: SpaceX (SPCX.US) tham gia thị trường càng chứng tỏ nhu cầu rất mạnh.

Cả Citigroup và Bernstein đều cho rằng, thông tin SpaceX tham gia sản xuất cánh tuốc bin cho thấy toàn ngành đang đối mặt với vấn đề thiếu hụt công suất, và bối cảnh ngành như vậy cuối cùng có thể củng cố vị thế thị trường của Howmet thay vì làm suy yếu nó.

智通财经2026/09/01 14:01
Bị “cướp bát cơm” làm Howmet (HWM.US) hoảng loạn! Citigroup, Bernstein khẳng định bị đánh giá sai: SpaceX (SPCX.US) tham gia thị trường càng chứng tỏ nhu cầu rất mạnh.