Nvidia công bố Groq 3 LPX chính thức đi vào sản xuất hàng loạt, hiệu suất suy luận của Vera Rubin tăng gấp nhiều lần, SpaceXAI đầu tư mạnh vào AI Agent và AI không gian
Nvidia cho biết, dựa trên khối lượng công việc AgentX của SemiAnalysis và sử dụng mô hình DeepSeek V4 Pro, Vera Rubin có hiệu suất thông lượng trên mỗi megawatt cao gấp 30 lần so với thế hệ trước GB300 NVL72, đồng thời chi phí mỗi Token giảm tối đa tới 35 lần. SpaceXAI sẽ sử dụng CPU Vera để tăng tốc ứng dụng AI thế hệ tiếp theo cho agent, đồng thời mở rộng xây dựng nền tảng dựa trên Vera Rubin. SpaceXAI có kế hoạch đưa Vera Rubin NVL72 phiên bản tối ưu lên không gian, phục vụ cho thế hệ vệ tinh Starmind AI đầu tiên.
Nvidia đang tăng tốc đẩy cuộc cạnh tranh về hạ tầng AI từ hiệu năng huấn luyện mô hình và suy diễn truyền thống, sang một giai đoạn mới tập trung vào tốc độ tạo Token, tiêu thụ điện năng và chi phí xoay quanh AI đại lý (Agentic AI).
Vào ngày 24 theo giờ miền Đông Mỹ, Nvidia công bố Groq 3 LPX, nhắm vào AI suy diễn tương tác, chính thức được sản xuất hàng loạt. Là một phần quan trọng của nền tảng Vera Rubin, Groq 3 LPX nổi bật với khả năng sinh Token siêu thấp độ trễ. Nvidia cho biết, trong bài kiểm tra Artificial Analysis, với mô hình Gemma 4 31B và ngữ cảnh 100.000 Token, Groq 3 LPX đạt tới 3400 Token đầu ra mỗi giây, lập kỷ lục mới cho mô hình này; đối với các tác vụ lập trình đại lý có yêu cầu thấp về độ trễ, tốc độ phản hồi cao gấp 4 lần nền tảng cạnh tranh gần nhất.
Bên cạnh đó, Nvidia còn công bố kết quả kiểm thử mới của Vera Rubin NVL72 dưới tác vụ đại lý thực tế: dựa trên tải AgentX của SemiAnalysis, sử dụng mô hình DeepSeek V4 Pro, hiệu suất Vera Rubin tính theo mỗi megawatt (MW) đạt gấp 30 lần thế hệ trước GB300 NVL72, chi phí trên mỗi Token giảm tối đa 35 lần. Nvidia nhấn mạnh, tác vụ đại lý khác biệt so với trò chuyện hoặc tóm tắt truyền thống, ngữ cảnh nhiệm vụ tích lũy qua hàng trăm bước, thậm chí tới hàng trăm ngàn Token.

Cùng ngày, Nvidia cũng thông báo SpaceXAI sẽ sử dụng Vera CPU để tăng tốc các ứng dụng AI đại lý thế hệ tiếp theo và mở rộng xây dựng nền tảng dựa trên Vera Rubin, khi quy mô tính toán mở rộng đến hàng GW; hơn nữa, SpaceXAI dự định triển khai Vera Rubin NVL72 bản tối ưu ra không gian cho vệ tinh Starmind AI thế hệ đầu tiên.
Groq 3 LPX sản xuất hàng loạt: Nvidia hoàn thiện “km cuối” cho AI đại lý
Lần này Nvidia chính thức đưa Groq 3 LPX vào sản xuất, mục tiêu cốt lõi không phải thay thế GPU bằng chip chuyên dụng suy diễn, mà nhằm bổ sung khả năng sinh Token độ trễ thấp cho Vera Rubin mà kiến trúc GPU truyền thống còn hạn chế.
Đối với AI đại lý, mỗi tác vụ thường không còn chỉ là “hỏi đáp”: Đại lý cần đọc file, gọi công cụ, thực thi mã, kiểm tra kết quả và tiếp tục suy diễn dựa trên kết quả, có thể lặp đi lặp lại hàng trăm tới hàng ngàn bước. Trong quá trình này, tốc độ sinh Token ở mỗi bước đều ảnh hưởng đến thời gian hoàn thành toàn bộ nhiệm vụ.
Nvidia cho biết, AI đại lý bởi vậy mang lại hai thách thức tính toán khác biệt: một là cần xử lý hiệu quả ngữ cảnh khổng lồ ngày càng lớn, hai là liên tục sinh Token với độ trễ cực thấp. Vera Rubin NVL72 đảm nhiệm đào tạo, suy diễn và xử lý ngữ cảnh quy mô lớn, còn Groq 3 LPX tối ưu tốc độ tương tác người dùng đơn, nâng cao tốc độ sinh Token.
Kết quả kiểm thử mới từ Nvidia cho thấy, Groq 3 LPX với điều kiện Gemma 4 31B và ngữ cảnh 100K đạt 3400 Token đầu ra mỗi giây; trong tác vụ đại lý và tải yêu cầu độ trễ thấp, tốc độ phản hồi lên tới 4 lần so với nền tảng cạnh tranh gần nhất. Nvidia cho biết, tốc độ này giúp đại lý hoàn thành các chuỗi tác vụ như lập trình mã, kiểm thử, gọi công cụ, xác minh kết quả nhanh hơn.
Về thương mại, nhà cung cấp dịch vụ đám mây AI Nebius sẽ là hãng đầu tiên sử dụng Groq 3 LPX, và dự kiến tích hợp vào nền tảng sản xuất suy diễn Nebius Token Factory. Groq cũng dự định là một trong những bên đầu tiên sử dụng nền tảng này.
Điều này đồng nghĩa, cùng với việc Groq 3 LPX sản xuất hàng loạt, năng lực mà Nvidia có được sau thương vụ mua lại công nghệ Groq đã thực sự được tích hợp vào hệ sinh thái sản phẩm trung tâm dữ liệu Vera Rubin.
30 lần không chỉ là tăng “tốc độ” 30 lần mà là mỗi megawatt xử lý nhiều tác vụ đại lý hơn
So với các chỉ số riêng lẻ như 3400 Token/giây, điểm đáng chú ý hơn từ Nvidia lần này là nhấn mạnh vào thông lượng mỗi megawatt và chi phí Token.
Dữ liệu thử nghiệm Nvidia công bố cho thấy, với tải AgentX của SemiAnalysis, Vera Rubin NVL72 đạt thông lượng mỗi megawatt lên tới 30 lần GB300 NVL72, đồng thời giảm tối đa 35 lần chi phí mỗi Token. Bài kiểm thử sử dụng hành trình lập trình đại lý thực tế, giữ nguyên tăng trưởng ngữ cảnh, gọi công cụ và sinh đại lý phụ như tình huống thực tế.

Vậy nên, tối đa tăng 30 lần thông lượng mỗi megawatt chỉ là biểu hiện nâng cao hiệu suất suy diễn AI vượt trội, chứ không có nghĩa đơn thuần tốc độ suy diễn chip tăng 30 lần.
Chỉ số này đặc biệt quan trọng đối với các trung tâm dữ liệu AI.
Các mô hình truyền thống chú trọng độ trễ, thông lượng cho mỗi yêu cầu, còn tác vụ đại lý tiêu tốn Token liên tục. Nvidia trích dẫn dữ liệu OpenRouter cho biết, lượng Token mà tác vụ AI đại lý tiêu thụ có thể gấp tới 15 lần so với yêu cầu trò chuyện đơn giản. Nguyên nhân vì một đại lý có thể tra cứu cơ sở dữ liệu, tìm kiếm tin tức và tài liệu, gọi đại lý con phân tích, chạy code và lặp đi lặp lại xác minh, trong suốt quá trình này ngữ cảnh không ngừng tích lũy.
Điều này khiến việc đánh giá yếu tố kinh tế của hạ tầng AI bắt đầu có phương pháp đo mới: Cùng một megawatt, có thể hoàn thành bao nhiêu tác vụ đại lý hiệu quả?
Trong bối cảnh điện năng và tài nguyên trung tâm dữ liệu ngày càng trở thành nút thắt mở rộng AI, gia tăng số lượng Token sinh ra với cùng một mức điện năng còn quan trọng hơn chỉ đơn thuần tăng sức mạnh tính toán đỉnh.
Vera Rubin từ “nền tảng GPU” trở thành nhà máy AI hoàn chỉnh
Xét về kiến trúc, Groq 3 LPX không phải sản phẩm đơn lẻ, mà nằm trong chiến lược “thiết kế phối hợp tối đa” của Nvidia Vera Rubin.

Nvidia trước đó đã định nghĩa Vera Rubin là nền tảng nhà máy AI cho thời đại đại lý AI. Toàn hệ thống không chỉ gồm GPU, mà được phối hợp giữa tính toán, mạng, lưu trữ và phần mềm, bao gồm các thành phần như Rubin GPU, Vera CPU, Groq 3 LPX, BlueField-4 DPU, Spectrum-6 SPX.
Trong đó, Rubin GPU đảm trách đào tạo quy mô lớn, suy diễn và xử lý ngữ cảnh; Groq 3 LPX phụ trách sinh Token tốc độ cao; Vera CPU xử lý lượng lớn tác vụ nặng về CPU do đại lý phát sinh giữa các lần gọi mô hình, như điều phối công cụ, thực thi mã, xử lý dữ liệu và mô phỏng.
Thông tin kiến trúc mà Nvidia công bố trước đây cho thấy, nền tảng Vera Rubin phối hợp giữa bảy loại chip và năm loại rack chuyên dụng nhằm tối ưu để từng phần cứng đảm nhận đúng tác vụ phù hợp, thay vì một loại bộ xử lý phải xử lý toàn bộ tải công việc AI.
Điều này cho thấy Nvidia đang nâng cấp hạ tầng AI từ “cụm GPU” lên một hệ thống tính toán dị chủng hoàn chỉnh.
Đối với các nhà cung cấp dịch vụ đám mây AI, kiến trúc này cho phép bố trí tài nguyên tối ưu cho từng giai đoạn như đào tạo, suy diễn ngữ cảnh dài, sinh Token, gọi công cụ, từ đó nâng cao hiệu suất sử dụng và hiệu quả kinh tế toàn trung tâm dữ liệu.
SpaceXAI tăng tốc cùng Vera: AI đại lý từ trung tâm dữ liệu lên quỹ đạo
Đúng lúc Groq 3 LPX sản xuất đại trà, SpaceXAI cũng công bố sẽ dùng hệ thống Vera Rubin sâu hơn.
Ngày 24 tháng 8, Nvidia thông báo SpaceXAI sẽ triển khai Vera CPU cho các ứng dụng AI đại lý thế hệ mới. Vera thiết kế chuyên biệt cho các tác vụ CPU ngoài suy diễn mô hình, bao gồm gọi công cụ, thực thi mã, xử lý dữ liệu, điều phối nhiệm vụ và mô phỏng.
Vera sử dụng 88 nhân Olympus tự thiết kế bởi Nvidia, kết hợp bộ nhớ LPDDR5X băng thông cao, đạt tối đa 1,2TB/s. Nvidia cho biết, với các tải như AI đại lý, học tăng cường và xử lý dữ liệu, Vera hoàn thành tác vụ nhanh tối đa 1,8 lần so với CPU x86.
Với SpaceXAI, giá trị của Vera không chỉ dừng ở cải thiện hiệu suất CPU.
Trong quá trình vận hành AI đại lý, nhiều tác vụ diễn ra giữa các lần suy diễn GPU, ví dụ thực thi mã, xử lý dữ liệu, gọi công cụ, điều phối đại lý khác. Nếu CPU xử lý không đủ nhanh, GPU sẽ phải chờ đợi, làm giảm hiệu suất toàn nhà máy AI.
Vì vậy, SpaceXAI muốn dùng Vera “gánh” những tác vụ ngoài mô hình cho CPU, để GPU tập trung hơn vào huấn luyện và suy diễn mô hình, từ đó nâng hiệu quả toàn hệ thống.
Đồng thời SpaceXAI cũng dự định mở rộng hạ tầng Grok AI dựa trên Vera Rubin lên quy mô nhiều GW; tiến xa hơn, công ty còn dự kiến triển khai Vera Rubin NVL72 bản tối ưu cho vệ tinh Starmind AI thế hệ đầu tiên.
Điều đó nghĩa là hệ sinh thái tăng tốc tính toán của Nvidia đang mở rộng từ trung tâm dữ liệu trên mặt đất lên tận quỹ đạo.
Từ “chatbot” đến “thực thi tự chủ”, nhu cầu tính toán AI đang chuyển hướng
Từ việc Groq 3 LPX sản xuất hàng loạt, Vera Rubin công bố 30 lần thông lượng mỗi MW, đến SpaceXAI mở rộng Vera Rubin lên vệ tinh Starmind, thông tin liên tiếp Nvidia công bố đều chỉ về cùng một xu hướng: Ứng dụng AI đang chuyển từ sinh nội dung sang thực thi tác vụ tự chủ.
Trong trò chuyện hoặc tóm tắt, người dùng chỉ cần mô hình trả về đoạn văn bản nhanh; còn với AI đại lý, mô hình cần suy diễn liên tục, gọi công cụ, thực thi code, truy cập dữ liệu ngoài và kiểm tra kết quả lặp đi lặp lại.
Điều này đồng nghĩa các chỉ tiêu cốt lõi của hạ tầng AI trong tương lai cũng sẽ thay đổi – từ chú trọng “huấn luyện mô hình lớn hơn”, dần chuyển thành chú ý vào số Token sinh ra trên mỗi đơn vị điện, chi phí để hoàn thành tác vụ, và thời gian để một đại lý hoàn thành nhiệm vụ phức tạp.
Lần này Nvidia tích hợp Groq 3 LPX, Vera CPU và Rubin GPU trong cùng một hệ nhà máy AI, chính là để thích ứng với sự thay đổi này và tái thiết kế hạ tầng.
Còn SpaceXAI đã mở ra một hướng ứng dụng sáng tạo hơn: Nếu hệ thống này có thể kéo dài từ trung tâm dữ liệu mặt đất tới vận hành ngoài quỹ đạo, thì biên giới của AI computing cũng không còn gói gọn trong các trung tâm dữ liệu truyền thống.
Tuyên bố miễn trừ trách nhiệm: Mọi thông tin trong bài viết đều thể hiện quan điểm của tác giả và không liên quan đến nền tảng. Bài viết này không nhằm mục đích tham khảo để đưa ra quyết định đầu tư.
Bạn cũng có thể thích
Robot của Xiaopeng hoàn thành vòng gọi vốn đầu tiên 900 triệu USD, định giá đạt 6,3 tỷ USD lập kỷ lục mới, nhưng lỗ ròng quý II tăng gần 1,8 lần so với cùng kỳ năm ngoái
Vòng gọi vốn do IDG Capital dẫn đầu, Tencent và Alibaba tham gia với vai trò nhà đầu tư chiến lược. Đồng thời, công ty ghi nhận lỗ ròng 1,34 tỷ NDT trong quý II và dự báo cho quý III cũng thấp hơn kỳ vọng của thị trường, khiến giá cổ phiếu tại Mỹ giảm hơn 8%. Ban lãnh đạo xác định robot và Robotaxi là động lực cốt lõi để chuyển đổi thành công ty công nghệ AI vật lý, với mục tiêu đạt vận hành chở khách không cần nhân viên an toàn vào năm 2027, tuy nhiên thị trường vốn vẫn đang theo dõi và đánh giá triển vọng chuyển đổi này.
Bộ Tài chính Mỹ chuẩn bị sử dụng gần một nghìn tỷ USD từ tài khoản ngân khố? Bessent nhấn mạnh việc mua lại trái phiếu lần nữa vào ngày 9 tháng 9
Ngày 9 tháng 9 chính là thời điểm kế hoạch mua lại trái phiếu dài hạn tăng cường do Bộ Tài chính Hoa Kỳ công bố vào tuần trước bắt đầu có hiệu lực. Bessent tuần trước cho biết quy mô mua lại trong một lần có thể vượt quá 4 tỷ đô la Mỹ.
Cuộc gọi hội nghị Pinduoduo: Ti ếp tục tăng cường chuỗi cung ứng, thương hiệu tự sở hữu tiến triển chậm hơn dự kiến nhưng mục tiêu "tái tạo một Pinduoduo trong ba năm" không thay đổi
Ban lãnh đạo đã làm rõ trong cuộc họp qua điện thoại rằng trọng tâm chiến lược chuyển sang cải tổ sâu chuỗi cung ứng, chương trình "Hệ sinh thái trăm tỷ" sẽ mở rộng đến các vùng sản xuất nông nghiệp, cụm ngành công nghiệp và hạ tầng logistics; mặc dù mảng thương hiệu riêng phát triển chậm hơn kỳ vọng, nhưng vẫn là chiến lược cốt lõi của mục tiêu "Tái tạo PDD trong ba năm", tập trung vào các danh mục sản phẩm mạnh của nền tảng và hợp tác dài hạn với nhà sản xuất. Đối mặt với chính sách thuế mới của EU, mảng kinh doanh toàn cầu sẽ chuyển sang hỗ trợ các nhà bán hàng địa phương và hoàn thiện kho vận nhằm nâng cao khả năng chống chịu. Công ty nhấn mạnh kiên định với chủ nghĩa dài hạn, không theo đuổi quy mô ngắn hạn.
Hạ lãi suất trái phiếu Mỹ có thể phản tác dụng? Citadel cảnh báo Bộ Tài chính Mỹ rằng "kiềm chế tài chính" có thể làm suy yếu đồng đô la Mỹ và thúc đẩy lạm phát
Gần đây, Bộ Tài chính Mỹ đã mở rộng quy mô mua lại trái phiếu chính phủ dài hạn nhằm giảm chi phí tài trợ dài hạn, tuy nhiên động thái này đang gây ra cảnh báo về các tác động phụ tiềm ẩn từ các tổ chức phố Wall.

