NVIDIA 宣布 Groq 3 LPX 全面投產,Vera Rubin 推理效率數倍提升 ,SpaceXAI 加碼智能體與太空 AI
英偉達表示,基於SemiAnalysis的AgentX工作負載,採用DeepSeek V4 Pro模型,Vera Rubin每兆瓦吞吐量最高達到上一代GB300 NVL72的30倍,每Token成本最高降低35倍。SpaceXAI將採用Vera CPU加速下一代智能體AI應用,並擴大基於Vera Rubin的平台建設,SpaceXAI計畫將優化版Vera Rubin NVL72延伸至太空,用於首代Starmind AI衛星。
英偉達正加速將AI基礎設施的競爭,從傳統的模型訓練和推理性能,推進到圍繞智能體AI(Agentic AI)的Token生成速度、能耗與成本展開的新階段。
美東時間24日週一,英偉達宣布面向互動式AI推理的Groq 3 LPX正式全面投產。作為Vera Rubin平台的重要組成部分,Groq 3 LPX主打超低延遲Token生成,英偉達稱,在Artificial Analysis測試中,搭載Gemma 4 31B模型、100,000 Token上下文時,Groq 3 LPX實現每秒3400個輸出Token,為該模型創下最高紀錄;針對智能體編程等低延遲工作負載,其響應速度最高達到最近競爭平台的4倍。
同時,英偉達公布Vera Rubin NVL72在真實智能體工作負載下的新測試結果:基於SemiAnalysis的AgentX工作負載、採用DeepSeek V4 Pro模型,Vera Rubin每兆瓦(MW)吞吐量最高達到上一代GB300 NVL72的30倍,每Token成本最高降低35倍。英偉達強調,智能體任務不同於傳統聊天或摘要,任務上下文會隨著數百個步驟不斷累積,甚至達到數十萬Token。

同一天,英偉達還宣布SpaceXAI將採用Vera CPU加速下一代智能體AI應用,並擴大基於Vera Rubin的平台建設,隨著其算力規模向數GW擴張;此外,SpaceXAI計畫將優化版Vera Rubin NVL72延伸至太空,用於首代Starmind AI衛星。
Groq 3 LPX全面投產,英偉達補齊智能體「最後一公里」
英偉達此次將Groq 3 LPX正式推向全面生產,核心目的並不是用專用推理晶片取代GPU,而是為Vera Rubin補充傳統GPU架構在低延遲Token生成方面的能力。
對於智能體而言,一次任務往往不再是「一問一答」:智能體需要讀取檔案、調用工具、執行程式碼、檢查結果,再根據結果繼續推理,可能循環數百甚至數千個步驟。在這一過程中,每一步Token生成的速度都會影響整個任務的完成時間。
英偉達稱,智能體AI因此帶來兩個不同的運算挑戰:一方面需要高效處理不斷增長的大規模上下文,另一方面需要以極低延遲持續生成Token。Vera Rubin NVL72負責更廣泛的訓練、推理以及上下文處理,而Groq 3 LPX則針對單用戶互動速度進行優化,提升Token生成速率。
英偉達最新測試顯示,Groq 3 LPX在Gemma 4 31B、100K上下文條件下達到3400個輸出Token/秒;在智能體任務和其他延遲敏感型工作負載中,響應速度最高達到最近競爭平台的4倍。英偉達稱,這種速度可以讓智能體更快完成程式碼編寫、測試、工具調用和結果驗證等連續任務。
商業化方面,AI雲服務商Nebius將成為首個採用Groq 3 LPX的雲廠商,並計劃將其部署到Nebius Token Factory生產推理平台。Groq也計劃成為該平台最早一批採用者之一。
這意味著,隨著Groq 3 LPX進入全面投產,英偉達先前收購Groq技術所形成的能力,開始真正嵌入Vera Rubin的數據中心產品體系。
30倍不是「速度」30倍,而是每兆瓦能完成更多智能體工作
相比3400 Token/秒這樣的單項性能指標,英偉達此次更值得關注的,是其對於每兆瓦吞吐量與Token成本的強調。
英偉達公布的測試數據顯示,在SemiAnalysis AgentX工作負載下,Vera Rubin NVL72每兆瓦吞吐量最高達到GB300 NVL72的30倍,對應每Token成本最高降低35倍。該測試使用真實的智能體程式軌跡,保留了實際的上下文增長、工具調用與子智能體生成等環節。

因此,每兆瓦吞吐量最高提升30倍只是AI推理效率大幅提升的一種體現,並不是單純意味著晶片的推理速度提高30倍。
這一指標對於AI數據中心的意義尤其突出。
傳統大模型服務更多關注單次請求的延遲和吞吐量,而智能體工作負載會持續消耗Token。英偉達引述OpenRouter數據稱,智能體AI工作負載消耗的Token數量可以達到簡單聊天請求的15倍。原因在於,一個智能體可能先查詢資料庫,再搜尋新聞和文件,調用子智能體進行分析,運行程式碼並反覆驗證,整個過程中上下文不斷累積。
這也使得AI基礎設施的經濟性開始出現新的衡量方式:同樣一兆瓦電力,到底能夠完成多少有效智能體任務?
對於電力和數據中心資源日益成為AI擴張瓶頸的背景而言,提高單位電力能夠產生的Token數量,可能比單純提高峰值算力更加重要。
Vera Rubin從「GPU平台」變成完整AI工廠
從架構來看,Groq 3 LPX並不是孤立的產品,而是英偉達Vera Rubin「極致協同設計」路線的一部分。

英偉達此前已經將Vera Rubin定義為面向智能體AI時代的AI工廠平台。整個系統並非單純由GPU組成,而是圍繞計算、網路、儲存和軟體進行協同設計,涵蓋Rubin GPU、Vera CPU、Groq 3 LPX、BlueField-4 DPU、Spectrum-6 SPX等不同元件。
其中,Rubin GPU承擔大規模訓練、推理以及上下文處理等任務;Groq 3 LPX負責高速Token生成;Vera CPU則處理智能體在模型調用之間產生的大量CPU密集型工作,包括工具編排、程式碼執行、資料處理和模擬。
英偉達此前公布的架構信息顯示,Vera Rubin平台通過七款晶片和五種專用機架進行協同設計,目的就是讓不同硬體分別承擔最適合自己的任務,而不是讓一類處理器包辦整個AI工作負載。
這意味著,英偉達正在把AI基礎設施從「GPU叢集」進一步升級為一個異質運算系統。
對於AI雲廠商而言,這種架構的意義在於,可以針對訓練、長上下文推理、Token生成、工具調用等不同階段進行資源配置,從而提高整座數據中心的利用率和經濟回報。
SpaceXAI加碼Vera:智能體AI從數據中心走向太空
就在Groq 3 LPX全面投產之際,SpaceXAI也宣布進一步採用英偉達Vera Rubin體系。
英偉達8月24日宣布,SpaceXAI將部署Vera CPU,用於下一代智能體AI應用。Vera專門針對模型推理之外的CPU工作負載進行設計,包括工具調用、程式碼執行、資料處理、任務編排和模擬。
Vera採用88顆英偉達自主設計的Olympus核心,並配備高頻寬LPDDR5X記憶體,頻寬最高達到1.2TB/s。英偉達稱,在智能體AI、強化學習和資料處理等工作負載中,Vera任務完成速度最高可達到x86 CPU的1.8倍。
對於SpaceXAI而言,Vera的價值並不僅在於提升CPU效能。
智能體運行過程中,大量任務發生在GPU推理之間,例如執行程式碼、處理資料、調用工具與協調不同智能體。如果這些任務由CPU處理速度不足,就可能導致GPU等待,從而降低整個AI工廠的利用率。
因此,SpaceXAI希望利用Vera處理這些「模型之外」的工作,讓GPU更多地專注於模型訓練與推理,從而提升整個系統的效率。
SpaceXAI同時計畫擴大基於Vera Rubin的Grok AI基礎設施,隨著運算能力向數GW規模擴張;更進一步,該公司還計畫將優化版Vera Rubin NVL72用於首代Starmind AI衛星。
這意味著英偉達的加速運算體系正在從地面數據中心向軌道運算延伸。
從「聊天機器人」到「自主執行」,AI算力需求正在換檔
從Groq 3 LPX全面投產,到Vera Rubin公布30倍每兆瓦吞吐量,再到SpaceXAI將Vera Rubin延伸至Starmind衛星,英偉達此次連續釋放的信息背後,指向的是同一個變化:AI應用正在從生成內容走向自主完成任務。
在聊天和摘要場景中,使用者往往只需要模型快速給出一段文字;而在智能體場景中,模型需要持續推理、調用工具、執行程式碼、存取外部資料並不斷驗證結果。
這意味著,未來AI基礎設施的核心指標也可能發生變化——從過去關注「訓練一個更大的模型」,逐漸轉向關注單位電力能夠產生多少有效Token、單位成本能完成多少任務,以及智能體完成一項複雜任務究竟需要多長時間。
英偉達此次把Groq 3 LPX、Vera CPU和Rubin GPU放進同一套AI工廠體系,正是在針對這一變化重新設計基礎設施。
而SpaceXAI則提供了一個更具想像力的應用方向:如果這套體系最終能夠從地面數據中心延伸到軌道,AI運算的邊界也將不再侷限於傳統的數據中心機房。
免責聲明:文章中的所有內容僅代表作者的觀點,與本平台無關。用戶不應以本文作為投資決策的參考。
您也可能喜歡
華爾街集體「潑冷水」 美國財政部擴大債券回購難壓長期收益率 高盛稱無法解決拋售根源
華爾街多家大型金融機構認為,美國財政部近期擴大長期國債回購規模能夠改善市場流動性,並在短期內緩解長端美債拋售壓力,但很難從根本上扭轉長期收益率上升趨勢。

