Bitget App
Trade smarter
Acquista CryptoMercatiTradingPerpsEarnAIPlazaAltro
Nvidia annuncia la produzione completa di Groq 3 LPX, l'efficienza di inferenza di Vera Rubin aumenta di diverse volte, SpaceXAI investe maggiormente negli agenti intelligenti e nell'intelligenza artificiale spaziale

Nvidia annuncia la produzione completa di Groq 3 LPX, l'efficienza di inferenza di Vera Rubin aumenta di diverse volte, SpaceXAI investe maggiormente negli agenti intelligenti e nell'intelligenza artificiale spaziale

华尔街见闻华尔街见闻2026/08/24 17:01
Mostra l'originale
Per:华尔街见闻

Nvidia ha dichiarato che, basandosi sul carico di lavoro AgentX di SemiAnalysis e impiegando il modello DeepSeek V4 Pro, Vera Rubin raggiunge una capacità di throughput per megawatt fino a 30 volte superiore rispetto alla precedente generazione GB300 NVL72, con una riduzione del costo per token fino a 35 volte. SpaceXAI adotterà la CPU Vera per accelerare le applicazioni AI di nuova generazione basate su agenti intelligenti e amplierà lo sviluppo di piattaforme basate su Vera Rubin. SpaceXAI prevede inoltre di estendere la versione ottimizzata Vera Rubin NVL72 nello spazio, utilizzandola per il primo satellite Starmind AI.

Nvidia sta accelerando la competizione nell’infrastruttura AI, passando dalla tradizionale prestazione nel training e inferenza dei modelli a una nuova fase incentrata sulla velocità di generazione dei Token, il consumo energetico e i costi nell’ambito dell’Agentic AI.

Lunedì 24, ora della East Coast degli Stati Uniti, Nvidia ha annunciato la piena produzione del Groq 3 LPX, progettato per l’inferenza AI interattiva. Come componente chiave della piattaforma Vera Rubin, Groq 3 LPX è specializzato nella generazione di Token a bassissima latenza. Nvidia afferma che, nei test Artificial Analysis, equipaggiato con il modello Gemma 4 31B e con un contesto di 100.000 Token, Groq 3 LPX ottiene 3.400 Token generati al secondo, stabilendo un nuovo record per questo modello; in carichi di lavoro a bassa latenza come la programmazione agentica, la sua velocità di risposta raggiunge fino a 4 volte quella delle piattaforme concorrenti più recenti.

Contemporaneamente, Nvidia ha pubblicato i nuovi risultati dei test di Vera Rubin NVL72 su carichi reali di lavoro agentici: con il carico di lavoro AgentX di SemiAnalysis e il modello DeepSeek V4 Pro, Vera Rubin raggiunge una produttività massima per megawatt (MW) pari a 30 volte quella della generazione precedente GB300 NVL72 e riduce il costo per Token fino a 35 volte. Nvidia sottolinea che i compiti degli agenti differiscono dalle tradizionali chat o attività di sintesi, poiché il contesto della missione si accumula per centinaia di passaggi, arrivando anche a centinaia di migliaia di Token.

Nvidia annuncia la produzione completa di Groq 3 LPX, l'efficienza di inferenza di Vera Rubin aumenta di diverse volte, SpaceXAI investe maggiormente negli agenti intelligenti e nell'intelligenza artificiale spaziale image 0

Nello stesso giorno, Nvidia ha anche annunciato che SpaceXAI adotterà la CPU Vera per accelerare le prossime applicazioni di Agentic AI ed espanderà ulteriormente la costruzione della piattaforma basata su Vera Rubin, facendo crescere il proprio potenziale di calcolo fino a raggiungere diversi GW; inoltre, SpaceXAI prevede di estendere l’edizione ottimizzata Vera Rubin NVL72 nello spazio, a bordo del primo satellite Starmind AI.

Groq 3 LPX in piena produzione: Nvidia completa “l’ultimo miglio” degli agenti

Il lancio in produzione del Groq 3 LPX da parte di Nvidia non mira a sostituire la GPU con chip di inferenza dedicati, ma a potenziare le capacità della Vera Rubin nella generazione di Token a bassa latenza rispetto alla tipica architettura GPU.

Per gli agenti, un task non è più una semplice “domanda e risposta”: l’agente deve leggere file, richiamare strumenti, eseguire codice, verificare i risultati e quindi proseguire l’inferenza in base agli esiti, spesso ripetendo centinaia o migliaia di passaggi. Durante questo processo, la velocità di generazione di ogni Token influenza il tempo di completamento dell’intero compito.

Nvidia afferma che l’Agentic AI introduce due sfide computazionali: da una parte gestire efficientemente contesti di grandi dimensioni in crescita continua, dall’altra generare Token a una latenza estremamente bassa. Vera Rubin NVL72 gestisce le attività di addestramento, inferenza e contesti, mentre Groq 3 LPX è ottimizzato per la velocità di interazione singolo utente, accelerando la generazione dei Token.

Nei test più recenti, Groq 3 LPX raggiunge i 3400 Token al secondo con Gemma 4 31B e un contesto di 100K; nei carichi di lavoro agentici e altre attività sensibili alla latenza, la velocità di risposta raggiunge fino a 4 volte quella delle ultime piattaforme concorrenti. Nvidia sottolinea come questa velocità renda possibile agli agenti completare più rapidamente compiti continuativi come scrittura di codice, test, invocazione di strumenti e validazione dei risultati.

Sul fronte commerciale, il cloud provider AI Nebius sarà il primo a implementare Groq 3 LPX, pianificando il deployment sulla propria piattaforma di inferenza Nebius Token Factory. Anche Groq prevede di essere tra i primi utilizzatori della piattaforma.

Ciò significa che, con l’entrata in produzione di Groq 3 LPX, le tecnologie acquisite da Nvidia tramite l’acquisizione di Groq saranno effettivamente integrate nell’ecosistema di prodotti data center Vera Rubin.

30 volte non significa 30 volte la “velocità”, bensì più compiti agentici completati per megawatt

Rispetto al dato sulla velocità di 3.400 Token/secondo, l’aspetto più interessante è l’enfasi sui Token per megawatt e sui costi per Token da parte di Nvidia.

Secondo i test pubblicati, su carichi di lavoro AgentX di SemiAnalysis, Vera Rubin NVL72 offre una produttività massima fino a 30 volte superiore rispetto a GB300 NVL72, con una riduzione dei costi per Token fino a 35 volte. Il test si basa su vere tracce di programmazione agentica, mantenendo le dinamiche di crescita del contesto, invocazione di strumenti e generazione di sub-agent.

Nvidia annuncia la produzione completa di Groq 3 LPX, l'efficienza di inferenza di Vera Rubin aumenta di diverse volte, SpaceXAI investe maggiormente negli agenti intelligenti e nell'intelligenza artificiale spaziale image 1

Perciò, l’incremento di 30 volte nella produttività per megawatt è una misura dell’efficienza dell’inferenza AI, non indica semplicemente che la velocità dei chip sia aumentata di 30 volte.

Questo parametro è particolarmente rilevante per i data center AI.

I servizi tradizionali di large model si concentravano su latenza e throughput delle singole richieste, mentre nei carichi di agenti il consumo di Token è continuo. Nvidia cita dati OpenRouter secondo cui il carico di lavoro degli agenti può consumare 15 volte più Token rispetto a una semplice richiesta di chat. Un agente può, ad esempio, interrogare un database, cercare notizie e file, richiamare sub-agent, eseguire codice e verificare iterativamente, con un contesto che si accumula incessantemente.

Ciò introduce un nuovo modo di valutare la convenienza economica delle infrastrutture AI: quanti compiti agentici efficaci possono essere completati con lo stesso megawatt di energia?

In un’epoca in cui energia e risorse di data center sono sempre più il fattore limitante della crescita AI, massimizzare la produzione di Token per unità di energia potrebbe essere più importante dell’aumento puro della compute peak.

Da “piattaforma GPU” a vera AI factory: l’evoluzione di Vera Rubin

Da un punto di vista architetturale, Groq 3 LPX non è un prodotto isolato, ma parte integrante dell’approccio “extreme co-design” di Nvidia per Vera Rubin.

Nvidia annuncia la produzione completa di Groq 3 LPX, l'efficienza di inferenza di Vera Rubin aumenta di diverse volte, SpaceXAI investe maggiormente negli agenti intelligenti e nell'intelligenza artificiale spaziale image 2

Nvidia aveva già definito Vera Rubin come piattaforma AI factory per l’era Agentic AI. L’intero sistema non è solo basato su GPU, ma si presenta come una progettazione coordinata di computing, networking, storage e software, che include componenti come Rubin GPU, Vera CPU, Groq 3 LPX, BlueField-4 DPU e Spectrum-6 SPX.

Rubin GPU svolge i compiti di training su larga scala, inferenza ed elaborazione del contesto; Groq 3 LPX si occupa della generazione ad altissima velocità dei Token; Vera CPU gestisce i carichi di lavoro intensivi della CPU che emergono tra le chiamate di modello — come orchestrazione degli strumenti, esecuzione di codice, data processing e simulazione.

Informazioni architetturali precedenti hanno evidenziato che la piattaforma Vera Rubin si basa su sette chip e cinque tipi di rack specializzati, progettando la collaborazione tra hardware differenti per allocare a ciascuno le mansioni più idonee invece di affidare l’intero carico di lavoro AI a una sola classe di processori.

Ciò significa che Nvidia sta portando l’infrastruttura AI dal semplice “cluster di GPU” a un sistema di calcolo eterogeneo.

Per i provider AI cloud, questo approccio permette di allocare le risorse per training, inferenza di lungo contesto, generazione di Token e chiamate di strumenti nei diversi stadi, massimizzando l’utilizzo e il ritorno economico di tutto il data center.

SpaceXAI rafforza la partnership con Vera: Agentic AI dal data center allo spazio

Nell’occasione della produzione in massa di Groq 3 LPX, SpaceXAI annuncia di adottare ulteriormente il sistema Vera Rubin di Nvidia.

Il 24 agosto, Nvidia ha annunciato che SpaceXAI utilizzerà la CPU Vera per le nuove applicazioni Agentic AI. Vera è ottimizzata specificamente per i carichi di lavoro della CPU diversi dall’inferenza dei modelli, incluse chiamate di strumenti, esecuzione del codice, trattamento dei dati, orchestrazione delle attività e simulazione.

Vera impiega 88 core Olympus progettati internamente da Nvidia e memoria LPDDR5X a larghezza di banda elevata, fino a 1,2 TB/s. Secondo Nvidia, nei carichi di lavoro come Agentic AI, reinforcement learning e data processing, Vera può raggiungere velocità fino a 1,8 volte superiori rispetto alle CPU x86.

Per SpaceXAI, il valore di Vera non si esaurisce nel miglioramento della prestazione CPU.

Nel runtime degli agenti, molte attività si verificano tra le inferenze GPU: esecuzione di codice, data processing, chiamate di strumenti, coordinamento di agenti. Se queste attività sono rallentate da CPU inefficaci, si rischia che la GPU resti in attesa, compromettendo così l’efficienza dell’intera AI factory.

SpaceXAI mira dunque a impiegare Vera per gestire questi compiti “off-modello”, lasciando alle GPU il focus su training e inferenza, per aumentare l’efficienza dell’intero sistema.

SpaceXAI ha poi intenzione di ampliare la propria infrastruttura AI Grok basata su Vera Rubin, facendo crescere la capacità di calcolo fino a diversi GW; inoltre, pianifica di utilizzare una versione ottimizzata di Vera Rubin NVL72 sul suo primo satellite Starmind AI.

Tutto ciò significa che il sistema di calcolo accelerato di Nvidia si sta estendendo dai data center terrestri al calcolo orbitale.

Dai “chatbot” all’“esecuzione autonoma”: cambia la domanda di calcolo AI

Dalla produzione in massa di Groq 3 LPX, all’annuncio del throughput 30 volte maggiore per MW di Vera Rubin, fino all’estensione di Vera Rubin da parte di SpaceXAI ai satelliti Starmind, tutte le novità annunciate da Nvidia riflettono la stessa tendenza: le applicazioni AI stanno passando dalla generazione di contenuti all’esecuzione autonoma dei compiti.

Negli scenari di chat e sintesi, agli utenti basta una risposta testuale rapida dal modello; negli scenari agentici, il modello deve dedurre in modo continuo, richiamare strumenti, eseguire codice, accedere a dati esterni e convalidare ciclicamente i risultati.

Questo significa che anche gli indicatori chiave delle infrastrutture AI stanno cambiando — si passa da “allenare un modello più grande” a quanti Token efficaci produce l’unità di energia, quante attività può completare l’unità di costo e quanto tempo serve a un agente per portare a termine una task complessa.

L’inserimento da parte di Nvidia di Groq 3 LPX, Vera CPU e Rubin GPU in un unico sistema AI factory rappresenta un redesign delle infrastrutture dettato da questo nuovo paradigma.

SpaceXAI mostra inoltre una direzione ancor più visionaria: con questa architettura estesa dall’ambiente terrestre al settore orbitale, i confini del calcolo AI non saranno più limitati alle tradizionali server room dei data center.

0
0

Esclusione di responsabilità: il contenuto di questo articolo riflette esclusivamente l’opinione dell’autore e non rappresenta in alcun modo la piattaforma. Questo articolo non deve essere utilizzato come riferimento per prendere decisioni di investimento.

PoolX: Blocca per guadagnare
Almeno il 12% di APR. Sempre disponibile, ottieni sempre un airdrop.
Blocca ora!

Ti potrebbe interessare anche

Xpeng Robotics raccoglie 900 milioni di dollari nella prima tornata di finanziamenti, la valutazione raggiunge i 6,3 miliardi di dollari stabilendo un nuovo record, ma la perdita netta del secondo trimestre si amplia di quasi 1,8 volte su base annua

Il finanziamento è guidato da IDG Capital, con la partecipazione strategica di Tencent e Alibaba. Nel frattempo, la società ha registrato una perdita netta di 1,34 miliardi di yuan nel secondo trimestre e anche le previsioni per il terzo trimestre sono inferiori alle aspettative del mercato, portando il titolo quotato negli Stati Uniti a perdere oltre l’8%. Il management identifica i robot e il Robotaxi come motori chiave per la trasformazione in un’azienda tecnologica AI fisica e ha fissato come obiettivo il 2027 per l’operatività senza personale di sicurezza a bordo; tuttavia, i mercati finanziari rimangono prudenti sul futuro di questa trasformazione.

华尔街见闻2026/08/24 21:31

Il Tesoro degli Stati Uniti sta per utilizzare quasi mille miliardi dal conto del Tesoro? Bessent sottolinea il riacquisto di obbligazioni il 9 settembre

Il 9 settembre è il giorno in cui entra in vigore il piano rafforzato di riacquisto di titoli di stato a lungo termine annunciato la scorsa settimana dal Dipartimento del Tesoro degli Stati Uniti. Bessent ha dichiarato la settimana scorsa che la dimensione di un singolo riacquisto potrebbe superare i 4 miliardi di dollari.

华尔街见闻2026/08/24 19:21

Conference call di Pinduoduo: investimento continuo nella catena di fornitura, lo sviluppo dei marchi propri procede più lentamente del previsto, ma l'obiettivo di "ricreare un altro Pinduoduo in tre anni" rimane invariato.

La dirigenza ha chiarito durante la conference call che la priorità strategica si è spostata verso una profonda trasformazione della catena di approvvigionamento, estendendo l’iniziativa “ecosistema da dieci miliardi” alle aree agricole, ai cluster industriali e alle infrastrutture logistiche. Sebbene lo sviluppo del marchio proprio proceda più lentamente del previsto, rimane una strategia centrale per il “rilancio di PDD in tre anni” e sarà focalizzato sulle categorie di punta della piattaforma e su una collaborazione a lungo termine con i produttori. Di fronte alle nuove regole sui dazi dell’UE, il business globale si sta orientando verso commercianti locali e una gestione logistica basata su magazzini locali per rafforzare la resilienza. L’azienda sottolinea il suo impegno verso una visione di lungo termine, senza inseguire obiettivi di crescita a breve termine.

华尔街见闻2026/08/24 16:21

Abbassare i rendimenti dei titoli di Stato USA potrebbe essere controproducente? Citadel avverte il Tesoro USA che la “repressione finanziaria” potrebbe indebolire il dollaro e alimentare l’inflazione

Recentemente il Dipartimento del Tesoro degli Stati Uniti ha abbassato i costi di finanziamento a lungo termine ampliando il programma di riacquisto di titoli di Stato a lunga scadenza, ma questa strategia sta suscitando avvertimenti da parte delle istituzioni di Wall Street riguardo a possibili effetti collaterali.

智通财经2026/08/24 16:16
Abbassare i rendimenti dei titoli di Stato USA potrebbe essere controproducente? Citadel avverte il Tesoro USA che la “repressione finanziaria” potrebbe indebolire il dollaro e alimentare l’inflazione