L’ultima battaglia di Altman! Consegna di AGI dopo 4 mesi

Report di Nuova Intelligenza
Report di Nuova Intelligenza

Qualcuno ha già dichiarato di aver realizzato l'AGI.
Proprio questa settimana, durante la conference call sui risultati finanziari di mercoledì, Huang ha affermato:
Per molti compiti, possiamo dire di aver già raggiunto l'AGI.

Nello stesso giorno, è stata pubblicata anche un'intervista fiume di oltre due ore ad Altman. La sua previsione è fine 2026.
Per Altman, questi 4 mesi non sono solo una corsa tecnologica. Prima della quotazione del prossimo anno, deve giocare la carta AGI.
Se non ci riesce, quando suonerà la campanella, davanti a lui ci sarà già un concorrente quotato, che vale il doppio e produce profitti.
Questa battaglia, OpenAI non può più arretrare.


Durante quella call, qualcuno gli ha chiesto cosa ne pensa del fatto che società come OpenAI rincorrano così disperatamente l’AGI.
La risposta di Huang è stata che non c’è più molto da discutere sulla questione. L’intero settore non ha ancora concordato su cosa sia l’“intelligenza”, figuriamoci su quale metro di misura serva per valutare l’AGI.
Ma ciò che ha in mano è qualcos’altro.
L’architettura AVO di NVIDIA ha ottenuto il 100% pieno punteggio in un test specifico ARC-AGI-3 che valuta la “capacità degli agenti di svolgere attività autonomamente a lungo termine”.
Partendo da questo risultato, Huang ha fatto una previsione molto ambiziosa:
In un futuro prossimo, NVIDIA potrebbe aver bisogno soltanto di circa 40.000 dipendenti umani, ma disporrà di 400.000, o perfino 4 milioni di dipendenti digitali.


È risaputo che il test ARC-AGI-3 è piuttosto “senza scrupoli”.
L’agente viene lanciato direttamente in un gioco sconosciuto, senza regole o obiettivi dichiarati, e deve affidarsi solo alle proprie azioni e osservazioni. Ha solo una griglia 64×64 e pochi tasti, con almeno sei livelli per ogni ambiente: il primo si supera in cinque mosse, ma per il sesto ne servono almeno cinquanta.
Giocare è difficile anche per le persone, figuriamoci per i modelli.

La chiave è questa: il modello usato da AVO è Claude Opus 5.
Poi NVIDIA ci ha incapsulato un guscio sopra. Senza modificare alcun parametro, la prestazione è passata dal 30,16% al 100%.
Qui, le vere differenze sono due.
Primo, la memoria persistente: anche quando il contesto è pieno, la memoria non si azzera e l’agente può continuare dal punto dove si era fermato, senza ripetere gli stessi errori.
Secondo, il supervisore: non lavora attivamente, ma controlla l’intero percorso di ricerca e, se rileva che si sta girando in tondo, indirizza l’agente verso un’altra strategia.

Tuttavia, a rigor di termini, quel cento per cento non conta realmente come risultato.
Poco dopo l’annuncio di NVIDIA, François Chollet, padre di ARC-AGI, ha twittato:
Ottenere il 100% sul dataset pubblico non equivale a raggiungere il 100% sul benchmark ARC-AGI-3. È come dire di aver finito un videogioco solo dopo aver completato il tutorial.
Secondo la documentazione di ARC Prize, il set pubblico non serve per la valutazione ufficiale: ciò che conta sono il set semi-privato e quello privato, per cui sul report di AVO non compaiono risultati.

La cosa curiosa è che questo è il terzo pieno punteggio nelle ultime sei settimane.
Tycho fu il primo a riuscirci a fine luglio, seguito da VISTA il 5 agosto, e ora AVO è la terza. Le soluzioni sono completamente diverse, ma il modello di base è sempre Claude Opus 5.

Sono sempre di più coloro che dichiarano di aver raggiunto l’AGI, ma chi davvero può crearla sembrano essere ancora quelle due aziende.
Eppure, quella carta AGI non è ancora stata realmente giocata da nessuno.

Nell’intervista esclusiva, Altman si mostra assolutamente sicuro:
Entro la fine dell'anno, secondo lui OpenAI avrà internamente un sistema a cui sarà disposto ad attribuire il titolo di AGI.
Il Chief Research Officer Mark Chen è invece più cauto. Secondo lui, OpenAI è ancora distante del 20% dall’AGI.
Sembra presuntuoso, ma effettivamente hanno qualcosa di concreto in mano.

Quest’anno, all’interno di OpenAI è stato fissato un obiettivo molto chiaro: costruire un vero tirocinante AI automatico per la ricerca.
Questo “tirocinante AI automatizzato” è Astra.
Fornendo ad Astra un’idea di esperimento, è in grado di scrivere codice, eseguire esperimenti e restituire i risultati nel codice base di OpenAI.
Lanciando un articolo, Astra può svolgere in poco tempo il lavoro che solitamente occupa circa una settimana a un top researcher umano.


In una recente demo interna, decine di dirigenti di grandi clienti hanno potuto assistere in diretta.
Sul grande schermo, 16 agenti AI hanno scomposto un problema di matematica di livello ricerca in una serie di sottoproblemi.
Ognuno di loro si è occupato di una parte, hanno fatto controlli incrociati, e alla fine hanno assemblato una dimostrazione completa.
Era un vero e proprio team che lavora insieme in perfetta coordinazione a porte chiuse.
Il secondo demo è stato ancora più impressionante.
Astra ha aperto i più comuni software da desktop, ha navigato rapidamente tra diverse applicazioni, creato file, modificato contenuti, gestito compiti, a velocità decisamente sovrumane.
Chi era presente ha convenuto che Astra ha realmente sdoganato il concetto di “agente persistente”.
Altman addirittura prevede: “Penso sarà il primo modello a inventare davvero qualcosa di nuovo. E questa è una vera caratteristica dell’AGI”.
Attenzione all'espressione “inventare qualcosa di nuovo”, significa creare dal nulla qualcosa che l’umanità ancora non conosce.


Recentemente, il primo chip progettato da OpenAI, “Peperoncino Jalapeño”, ha surclassato la GPU di punta di NVIDIA.
Il merito principale è di GPT-Astra.
Astra si è occupata di tutto, dal design dei circuiti al software.
Lavorando sull’hardware, ha ottimizzato i circuiti base; lato software, ha programmato e ottimizzato i kernel core, intervenendo anche sull’fine tuning dei tre principali modelli open source.
Il risultato: le performance dei moltiplicatori BF16 sono salite del 56%, mentre l’area di ogni cella di matrice si è ridotta del 10%.
I due moduli chiave, “meccanismo di attenzione” e “MoE”, sono tra 1,5 e 1,8 volte più rapidi delle versioni scritte dagli esperti umani.
Un AI che interviene persino nel design fisico dei circuiti!

Ed è curioso che anche NVIDIA stia facendo lo stesso.
AVO non è stato affatto creato per giocare: il suo campo di battaglia è scrivere codice di basso livello per GPU.
A marzo di quest’anno NVIDIA ha pubblicato un paper la cui idea di fondo era: “lasciamo che sia un agente automatico a correggere il codice”.
Nei test, l’agente ha lavorato autonomamente per 7 giorni senza alcun intervento umano, esplorando più di 500 vie di ottimizzazione e proponendo infine 40 versioni efficienti del kernel.
Il codice prodotto, rispetto alle soluzioni proprietarie NVIDIA, è il 3,5% più veloce, e batte gli implementativi open source più avanzati del 10,5%.


Guardando insieme questi due casi, la frase di Altman acquista più senso.
Ogni iterazione di modello richiede un enorme investimento di tempo umano in ricerca; se Astra iniziasse a gestire questa fase, la velocità di sviluppo si impennerebbe.
Una volta innescato questo ciclo, a fare la differenza sarà solo la velocità.

In realtà, GPT-5.6 e Fable 5 che possiamo usare oggi sono già prodotti della scorsa generazione.
Ma secondo i rumor, le vere prossime generazioni di entrambe le aziende sono già pronte.

Spud (Sol): pre-training concluso a marzo, corrisponde agli attuali GPT-5.5 e 5.6 pubblici;
Doug: concluso tra aprile e maggio, seguito da fine-tuning e reinforcement learning, è l’imminente Astra, chiamato da molti GPT-6;
Bel: pre-training concluso da poco in agosto, con oltre 10.000 miliardi di parametri, praticamente la dimensione del GPT-4.5.
Secondo le indiscrezioni, internamente OpenAI considera Bel “il modello base post-GPT-6”, ed è possibile che sia la piattaforma per il modello che supererà realmente la soglia AGI.


In Anthropic, il 18 agosto qualcuno ha scoperto che alcuni account della versione web di Claude, impostati su Fable 5, erano stati migrati silenziosamente a un nuovo modello.
Questa è la consuetudine di Anthropic prima di un rilascio ufficiale: anche Fable 5 era uscito in questo modo.
Poco dopo sono stati scoperti i nuovi codici interni.
claude-melon-eap, apparentemente Fable 5.1;
claude-marshmallow-eap, apparentemente Opus 5.1.
Entrambi i nuovi modelli, a quanto pare, sono già in esecuzione limitata e pronti per il rilascio globale.

Quanto al motivo per cui nessuno pubblica per primo, gli utenti pensano che chi esce prima verrebbe subito “sorpassato” dagli altri.
Soprattutto considerando che Anthropic secondo i leak potrebbe conquistare il vertice nel primo 2027.

Questa situazione identifica esattamente la finestra temporale della guerra attuale.
I 4 mesi che restano del 2026.
Secondo alcune analisi, Anthropic ha l’88% di probabilità di quotarsi prima di OpenAI, con data più probabile il 26 ottobre di quest’anno, mentre per OpenAI la data stimata è il 15 luglio del prossimo anno.
Per la stima della capitalizzazione il primo giorno: Anthropic 1.820 miliardi di dollari, OpenAI 1.060 miliardi.
In un meeting aziendale di agosto, il CFO di OpenAI ha affermato che l’IPO arriverà nel 2027 o prima, purché il business “continui a crescere”.
Quindi l’AGI di fine anno non è solo una pietra miliare tecnologica.
È la pagina più “cruciale” nel prospetto IPO.
Se ce la fanno, la storia di OpenAI cambia da “stiamo bruciando denaro per sviluppare” a “siamo già al traguardo”: cambiano tutti i criteri di valutazione. Se non ce la fanno, anche a luglio prossimo alla campanella resterà lo storytelling del “denaro che brucia”.
Questa partita è inevitabile e la ragione sta nella “auto-miglioramento ricorsivo”.
La frase di Huang (“40.000 persone che comandano 4 milioni di Agent AI”) e quella di OpenAI (“l’AI già aiuta a creare la prossima AI”) raccontano la stessa storia: una volta che un’AI potrà occuparsi della creazione della sua generazione successiva, il progresso non sarà più lineare.
Ecco perché tutti scommettono che nella corsa alla superintelligenza (ASI) il vincitore prende tutto.
Il primo a far girare davvero questo ciclo si porterà a casa tutto. Il secondo potrebbe non avere nemmeno la chance di recuperare.
Alle spalle di Altman, non ci sono più vie di fuga.
Editor: Mosè, Momoko


Esclusione di responsabilità: il contenuto di questo articolo riflette esclusivamente l’opinione dell’autore e non rappresenta in alcun modo la piattaforma. Questo articolo non deve essere utilizzato come riferimento per prendere decisioni di investimento.
Ti potrebbe interessare anche
Perché un anello AI può valere 16 miliardi di dollari?

Cosa farà la Fed? Walsh dà la risposta!

GTA 6 porta opportunità di investimento!?


