奥特曼最后一战!4个月后,交付AGI

新智元报道
新智元报道

AGI已经有人宣布实现了。
就在本周三的财报电话会上,老黄撂下一句:
对于许多任务来说,我们可以说我们已经实现了AGI。

而同一天,一篇两个多小时的奥特曼长访谈也放了出来。他给的日期是2026年底。
对奥特曼来说,这4个月不只是一场技术冲刺。明年上市之前,他必须先把AGI这张牌打出来。
打不出来,等他敲钟的时候,前面已经站着一个先上市、市值高出一倍、还在盈利的对手。
这一仗,OpenAI退无可退。


那场电话会上有人问他,OpenAI这些公司这么玩命地追AGI,你怎么看。
老黄的回答是,这问题现在没什么好争的。整个行业连「智能」到底是什么都没谈拢,更别说拿哪把尺子去量AGI。
他手里握着的是另一样东西。
英伟达的AVO架构,在一项专门考「智能体能不能长时间自己干活」的测试ARC-AGI-3上,拿到了100%满分。
顺着这个成绩,他抛出了一个野心极大的预测:
在不久的将来,英伟达可能只需要维持4万名左右的人类员工,但他们将拥有40万,甚至400万名数字员工。


众所周知,ARC-AGI-3的玩法相当「不讲武德」。
把智能体直接扔进一个陌生游戏里,规则和目标一概不给,全靠自己按、自己看、自己猜。手里只有一块64×64的网格和几个按键,每个环境至少六关,第一关五步能过的,到第六关得走五十步。
人玩着都费劲,模型更没好到哪去。

关键在这儿:AVO用的模型,是Claude Opus 5。
然后英伟达给它套了个壳。权重一个参数没动,直接从30.16%跑到了满分。
在这里,真正起作用的是两样东西。
一是持久记忆,上下文满了记忆也不清零,智能体从当前状态接着干,不用把同样的坑再踩一遍。
二是监督器,它自己不干活,只在旁边盯着整条搜索轨迹,一发现原地打转就把主智能体拽向别的策略。

不过,严格来说,这张满分卷其实并不算数。
英伟达官宣三个多小时后,ARC-AGI之父François Chollet发推表示:
在公开演示集上拿到100%,不等于在ARC-AGI-3基准上拿到100%。这就好比说你通关了一款电子游戏,其实你只是清掉了新手教程关。
按ARC Prize自己的说明,公开集本来就不是用来打分的,真正算数的是半私有集和私有集,而AVO的成绩单上这两项都没有。

更微妙的是,这已经是六周内的第三张满分卷。
Tycho在7月底率先拿下,VISTA在8月5日又拿了一次,AVO是第三个。三家的解法完全不同,但驱动的模型清一色是Claude Opus 5。

宣布AGI的人越来越多,但能造AGI的,似乎还是那两家。
而这张牌,还没有人真正打出来。

在专访中,奥特曼信心十足:
到年底,OpenAI内部会出现一个他愿意称之为AGI的系统。
首席研究官Mark Chen则相对保守一些。在他看来,OpenAI距离AGI还差20%。
这话听着狂,但他们手里确实是有点东西的。

今年OpenAI内部定过一个非常明确的目标:造出一个可以真正干活的自动AI研究实习生。
而这个「AI自动化实习生」,就是Astra。
给Astra一个实验想法,它能在OpenAI的代码库里自己写代码、跑实验、交结果。
把一篇论文扔给它,Astra可以完成过去一名顶级人类研究员一周左右的工作量。


不久前的一场内部演示上,几十位大客户高管亲眼见了一回。
大屏幕上,16个AI智能体把一道研究级数学题拆成一堆子问题。
它们各自领活,中途互相核对,最后拼出一份完整的证明。
这完全看着,已经是一支配合默契的团队在开闭门会了。
第二个演示更震撼。
Astra打开常见的桌面软件,在不同应用之间来回横跳,建文件、改内容、调度任务,快得根本不像人在敲键盘。
看到的人无不感慨,Astra这次彻底打通了「持久化智能体」。
而奥特曼更是预言,「我预计这会是第一个真正发明出重要新东西的模型。这是非常AGI的一件事」。
注意「发明新东西」这个措辞,它的意思是凭空造出全人类目前还不知道的东西。


最近,OpenAI首颗自研芯片「墨西哥辣椒」(Jalapeño),直接把老黄的旗舰GPU按在地上摩擦。
这背后的头号功臣,正是GPT-Astra。
它直接上手,从电路设计一路干到软件。
芯片这头,下场优化了底层电路。软件那头,编写和优化了最底层的核心Kernel,并且还顺手把三大开源模型调校了一遍。
结果就是,BF16乘法器性能暴涨56%,矩阵单元面积反而缩小了10%。
「注意力机制」和「MoE」这两个核心模块,比人类专家手写的版本还要快1.5到1.8倍。
各位,AI这是在物理层面动电路啊。

有意思的是,英伟达那边干的是同一件事。
AVO压根不是为打游戏做的,它的主战场是给GPU写底层代码。
今年3月英伟达发过一篇论文,核心思路是把「改代码」这一步整个交给一个能自己干活的智能体。
实测里,它连续自主运行了7天,全程无人干预,探索超过500个优化方向,最终提交40个有效内核版本。
跑出来的核心代码,比英伟达自家闭源的版本最快3.5%,比业内最前沿的开源实现最快10.5%。


现在,把这两件事连起来看,奥特曼那句话就有底了。
每一次模型迭代,都要烧掉大量人类研究时间。但如果Astra开始接管这一环,整个研发速度就会发生质变。
这个循环一旦转起来,剩下的就是速度问题。

实际上,我们在外面能用到的GPT-5.6和Fable 5,都是上一轮的产物。
而爆料显示,两边真正的下一代,其实都已经练完了。

Spud(Sol):3月完成预训练,对应现在公开的GPT-5.5、5.6系列;
Doug:4到5月完成,在它上面继续做强化学习等后训练,就是即将登场的Astra,也就是外界口中的GPT-6;
Bel:8月刚刚结束预训练,总参数超过10万亿,规模接近当年的GPT-4.5。
爆料称,OpenAI内部把Bel视为「GPT-6之后的基础模型」,甚至有可能成为某个跨过AGI门槛的模型的基座。


Anthropic这边,有人在8月18日发现,Claude网页版上一部分选了Fable 5的账号,被悄悄切到了一个新模型上。
这是Anthropic发布前的老规矩,Fable 5自己当初也是这么灰度出来的。
紧接着代号被扒了出来。
claude-melon-eap,疑似是Fable 5.1;
claude-marshmallow-eap,疑似是Opus 5.1。
并且,两个新模型据称都已经在小范围跑起来,随时可以推给所有人。

至于为什么都压着不发,网友的分析是,谁先发,谁就会在几天后被对方盖过去。
尤其是Anthropic还被曝出,将在2027年初直接拿下领先位置。

这恰好把眼下这场战争的时间窗口圈了出来。
2026年剩下的4个月。
有机构做过测算,Anthropic有88%的概率先于OpenAI上市,最可能的日期是今年10月26日,而OpenAI最可能的日期是明年7月15日。
上市首日的市值预估,Anthropic 1.82万亿美元,OpenAI 1.06万亿美元。
OpenAI的CFO在8月的全员会上说,公司会在2027年或更早上市,前提是业务「继续拐头向上」。
所以年底那个AGI,就不只是一个技术里程碑。
它是招股书里最「关键」的一页。
交得出来,OpenAI的故事就从「我们烧钱做模型」变成「我们已经站到了终点线上」,估值逻辑整个换掉。交不出来,明年7月敲钟的时候,手里还是那个烧钱的故事。
而这一仗之所以非打不可,答案在递归自我改进这四个字里。
老黄那句「4万人指挥400万AI Agent」,OpenAI那句「AI已经在帮着造下一代AI」,讲的是同一件事:一旦AI能接管制造下一代AI的活,进步就不再是线性的了。
这就是为什么所有人都在赌,超级智能(ASI)这场竞赛,最后是赢家通吃。
第一个把这个循环真正转起来的玩家,会顺手拿走后面所有的东西。至于第二名,可能连追的资格都没有。
奥特曼身后,已经没有地方可退了。
编辑:摩西 桃子


免责声明:文章中的所有内容仅代表作者的观点,与本平台无关。用户不应以本文作为投资决策的参考。
你也可能喜欢
巴克莱拆解AI利润格局:模型公司每100美元收入,35-40美元流向云厂,为其带来10-20美元营业利润

对话Epoch Ventures创始人:大规模资金轮动已开启,四年周期已终结

对话Epoch Ventures创始人:大规模资金轮动已开启,四年周期已终结

Strive 高管:重新理解比特币的价格飞轮

