9 月 3 日下午,闭门媒体沟通会临近尾声时,OpenAI 总裁 Greg Brockman 表示:
欢迎来到 AGI 时代。
有记者追问:这是正式宣布你们实现了 AGI 吗?
他回应称,AGI 这个词已不再与公司和微软之间的协议挂钩,现在更像是一个使命层面、精神层面的概念。
这句话听起来像套话,实则是整件事的关键。
——导语
01
这个词是谁发明的
AGI 这个词的诞生,比大多数人以为的要早得多。
1956 年,约翰·麦卡锡在达特茅斯会议的提案中创造了“人工智能”这个词。当时,他们希望让机器具备人的全部智能。
但接下来的五十年,这个词被滥用。下棋程序叫人工智能,垃圾邮件过滤器叫人工智能,商场里的语音导购也叫人工智能。到 2000 年前后,“人工智能”已沦为什么都能装的筐。
2001 年,一批研究者无法忍受。他们决定回归最初的野心,合写一本书。关键问题是这本书该叫什么。他们试过叫《真正的人工智能》,被否决;也试过叫《合成智能》,但无人满意。
后来,刚拿到硕士学位的 Shane Legg 在邮件组中提议:既然说的是有通用能力的机器,就叫 Artificial General Intelligence 吧,缩写 AGI,好念。
参与那轮讨论的还有王培、Peter Voss,以及后来以担忧 AI 风险著称的 Eliezer Yudkowsky。这个名字在 2002 年被确定下来,几年后作为书名由施普林格出版,2006 年起又办成同名的系列研讨会,就此在研究圈中传播。
有趣的是后面。2005 年前后,AGI 社区的一个网络讨论中,突然冒出一个陌生人,说这个词他 1997 年就用过。众人一查,还真有——物理学者 Mark Gubrud 在一篇讨论自动化军工与技术风险的文章中用了这个说法,八年无人问津。Legg 后来回忆这段时说得直白:突然有个人冒出来说这词是我发明的,我们说,你是谁啊?
所以 AGI 的来历是这样的:一个物理学者顺手写下,但大多数人根本不知道。于是,一群研究者为了给自己的野心正名,重新造了一遍。
至于给它起名的 Shane Legg,五年后和哈萨比斯一起创办了 DeepMind。后面你还会再见到他。
而这个从未确定含义的词,2015 年被写进了一家公司的章程。
02
值一千亿美元的那个词
OpenAI 2015 年成立时是家非营利机构。章程中有一句话,可以认为既是使命,也是定义,这句话是:确保通用人工智能,也就是在大多数有经济价值的工作上胜过人类的高度自主系统,造福全人类。
留意“造福全人类”这五个字。至少从字面意义上来讲,OpenAI 一开始就认定,AGI 一旦造出来,会重要到不该归任何一家公司私有。
可是造 AGI 要烧钱,非营利结构融不到那个量级的钱。2019 年 OpenAI 改成“有限利润”结构:投资人可以赚,但回报有上限,超出的部分归非营利母体,董事会的权柄仍然在非营利这边。
同年 7 月,微软投了第一笔十亿美元。到 2023 年 1 月又追加一百亿,总承诺一百三十亿。微软换到的东西极为可观:Azure 成了 OpenAI 唯一的云;微软独家拿到这些模型的商业授权,转手塞进必应、Office、GitHub Copilot;外加一笔分成:2023 到 2025 年间微软从这段合作里进账约三百亿美元,其中两百三十亿是卖算力挣的。
但重点不是微软赚了多少钱,而是 OpenAI 在谈判桌上坚持塞进去一条:如果 OpenAI 董事会宣布公司达成了 AGI,微软对此后技术的权利立刻中止。
为什么要有这么一条?因为它是那句“造福全人类”的保险绳。说白了就是:到 AGI 线之前你随便赚,一旦到线,它就太重要了,不能再是一家公司的私产。
问题出在,合同里从头到尾没写清楚 AGI 是什么。
可能是为了弥补这个缺陷,2023 年那轮投资又加了第二道触发器,这次干脆用钱来定义——当系统能创造出某个量级的利润,例如数字在一千亿美元上下时,独家权利就终止。
但后面的条件又变了。2025 年 10 月 OpenAI 完成重组,微软拿到约 27% 的股份,同时加了道程序:就算 OpenAI 宣布了 AGI,也要经一个独立专家小组核验,不能自说自话。2026 年 2 月,两家还专门发了联合声明,说合同里 AGI 的定义和认定流程维持不变。
然后一个巨大的转折来了。2026 年 4 月的又一次最新修订,把此前的触发条件整个拿掉,换成两个日期——微软的授权走到 2032 年,分成走到 2030 年,且都不再取决于 OpenAI 是否宣布达成 AGI。
四个多月后,Brockman 干脆说,AGI 现在已经是一个精神概念。
我不打算从这个先后顺序中推出任何动机。合同条款的存废有太多商业理由,Brockman 也很可能真心这么认为。
这条时间线上,AGI 这个词的历史,一开始是命名,后来是承诺,再后来是条款,现在是口号。
但至少 OpenAI 还是把这个词当作终极目标和衡量标准,但其实 OpenAI 内部也没有共识。
因为,就在 Brockman 说那句话的一周前,《TIME》的报道里,奥特曼还在说 OpenAI“还没完全到 AGI”,但他补充说,2026 年底前会有一个他愿意称为 AGI 的内部系统。
差不多同时,公司的首席研究官 Mark Chen 则给了个数字:我们走完了通往 AGI 的 80% 的路。
十天之内,一家公司的三个人,给了三个答案。
为什么这个问题,会问出这么多个答案。
03
四派人
这世界上,有几批人认真回答过“AGI 到底是什么”。这几种答案表面上都在谈 AGI,但想解决的根本不是同一个问题。
第一派就是 OpenAI 自己。上面那句章程就是定义:在大多数有经济价值的工作上胜过人类。这不是一篇论文的结论,是一家公司的宪法,也是那份合同里那个词的出处。它用经济来定义智能——能不能替掉人的活儿。
第二派的领头人叫 François Chollet。你可能没听过他,但全世界几百万开发者用过他写的东西,深度学习框架 Keras 就是他的作品。2019 年他写了篇《论智能的度量》,观点在当时很不合群:无论把模型做多大、喂多少数据,都不等于智能,真正的智能是高效地学会一件你从没被教过的事。
他不是光说说。他设计了一套测试,有趣但有效:给你几个例子,让你推出规律,然后解一道从没见过的新题。这些新题,人类小孩就能做,模型却很难答对。这套题悬赏了五年没被攻破,到 2024 年底最好成绩才刚过一半。它后来成了这个行业里最有名的钉子户,因为它专治一件事:分得清“真会做题”和“背过答案”。
第三派是 DeepMind,就是当年下围棋赢了李世石那家公司,现在归谷歌。他们今年 3 月那篇框架论文的作者里有 Shane Legg——对,就是 2002 年在邮件组里起了 AGI 这个名字的那个人。
客观来说,和其他所有用一个抽象概念定义 AGI 的人不同,这一派的态度最务实,提出来的标准也最可量化。他们的意思是:别急着问到没到,先把该测的项目造齐。那篇论文把认知拆成十项——感知、生成、注意、学习、记忆、推理、元认知、执行功能、问题解决、社会认知——逐项去比普通人的水平。他们还挂了二十万美元奖金搞众包,专门征集五项他们认为最缺工具和标准的增量测试。
他们给今天的模型下了个判断:这是一个参差不齐的认知剖面。
也就是说,现在的前沿模型在数学、事实记忆、模式识别上超过多数人,在新经验中学习、在长对话中维持上下文、读懂社交情境上落后于普通人。如果你是一个理性主义的信奉者,他们提供的这套东西可能是最能说明 AGI 走到哪一段的。
第四派是 Anthropic,也就是 Claude 的母公司,创始团队是从 OpenAI 出走的一批人。CEO 达里奥·阿莫代伊干脆不用 AGI 这个词,嫌它太像科幻,改叫“强大的 AI”,形容成“数据中心里的一个天才之国”。但别以为他故弄玄虚,他是所有实验室 CEO 中唯一给出官方时间表的:这种系统会在 2026 年底到 2027 年初出现。
有一个更值得注意的共同点:这四种定义,全都出自要造这个东西的人。定标准的和交卷的,是同一批人。
这不是阴谋,造它的人本来就是最有资格描述它的人。但它意味着一件事——AGI 从来不是一个可以被发现的事实,而是一个需要被约定的标准,而人类至今没有完成这个约定。
04
GPT-6 Astra 做到了什么
先把支持方的牌全摊出来。这一轮愿意说出 AGI 这个词的人,绝大多数不是在凭空兴奋。
沃顿商学院教授伊桑·莫里克长期研究 AI 在真实工作中的表现,拿到了 GPT-6 的提前权限。他的评价是:这个模型能替他自主完成复杂而有意义的工作,而且可以连续好几天干一个活儿。
他举的例子(按他自己的说法只是个好玩的例子)是网页上的一座可以走进去的亚历山大图书馆。公元前 250 年左右的场景,有史料依据,卷轴能读,有讲解,甚至能切换观看关于这座图书馆究竟如何衰败和毁灭的几种不同史学假说。
这件事比一个漂亮的三维场景重要得多,因为它不是一件事,是五件事拧在一起:写软件、查史料、设计交互、组织叙事、编排大量内容。这五件事分属五个工种。过去的模型能做好其中任何一件,做不到把它们攒成一个成品。
另一个要点是,它在数学研究上产出了新东西,而且这次是可以核验的。
8 月 1 日,OpenAI 宣布内部版本解决了十个开放数学问题,其中一个从 1999 年就悬在那儿。他们公开了 249 页手稿,以及可以让计算机逐步核验的形式化证明。
这一条的分量不在难度,在“可核验”三个字。
OpenAI 曾经在这件事情上丢过脸。2025 年 10 月,OpenAI 一位副总裁曾发帖说 GPT-5 解决了十个未解的数学难题,被维护那份问题清单的数学家当场指出是严重误读——模型不是自己解决的,而是找到了既有文献。OpenAI 只好把帖子删了。十个月后,再宣布数学研究成果时,他们附上了机器能逐步验算的证明过程。
接下来,也是比较容易被忽略的:它可以自行开始判断什么时候停下来问人。
OpenAI 放了一组对照。同一个任务,给一个正在转行的人做求职网站。上一代模型一声不吭做了 13 分 15 秒,交出成品。Astra 干了 20 秒就停下来,问了一句:你要转去哪个行业?
仅仅从表面看,这句话像是开倒车。
这主要因为,过去两年了,衡量智能体的通用标准一直是“能连续跑多久不用人管”,因为它们总是跑一半就散架。可这个指标现在反过来了。正因为它能跑很久了,跑偏的代价才变得大得多。在一个错误前提上认真工作十三分钟,比停下来问一句糟糕得多。
会问,不是能力变弱,而是知道哪一个不确定性会毁掉整件事。这两件事合起来,是一种对人的建模,这成了很多人认为 GPT-6 确实具有类人智慧的理由。
回头看这三件事,会发现一个共同点:没有哪一件是 Astra 第一次做出来。写代码、查资料、做设计、证数学,上一代都会。变的是它第一次能把这些攒成一个交得出去的东西。
从“会做”到“做完”,这是这一代真正跨过的那条线。
但有一条必须写在这里,否则前面全是宣传。上述几乎每一个正面例子,都来自拿到提前测试权限或与 OpenAI 有合作关系的人。OpenAI 自己的演示页脚注也写明,展示片段是剪辑过的:有一段标注实际耗时 2 分 54 秒的操作,播出来是压缩过的 15 秒。
这不是说他们不诚实,但它意味着一件事:目前独立的证据,不是这些演示。演示都有很强的局限和偏好,稍微更值得注意的,是那些评测数据。
05
值得单独说的一件事
回到 Chollet 那套测试。今年的版本更狠:把模型丢进一个从没玩过的抽象小游戏,不给规则,不给目标,让它自己摸索怎么赢。
ARC Prize 回放过程记录时发现,模型会把陌生环境即时压成一套符号规则:把游戏机制写成逻辑,并且发展出一套自己的简写符号,用来记录局面、规划下一步。用他们的话说,那基本上是为这个游戏现造的一套代数记号。
结果是:96% 的关卡上,它用掉的操作次数比参加基线测试的普通人的中位数还少,平均少一半。
这一条最诛心,因为 ARC Prize 原本的预判恰恰相反。他们认为 AI 就算最终能解开陌生谜题,过程也会笨拙、来回试错,人和机器的差距会长期停在“效率”这一项上。这个预判没扛住。
几乎同时,一家把模型接进产品的工程团队记下了另一件事:让它编排一群子智能体协同工作,发现一旦消息长度被限制,它就把智能体之间的通信压成了一种去掉空格和语法的残句。
一个是造记号,一个是造暗语。两处都不是人教出来的,是它自己“发明”的。
看到这两条记录的时候,我的第一反应不是技术问题,是一个文科生的联想。
人类文明史上,文字的发明是极有意义的里程碑。而文字的前身叫刻符,即有意义的符号,但还没成体系。河南贾湖遗址的龟甲上有刻画符号,距今八九千年;西安半坡的陶器上也有,六千年上下。这些算不算文字,学界至今在吵。公认成体系的中国文字,要到三千多年前的甲骨文。
文字是怎么长出来的?两河流域那条线最清楚。最早的记账工具是陶筹,一个筹代表一只羊;后来把筹封进泥球,在泥球外面压出记号;再后来发现泥球可以不要了,记号本身就够用。楔形文字就是这么从记账工作中长出来的。
文字诞生的机制是:要记的东西超过了媒介能承载的量,于是压缩成约定记号。
Astra 那两处行为,机制上完全同构。一处是要在多步游戏中追踪局面,一处是消息长度被卡住。都是记录压力逼出来的自发压缩,都长成了似语言非语言的东西。
那这是不是智能的涌现?
这里得把话说准,差之毫厘的地方最要紧。
让文字成为文明起点的,不是“造出了记号”这个动作,是记号留了下来。可以跨人,可以跨代,可以累积。你刻的符号别人能读,这一代记的账下一代能查。文字真正的分量在于,它是外部的、共享的、持久的记忆:人类第一次把脑子里的东西放到脑子外面,还能拿回来。
而 Astra 造的那套记号,用完就没了。下一局游戏重造一套,不传给别的模型,不积累,也没有第二个使用者。
它是私人速记,不是文字。
所以准确的说法是:它长出了文字的形状,缺的恰好是让文字改变历史的那个功能。
它能想出记号,但记不住记号;能解决问题,但留不下解决问题的办法。
所以我们很难说,Astra 创造了自己的文明,但这个点绝对值得长期关注。
06
我们正在失去看它思考的窗口
在看评测之前,得先解决一个技术问题,因为它会影响你怎么读后面所有的数字。
发布前两天,商业媒体 The Information 披露,Astra 用了一种叫“循环深度”的技术。
传统做法是,信息沿着固定层数的网络一层层往前走,有几层算几层。要让模型想得更久,过去只有两条路:把模型做大,或者让它把思考写成更长的文字,就是我们能看见的那种“思维链”。
循环深度是第三条路:让信息在同一组网络层中反复循环,在吐出下一个字之前先在内部多算几轮。部分推理直接在内部的数值状态中完成,全程不落成人类能读的文字。
那它算不算变成了另一种东西?不算。它还是那个架构,变的是它被优化成了想得更多、说得更少。
这条路线也不是 OpenAI 独有的。字节跳动的 Seed 团队发过公开论文做同一件事,让一组网络层循环运行,把更多计算放回模型内部。方向是共同的。
这件事真正的麻烦,不在能力,在证据链要出问题了。
我们过去两年之所以能对模型多一点信任,很大程度上是因为思维链:它把推理过程写出来了,你能看见它是一步步推出来的,还是从哪儿搜索出来的。那是我们唯一的窗口。
循环深度把这扇窗口关小了。现在它可以不出声就把竞赛题做出来,你看到的只有答案。你没法从答案本身判断它是推出来的还是记住的——而这恰恰是整场争论的核心问题。
OpenAI 目前主动限制了这项技术的用量,为的是让推理仍然可读。但方向已经摆在那儿了——它变强的同时,我们关于它怎么变强的证据在变少。
为什么前沿 AI 越来越让人恐惧?这其实是一个很重要的因素——这不是它在隐瞒。是我们过去两年用来判断它的那个办法,正在失效。
07
六份体检报告,为什么拼不成一张
关于 AGI,公开的权威评测已经有二十几项。我们挑六项有代表性的,先说清楚每项到底在考什么。
第一项是 Chollet 那套,把模型丢进从没玩过的游戏,不给说明书,考的是学新东西的速度。
第二项给一道全世界都没解开的数学题,限三天、限三百美元经费,考的是智力的上限。
第三项交给它一件真实工作,看它能独立干多久不用人插手,考的是能撑多久。
第四项让它交一份法律意见书、一张工程图、一份护理计划,请同行专家盲评,跟真人的成品比,考的是活干得漂不漂亮。
第五项让它经营一家店跑满一年,考

