AGI——通用人工智能(artificial general intelligence)——指的是 AI 在大多数认知工作上达到或超过人类的那个假想节点,而不是把某一件事做到极致。按这个框架,国际象棋引擎、图像分类器、甚至考试碾压人类的 LLM 都算「窄」AI;AGI 主张的是通用性——一个系统,差不多无论你的工作是什么,它都学得会。它同时是各大实验室的公开目标,和一个没有公认定义的词——关于它的大部分争吵,根源就在这里。
为什么没人能达成一致
每个被提出的测试一接触现实就溶解。图灵测试几年前就悄悄陷落了——模型早已通过对话不可分辨性,却没人因此承认 AGI 到来。经济学定义(OpenAI 章程:「在大多数有经济价值的工作上胜过人类」)会随经济本身漂移。基于基准的定义会饱和:模型考研究生考试如探囊取物,却仍会搞砸一个临时工一下午能干完的活。DeepMind 的「AGI 分级」框架是最诚实的回应——把通用性当成光谱(涌现 → 胜任 → 专家 → 大师 → 超人,再乘上自主性维度),而不是一条终点线。按这把梯子,今天的前沿模型大致处于「涌现期 AGI」:通用,但胜任得参差不齐。
参差不齐的前沿
反复出现的实证意外是参差(jaggedness):同一个模型,能拿数学奥赛金牌、能写生产级代码,却可能输掉一个小孩几分钟就学会的新游戏,或自信地看错一张日历。能力以尖峰的形式到来,而不是一条平滑上升的曲线。这就是为什么严肃的研究者看着同一份证据,结论能差出几十年——指着尖峰说「X 已达专家级!」或指着低谷说「Y 还不会!」,是侧重点的选择,不是事实的分歧。智能体让问题更锋利了:持续的自主工作,恰恰是通用性缺口最藏不住的地方。
这个词为什么仍然重要
定义再模糊,AGI 也在驱动真实的决策——万亿美元级的数据中心建设、写进实验室章程的 AGI 条款(微软与 OpenAI 的协议就系于其上)、各国政府的安全框架。读新闻时有个好习惯:每当有人说「AGI」,把它替换成可操作的主张——*哪些任务、什么可靠性、替代谁?*替换后句子还成立,它就说了点东西;不成立,那就是营销。