AGI

发表 2026-10-07


Artificial General Intelligence

AGI 的全称是 Artificial General Intelligence,即人工通用智能。

不通用的智能

回到 2018-2019 年的 OpenAI Five,这 OpenAI 在围棋项目的成功后对 Dota2 电竞项目的尝试。 即使事后营销非常成功,但这是一个明显「通用性」的反例。

诚然 AlphaGo 在 Go 这个项目上对人类选手的碾压十分震撼,而 OpenAI 的中路 solo 和五人团队游戏对战人类也胜多负少,但我认为这是完全不同的胜利模式。
围棋是一个规则简单、局势复杂的游戏,它的复杂性来自规模。 在围棋之前的国际象棋项目,规则明显更复杂,但这实际意味着可能性更少,同时棋盘更小,这导致复杂性不如围棋,不需要 AI 的深蓝就可以战胜人类。
但在 Dota2 项目上则不同,这是个规则极度复杂,同时自由度又很高的游戏,而且它不是透明信息、轮流行动的策略游戏。
在中路 solo 模式,很明显 AI 的优势在于极度的操控和绝对的不失误。 但它有很多完全无法应对的情况,比如开局不卡兵,或者勾兵线打法。
AI 比较出乎意料的,是开发了芒果大药流极致压迫的打法,这在之前的人类对局是没有的。 这也很好解释:过拟合,人类拟合到了正常对局,中路 solo 不是比赛全部,不可能完全不累积经济;而 AI 则拟合到了极致的 solo 情景。

而 OpenAI Five 的 5v5 模式更暴露出了 AI 的问题,它对游戏道具、局势完全没有理解,完全靠局部操作来获得优势。
比如当有击杀机会时,5 个 bot 会同时使用技能造成伤害达成击杀,这是 5 个职业级同一战队的默契队友也做不到的,因为不能精准估计技能范围和伤害数值,也不可能有相同的决策行为。这是 AI 的巨大优势。 另外还有斧王跳吼永远被吹风或沉默打断(rOtk 不用空大了,因为根本大不出来),屠夫出勾永远扭屁股躲开,这是不可能发生在人类操作上的。
但明显有伤害溢出的现象,晕眩类控制也完全没有轮流释放的概念,往往叠加释放浪费了控制时间。即使在狭小时间和空间场景下,AI 决策也显然没有最优。
更明显的问题是,AI 对战术道具毫无使用理解,塔下插真眼,兵线上开雾等等。也没有 1-5 号位概念,纯各凭本事。
一个明显的证据就是,第一次表演赛,微操极其优秀的 AI 在和基本功全面退步的中国退役选手比赛中,被随意戏耍。

第二年新版本的 AI 在表演赛上看似碾压地战胜了当时路边一条的前冠军战队 OG,接着开放为期三天的路人挑战,拿到了好看的战绩。看似取得大胜,实则在「智能」这个领域上是彻底的失败。
首先是限制英雄选择和道具,原本游戏是 100+ 角色的 5v5 情景,被压缩到了 17 个,并且禁止了幻象和召唤物这种会产生额外单位的机制。这和实际的 Dota2 游戏场景是完全不同的,也是人类缺乏训练的。
根据对局时间换算,这个 AI 通过自我对局,训练了相当于 45000 年的时间。延续中路 solo 模式的思路,没有长期战术计划,而是激进地使用低成长性快速获取优势的方案,非常明显是过拟合的表现(换言之,一股子 TI4 VG 味)。
为期三天的挑战赛,AI 胜率超过 99%。但 OpenAI 没说的是,仅仅三天的人类适应时间(还要减去休息时间),就有队伍能够十连胜,也就是说迅速找到了压制策略,而 AI 在十个月现实时间、4500 年虚拟时间里都没有做到。而且,还有胖头鱼这些退役选手,纯靠硬实力战胜 AI。
像 Dota2 这样的复杂策略、长程游戏,我认为人类和 AI 加起来对它战术的开发也不到十分之一(所以才会有 Wings 这样的战队)。

大量训练使得它们发现了许多神奇的诡异且(小时空尺度上)有效的策略,但也有显然完全无效的、错误的行为;另一方面,一些很少游戏时长的普通玩家,只要读技能和物品说明就能想到的策略、组合,却没有展现出来。
简而言之,OpenAI Five 所展现出的优势,要么是计算机在操作上的极端优势(比如没有失误,比如 150 左右没有无效操作的极致 APM,绝对稳定的反应时间),要么是大量经验过拟合、局部最优后的「习惯性」行为。
它的「策略」是一种经验的总结和筛选,而不是通过逻辑推理得出的「结论」,这是一个关键的区别。

什么是通用

我认为这里的 General 不是指通常的、一般的、大部分的任务,不是指能做到很多具体的任务。「通用」不是很多能力的复合。
相反,General 应该指「一个」能力,一个「形式的」而非「具体的」能力。 更进一步地,从这个能力出发,面对一个全新的任务,能够把这个形式能力应用到任务上,得到这个任务的「具体的」能力。 前者是对(具体的)各种各样的任务具有完成它的能力,后者是这是「能」做到(一个抽象意义下的)一般性任务的能力;前者是复数,后者是单数。

累积知识

另一个显著的缺陷是,模型暂时仍是静态的。依旧用 OpenAI Five 为例,它每一局的策略都是相同的,并不能在三天内继续学习,它的学习效率也不够。
但人类很明显可以学习,并且需要的样本极小。人类并不是以具体的对局决策细节为学习单位的,而是首先理解然后逻辑演绎的。

人类从现象中抽象出知识,然后把知识快速融入行为的过程,当前所有模型架构都难以做到相同的程度。
让模型具有权重外的新知识,已经有很多尝试。例如 RAG,似乎已经被淘汰了;当前更多地通过长上下文和注意力机制来直接把知识放在会话里,并且通过 MCP 和 Skills 来作为工程实现方案。

如果将人类比为(当前架构的)模型,那么人的生理结构决定的大脑神经,可以类比于架构细节和预训练;人类成长过程中神经发育的过程,新突触和回路的形成,类比于后训练; Skills 等上下文注入,应该类比于工作记忆。那么人类(在大脑基本发育完成后)学习、理解、吸收的知识,长期记忆等,并没有相应的类比,因为除了权重和上下文外,模型本身没有本质上的第三种输入方式。

先天能力与后天能力

在西方哲学上,人的心灵是否先天是一块白板,这是个持续争论的问题。从脑科学角度,人类必然有先天能力,但我们不知道这能力的边界在哪里。

为了解释这个问题,可以举例一个回答,例如如果让康德来回答,那么人在认识论的先天能力是时间和空间的直观。

如果模型的先天能力来自架构,那么它的学习能力极其低效;如果先天能力来自权重,那么过于笨重复杂。
要实现 RSI 的 AGI,需要一个有先天学习能力的 AI,而不是靠堆参数涌现的看起来像智能的黑盒。