这里是一个简短的回忆,记录过去到现在对 AI 的接触
通识
最早接触计算机算法和人工智能概念,应该是高中看科普书《复杂》(主要内容是关于复杂系统)和《皇帝新脑》(罗杰·彭罗斯的作品),以及《数学:确定性的丧失》等。
我关于图灵机、可计算性理论、复杂系统涌现现象等都从这几本书中了解,尤其是《皇帝新脑》。
这里推荐一下这本书和这位作者,虽然主要身份是物理学家,但其实是数学系出身,和霍金合作密切,并且是诺贝尔奖得主。其他比较有名的成果,包括提出彭罗斯镶嵌(非周期平面密铺)、彭罗斯楼梯(《盗梦空间》里那个)等。
大概是因为数学系出身,他在物理学领域和其他领域的思考都带有一点哲学意味(从康德的术语来看,物理属于后天综合,是经验性的;数学属于先天综合,更靠近形而上学)。
回到主题,在这些书里接触到了遗传算法,可能是我了解到的第一个重要算法。书里还给了一个例子:罗比机器人,在格子里拾取罐子,根据旁边8个格子的状态来决策。
当时还用 Visual Basic (因为学校里教这个)写了个遗传算法的代码来实践来实践,现在回忆一下发现最耗费时间的是每次遗传做排序,用了冒泡。
除此之外席尔勒的中文屋子,康威的生命游戏,图灵的测试,lambda 演算,混沌系统与相空间等都了解了一些。
Openai Five
在 openai 的 alpha go 名声大噪之时,我首先了解到的其实是 openai five (除客皆刀),这两项的比较使我认为,(当时)的 AI 完全没有智能可言。
诚然 alpha 在 go 这个项目上对人类选手的碾压十分震撼,而 open ai 的中路 solo 和五人团队游戏对战人类也胜多负少,但我认为这是完全不同的胜利模式。
围棋是一个规则简单、局势复杂的游戏,它的复杂性来自规模。在围棋之前的国际象棋项目,规则明显更复杂,但这实际意味着可能性更少,同时棋盘更小,这导致复杂性不如围棋,不需要AI的深蓝就可以战胜人类。
但在 Dota 项目上则不同,这是个规则极度复杂,同时自由度又很高的游戏,而且它不是透明信息、轮流行动的策略游戏。在中路 solo 模式,很明显 AI 的优势在于极度的操控和绝对的不失误。
但它有很多完全无法应对的情况,比如开局不卡兵,比如勾兵线打法。 AI 比较出乎意料的,是开发了芒果大药流极致压迫的打法,这在之前的人类对局是没有的。这也很好解释:过拟合,人类拟合到了正常对局,中路 solo 不是比赛全部,
不可能完全不累积经济;而 AI 则拟合到了极致的 solo 情景。
而 openai five 的 5v5 模式更暴露除了 AI 的问题,它对游戏道具、局势完全没有理解,完全靠局部操作来获得优势。
比如当有击杀机会时,5个bot会同时使用技能造成伤害达成击杀,这是5个路人做不到的,因为没有默契,并且并不能精准估计技能范围和伤害数值,这是AI的巨大优势。
另外还有斧王跳吼永远被吹风或沉默打断(rotk不用空大了,因为根本大不出来),屠夫出勾永远扭屁股躲开,这是不可能发生在人类操作上的。
但明显有伤害溢出的现象,晕眩类控制也完全没有轮流释放的概念,往往叠加释放浪费了控制时间。
更明显的问题是,AI 对战术道具毫无使用理解,塔下插真眼,兵线上开雾等等。也没有1-5号位概念,纯各凭本事。
一个明显的证据就是,第一次表演赛,微操极其优秀的 AI 在和基本功全面退步的中国退役选手比赛中,被随意戏耍。而第二年和OG的比赛,则是一次丑陋的胜利:限制英雄选择和道具,使用速推战术,非常明显是过拟合的表现。
Openai Five 的训练是自我对抗,在 alphago zero 上不用人类对局而是自我对抗的策略非常有效,但在 dota 领域上,从智能角度上,我认为是彻底的失败。甚至我认为这种失败的模式到现在也成立。
大量训练使得它们发现了许多神奇的诡异的策略,但里面显然有完全无效的、错误的行为;另一方面,一些很少游戏时常的普通玩家,只要读技能和物品说明就能想到的策略、组合,却没有展现出来。
作为比较,根据对局时间换算,这个 AI 训练了相当于 45000 年的时间。
简而言之, Openai Five 所展现出的优势,要么是计算机在操作上的极端优势(比如没有失误,比如150左右没有无效操作的极致APM,绝对稳定的反应时间),要么是大量经验过拟合、局部最优后的「习惯性」行为。
它的「策略」是一种经验的总结和筛选,而不是通过逻辑推理得出的「结论」,这是一个重要的区别。我认为这种区别在今天也没有变化。
顺便一提,后来 openai 开放了路人挑战,为期三天,胜率超过99%。但另一方面,仅仅三天的人类适应时间(还要减去休息时间),就有队伍能够十连胜,也就是说迅速找到了压制策略,而 AI 在十个月现实时间、4500年虚拟时间里都没有做到。
而且,还有胖头鱼这些退役选手,纯靠硬实力战胜 AI。
像 Dota2 这样的复杂策略、长程游戏,我认为人类和AI加起来对它战术的开发也不到十分之一(所以才会有Wings这样的战队)。
LLM 来了
接下来是大部分人共享的 GPT 时刻,deepseek 时刻。因为过于共享,所以略过吧。
AI4Math
之前做中学数学题、高考题、竞赛题等,我保持类似的态度:那不是真正的数学。虽然我本人做竞赛非常一般,但我认为竞赛题并不是一个好的 benchmark,也不认为能做竞赛题就能做数学研究。
因为很多竞赛题是纯粹的技巧,是灵光一现,而不是深刻理解后自然而然地推进出结论。对「随机鹦鹉」式 AI 而言,大量探索并剪枝筛选等,依然非常有效。竞赛题往往是有时限的,并且出题人是预期在这个时间内选手有可能解答的。
这意味着,竞赛题依然是一个短程任务,而非长程任务。
而我对数学研究理解,是推进人们对数学对象的认识,并发展概念。问题是自然遇到的,而不是刻意提出的。这是一个极度的长程任务,需要高度抽象出的直观理解,才能决定长远的方向和目标,并且去探索路线。
从今年五月左右, AI4Math 的成果才真正使我重视。A\ 和 OAI 轮流发力,解决了几个大的数学问题,接着是董彬团队的 Rethlas 数学智能体框架,以及各式各样 AI generated 数学论文。
每个领域,或早或晚都会迎来 ljh 时刻
接下来就是大抽卡时代,在这个明显新旧秩序交接的时刻,一大批人想要用新技术获取旧秩序下的资源,并寄希望于把这些资源延续下去。
这是最好的时代,这是最坏的时代。
如果单纯从研究数学的角度来看,AI 辅助可以极大的加速数学研究,也可以让人快速学习新知。前沿 AI 解答难题的能力,除了让人感到溃败以外,非常好用。人的感受是需要人自己去适应的,不是 AI 的问题。
另一个需要适应,或者说解决的问题,就是 AI 生成文本的可读性问题。诚然 lean 语言是检验正确性的利器,但这些论文文本如何能够真正成为人类知识,这是新时代数学研究的关键问题。
真正的问题在于,如何使用 AI、谁来使用 AI。数学界的莱顿宣言和Tao等人的其他联合声明,常常被外界识别为反对 AI,这很不准确。大部分数学工作者所反对的,是这两家公司使用 AI 的方式。 它们把重要的数学问题当作 benchmark,本质上仍然是在做题,并不为了发展数学认知,而是迅速取得成果来自我宣传。不仅如此,模型的使用也明显带来了各种不平衡、不公平,比如 OpenAI 可以用内部模型和1000个agent暴力尝试 NS 方程。 当然,还包括对用户数据的使用,即使去标识化,这些对话数据也明显是对人类知识的大范围剽窃。而且在我看来,数学家的对话数据很明显是高质量的逻辑训练数据。
抛开外部因素,AI 产出论文的一个巨大影响,就是撼动了数学界长期以来 credit 分配的问题。不得不说这是一个长久的弊病,现在加速和放大了这个问题。也许在技术的发展下是改变这一现状的契机。
但在当下时刻,AI 论文的 credit 非常争议。例如某人抽卡抽出大问题,但并看不懂,依旧直接投稿。审稿人耗费数月后完全理解,并确认正确性;但为此没有时间继续自己的研究、写自己的论文。与此同时原作者由抽出了数篇论文挂在 arxiv 上。
这种情况对数学生态完全是毁灭性的。
回到 AI 本身,像 Astra 已经十分强大,可以 one shot 直出氢弹级成果,使人震惊瘫坐。
但是,从它生成又臭又长的垃圾文本来看,我依然认为它不是通过逻辑推理得出数学思路,还是通过复杂系统生成大量文本、然后筛选得到结果,依赖涌现机制表现地像智能。