哲学与人工智能

发表 2026-09-23


什么是哲学和人工智能

人工智能的含义非常广泛,但在当下的主流语境下主要指围绕大语言模型(LLM)的一系列技术,比如 模型训练与后训练、多模态、 agent/harness 工具等。 这是一个相当新兴的行业和领域,甚至难以对它进行分类和范畴分析。
而哲学是一个古老的领域,因为过于广泛而同样难以归类。「哲学很不科学」本身是个既不哲学也不科学的说法: 有一部分哲学不怎么科学也不需要科学,还有一部分哲学很像科学但不是科学。

考虑到语言本身的模糊性,我不打算解释我到底在指什么,而是寄希望于读者通过注意力把上下文的信息集中到这一部分中。

注意力机制

大模型的 Transformer 架构,通过注意力机制来移动词的嵌入向量,也就是说,词的含义被上下文影响。 另一种解释方式是,每个词有它的查询(Q)和它的键(K);每个词用它的查询和其他词的键来得到其他词对它的值(V)。 叠加上值,就得到新词的含义。
这里,我首先想到罗素的摹状词理论,但我对这套并不熟悉。通常使用的例子是当今的法国国王金山,这些词应该具有怎样的含义呢?
接下来想到的是索绪尔提出的能指、意指、所指概念,很容易认为词嵌入所做的是解析出的能指,而所指、意指则与上下文相关。
但更多后现代风味哲学家不断延拓相关思想,这些概念就更扑朔迷离了。

当我们谈论一棵树时,对我而言这个词所代表的树、我脑海中想象的树、我想要谈论的情景中的树、对方所理解的情景中的树、对方所理解的这个词、以及路边的一棵树,它们是什么关系? 在这个场景中,不妨假设这是两个不同母语的人,在用不同语言交流,那么这其中必然有语意的偏移。 但另一个角度来看,即使两个人在用一个国家、同一种文化中习得同一种语言,语意同样是偏移的。
我想这个例子可以说明,通常议一下翻译这个视角对人工智能的重要性。有趣的是,最早的 Attension is all you need 就是研究翻译的人工智能,更早的还有西尔勒的中文屋的思想实验。

多模态世界

在科学中,也有所谓的梅拉宾法则,又称7-38-55法则:在沟通中,7%取决于谈话内容,38%取决于语气和音量,55%取决于表情和态度。 当然,这个数据只在特定场景下才有意义,并非所有交流都是这个比例。 也许数学被 AI 这么显著地攻破,是因为数学论文是高度形式化的,相当于只需要处理那 7%。

这个例子大概也说明了多模态输入的重要性。 多模态训练中有一个神奇的有效的技术,把文本和图片的 token 放在同一个空间中,并且直接混用 Q K 权重。
这看似胡来的拼接背后是名为柏拉图表征假说的理论,认为有含义的信息在整个空间中应该是一个有特征的子集,甚至可能是一个子流形。 从这个假说名字就可以看出来,这个有意义的空间很像柏拉图的理念世界。
在生图模型使用的扩散模型中,同样假定有一个空间是所有可能的图像集合,而生图策略就是从一个噪声开始,通过逆向布朗运动回到那个可能空间里。
顺便一提,我认为生成文本的模型也应该用扩散模型的思路,而不是自回归地找到下一个词

但接下来我们看维特根斯坦的看法。他的早期理论语言世界,声明了一个真实世界的范围: 我的语言的界限意味我的世界的界限。 比起(朴素物理主义下的)真实世界,更重要的是事实世界,它由所有可能的事态构成;而所有可能的事态,就是可被言说的事态。 但是回到他的老师罗素,金山和独角兽这样的文本,在柏拉图表征世界的什么地方呢?

在大模型训练中,另一个常被提起的现象是,在词嵌入空间中,意思相近的词的对应向量往往距离更小。 而这不由得使我想起维特根斯坦的家族相似的概念。词语或概念的含义并没有固定的理形实体,只有一系列互相靠近的概念。

上下文

无论是模型训练,还是智能体框架,上下文(context)都是至关重要的概念。 在近代哲学中,文本同样是一个重要概念,德里达甚至提出了一切皆文本的口号。
结构主义和范畴论的一个共同点在于,更重视对象间的关系,而非对象本身。

上下文的顺序是一个奇妙的结构,在写作过程中有三个结构: 写作之难,在于将网状的思想,通过树状的结构,用线性的文字展开(Steven Pinker)。 可以设想在读者思考时,实际发生了相反的过程,即线性读完全文,从大纲发掘树状/层级结构,然后产生网状思考。
比如本文就是网状的,文本之间的关系并不完全是线性的先后关系。从维特根斯坦、索绪尔、柏拉图那里偷来的观点,和对模型效果的分析,是交错且前后相连的。 这种混乱的写作方式是一个实验(绝对不是我写不明白所以找的借口呢),把潜空间中的内容放出来,做文本解读。