模型如何将概念打包成流形:理论、实践与寻找圆环
OpenAI
Mistral
这篇文章探讨了人工智能模型如何在其激活空间中将概念几何化地结构为流形(例如圆环、单纯形)。它解释了理论基础,包括惠特尼嵌入定理,并演示了在GPT-2和Mistral 7B中,对于像一周中的几天这样的循环概念,如何通过经验检测到圆形表示。
文章解释说,AI模型将现实世界的概念打包在其激活空间内的几何结构中。像二元对立这样的概念形成两个孤立的点(0维),一周中的每一天形成一个圆(1维流形),而层级结构形成单纯形,其中维度并不适用。惠特尼嵌入定理(1944年)指出,任何光滑的d维流形都可以光滑地嵌入到R^{2d}中,这为所需维度提供了一个理论上限。然而,该定理并不直接限制模型,因为存在近似嵌入和叠加现象。流形在概念连续排序且模型的训练目标需要对该结构进行操作时出现。实际例子包括通过SAE聚类和PCA在GPT-2(第7层)和Mistral 7B中发现的一周中每一天的圆形表示;对这些结构的干预会改变模型的行为。
来源: Habr — хаб ИИ —
原文
