涌现能力是大模型研究领域最受关注也最具争议的概念之一。2022年,谷歌的研究人员在论文中正式提出这一术语,用来描述一种反直觉的现象:当模型参数规模跨过某个阈值后,某些能力会从几乎完全不具备突然跃升到接近可用的水平,而在阈值之前,性能曲线几乎是平的。这种非线性跃迁与传统机器学习中性能随数据和参数平滑增长的规律形成鲜明对比,也因此成为大模型被赋予巨大想象空间的重要依据。理解涌现能力,不仅有助于把握大模型的能力边界,也是判断继续堆参数是否有意义的关键。

涌现能力的定义与典型案例
按照谷歌论文中的原始定义,涌现能力是指小模型中不存在、但在大模型中出现的能力,即无法通过小模型的性能外推来预测的能力。这个定义包含两个关键点:一是不可预测性,即使你观察了一连串小模型的表现,也无法预见到大模型会突然掌握某项技能;二是非线性,能力的出现不是渐进改良,而是阶跃式跃迁。
研究者在多个基准任务上观察到了这种模式。最经典的例子是GPT-3在三位数加法任务上的表现:参数量从一百万到一千万、一亿乃至十亿的模型,准确率几乎为零,而当模型规模达到某个量级后,准确率陡然上升到接近百分之九十。类似的曲线还出现在多步算术、词语重排、上下文学习等任务上。PaLM模型在多语言翻译和思维链推理任务上也展现了类似现象——模型规模不够时思维链提示完全无效,跨过阈值后推理能力才被激活。
除了任务能力,指令遵循也是常被引用的涌现案例。小模型在给出指令后往往只会续写文字而忽略指令本身,而经过大规模预训练的模型配合指令微调,突然就能理解并执行各种自然语言指令。这种从量变到质变的特征,正是涌现一词的直观体现。
涌现能力从何而来:主流解释与成因分析
为什么能力会在某个规模点突然出现?目前学界有几种代表性解释。第一种是任务指标的视角:许多评测任务的评分方式是不连续的。以生成任务为例,要么完全答对得分,要么不得分,没有部分分数。模型的能力实际上是平滑增长的,但在精确匹配这类非黑即白的指标下,平滑的进步被压缩成了阶跃。就好比一个班级学生的知识水平是连续分布的,但只用满分六十题的卷子去测,及格率的变化看起来就像突变。
第二种解释涉及复杂能力的组合性。研究者发现,一些看起来涌现的任务实际上可以被分解为多个子任务,每个子任务的能力都随规模平滑增长,但只有当所有子任务都达标后,最终任务的指标才会突破零点。例如多步推理需要每一步都正确,若每步正确率为百分之九十,两步任务的总体成功率就是百分之八十一,但当每步正确率只有百分之五十时,多步任务几乎不可能成功。这种组合爆炸式的门槛效应会造成表面上的涌现。
第三种解释则强调模型内部的相变机制。有研究通过分析模型内部表征发现,某些能力(如上下文学习)的实现对内部回路有特定的结构要求,模型规模不足时这些回路无法有效形成,参数量足够后功能回路被完整建立,能力因此显现。这种解释类似于物理系统中的相变,比如水在零度结冰,性质发生突变但微观变化是连续的。此外,训练数据中的知识密度、稀疏但关键的高质量样本,也被认为可能促成涌现。
涌现是真实存在还是度量假象
2023年,斯坦福大学的研究团队发表论文提出了强有力的质疑:涌现能力可能只是度量方式造成的假象。他们选取了几个典型的涌现任务,把非连续的精确匹配指标替换为连续指标后,原本陡峭的阶跃曲线变成了平滑的上升曲线。这意味着模型能力的提升始终是渐进的,只是不连续的度量方式掩盖了这一点。
更进一步,该研究还展示了度量选择可以人为制造涌现:在一些本无涌现迹象的任务上,通过设计特定的非线性评分函数,研究者能够凭空创造出类似涌现的性能曲线。这给整个领域敲响了警钟——如果我们评测大模型的方式本身有偏差,那么基于这些评测得出的涌现结论就值得重新审视。
不过,质疑度量假象并不意味着涌现能力被彻底否定。即使连续指标下曲线是平滑的,大模型确实能够完成小模型完全无法完成的任务,这一客观事实没有改变。争论的焦点从是否存在涌现转移到了如何定义涌现:是性能曲线的形状涌现,还是能力本身的涌现。对工程实践而言,这场争论的启示是:评估大模型时应采用多样化、连续化的指标,避免被单一指标的阶跃误导,从而更准确地判断模型的真实水平。
涌现能力对大模型发展的实际意义
对研究和工程而言,理解涌现能力有多重价值。首先是缩放定律层面的考量。OpenAI提出的缩放定律指出模型损失随参数、数据、算力呈幂律下降,而涌现现象则提示:损失下降与具体能力出现并不是一回事。损失可以平滑下降,但能力的解锁可能存在阈值。这解释了为什么单纯看困惑度指标无法预测模型是否具备推理能力,也为混合专家模型、小型化模型能否触发涌现提供了研究课题。
其次是能力预测与安全治理。如果涌现能力真实存在且不可外推,那么在训练更大模型之前,我们无法预知它会解锁哪些新技能,这给模型对齐和安全评估带来了根本性挑战——针对现有能力的安全测试可能无法覆盖未来涌现出的能力。这也是为什么可解释性研究试图深入模型内部,提前识别潜在能力的萌芽状态。
最后,涌现能力也影响了产品和技术选型的判断。实践中不少团队发现,参数规模跨过某个量级后,模型在长链路任务、复杂指令理解上的可用性明显提升,这种经验性的阈值感知指导着模型选型与蒸馏策略。无论学术争论如何演进,涌现能力作为一个概念框架,已经深刻塑造了大模型时代的科研议程与工程决策,值得每一位从业者深入了解。