关键观点
神经网络更像被培育,而非被设计现代模型的内部结构并不是由工程师逐项指定,而是从随机状态出发,在数据和大量微小更新中形成。Nanda 将这一过程类比为自然选择塑造生物系统:复杂能力是累积优化的结果,而不是预先绘制的蓝图。因此,可解释性研究承担的是逆向工程任务,要从训练结果中重建模型学到了什么以及如何使用这些知识。
现代模型的内部结构并不是由工程师逐项指定,而是从随机状态出发,在数据和大量微小更新中形成。Nanda 将这一过程类比为自然选择塑造生物系统:复杂能力是累积优化的结果,而不是预先绘制的蓝图。因此,可解释性研究承担的是逆向工程任务,要从训练结果中重建模型学到了什么以及如何使用这些知识。
为什么重要: 这一视角解释了为什么模型能力可以快速提升,而人类对其内部机制的理解却明显滞后。
支撑证据
neural networks are more grown than designed.
可解释性是 AI 的神经科学可解释性试图把模型内部庞大的数字激活映射为人类能够理解的概念和机制。它既服务于科学好奇心,也服务于调试、风险识别和安全评估。研究者并不必然能够获得完整解释,但局部理解仍能揭示行为原因、发现异常,并提高干预的针对性。