大语言模型常被称作"黑箱"——它能给出答案,却说不清自己是怎么想的。Anthropic 的可解释性(interpretability)团队一直在做一件事:打开这只箱子。下面按时间顺序选了五项代表性工作,配上一分钟读懂的导读;想深入的话,点每条里的原文链接。

SAE
2023 · 10

Towards Monosemanticity

单个神经元往往同时"身兼数职",直接看它没有意义。这篇工作用稀疏自编码器(SAE)做"字典学习",把纠缠在一起的激活拆成一个个含义单一、人类可读的特征——之后所有工作的方法基石。

Golden Gate Claude 文章头图:三联色调的金门大桥
2024 · 05

Golden Gate Claude

找到特征只是"能读",这次是"能写":把"金门大桥"特征人为放大后,Claude 无论聊什么都会绕回那座桥——用一场公开演示证明,特征不仅可以观察,还能因果地操控模型行为。

页面中的图片与原文版权归 Anthropic 所有,此处仅作学习导读;导读文字为本站原创概括,细节以原文为准。