大语言模型常被称作"黑箱"——它能给出答案,却说不清自己是怎么想的。Anthropic 的可解释性(interpretability)团队一直在做一件事:打开这只箱子。下面按时间顺序选了五项代表性工作,配上一分钟读懂的导读;想深入的话,点每条里的原文链接。
页面中的图片与原文版权归 Anthropic 所有,此处仅作学习导读;导读文字为本站原创概括,细节以原文为准。
大语言模型常被称作"黑箱"——它能给出答案,却说不清自己是怎么想的。Anthropic 的可解释性(interpretability)团队一直在做一件事:打开这只箱子。下面按时间顺序选了五项代表性工作,配上一分钟读懂的导读;想深入的话,点每条里的原文链接。
页面中的图片与原文版权归 Anthropic 所有,此处仅作学习导读;导读文字为本站原创概括,细节以原文为准。