借助AI驱动解释与实验理解大脑——微软研究院

Microsoft Research 2026-06-26T03:18:08.889245

借助AI驱动解释与实验理解大脑——微软研究院

发表于2026年6月25日

作者:Chandan Singh,高级研究员;Jianfeng Gao,技术院士兼企业副总裁

理解大脑 | 四个白色线条图标位于抽象紫色背景上:大脑图标、聊天气泡图标、带对勾的圆形图标、搜索图标

概览

语言神经科学中的可解释性问题

过去十年中,LLM已成为预测人脑如何响应语言的最准确工具。将人们在同一fMRI(功能性磁共振成像)扫描仪中聆听的故事输入LLM,该模型的内部表示能够以惊人的保真度预测单个皮层区域的活动。但这种成功伴随着一个问题:没有人能读懂这些模型。它们是数百万个难以理解的参数,无法直接转化为解释。一个能预测大脑活动的模型告诉我们某个区域对语言有响应,但并未说明它真正捕捉的是什么——是食物、地点、数字,还是其他完全不同的内容。随着黑箱模型的普及,预测与理解之间的差距已成为计算神经科学的核心问题之一。

将黑箱转化为可检验的理论

在一篇被《自然·神经科学》(Nature Neuroscience)接收的新论文中,微软研究院的科学家与加州大学伯克利分校、加州大学旧金山分校及哥伦比亚大学的科学家合作,引入了一种克服这一可解释性危机的框架:生成式因果测试(GCT)。GCT将大脑预测模型提炼为简短、可读的描述,说明每块皮层区域响应什么,然后对这些描述进行检验。LLM撰写旨在激活特定脑区的新故事,受试者在扫描仪中聆听这些故事,如果解释正确,目标区域就会被激活。最终,该方法将不可解释的预测模型重新转化为科学的通用语言:可以在后续实验中被证实或反驳的简洁假设。LLM撰写旨在激活特定脑区的新故事,受试者在扫描仪中聆听这些故事,如果解释正确,目标区域就会被激活。最终,该方法将不可解释的预测模型重新转化为科学的通用语言:可以在后续实验中被证实或反驳的简洁假设。

图1:展示两步骤过程的示意图。顶部,第一步的流程箭头显示从故事n-gram到体素解释“食物准备”的进展。底部显示第二步,包含AI聊天、脑区图像及其响应折线图。

图1. 生成式因果测试(GCT)的两个步骤。在步骤1中,最强烈驱动脑区预测模型的短语由LLM总结为简短候选解释,例如“食物准备”。在步骤2中,LLM撰写与该解释相匹配的新故事,并在扫描仪中测量该区域对这些“驱动”故事的响应,并与基线进行比较。

GCT的工作原理

GCT包含两个步骤:解释,然后验证。为生成解释,该方法首先针对单个体素或区域建立预测模型,并识别出最强烈驱动其预测响应的短短语。然后,LLM将这些词语总结为简洁的口头解释,通常是一个短语,如“食物准备”或“地点名称”。

关键的第二个阶段形成了闭环。为了建立对解释的信任,GCT 使用 LLM(大语言模型)编写新的故事,其中每个段落都经过精心构建,以便根据其解释驱动特定的大脑区域。三名被试再次回到扫描仪中阅读这些合成故事。如果某个区域对其“驱动”段落的反应显著高于基线文本,则该解释通过了真正的因果测试,而不仅仅是相关性测试。

在所有三名被试中,核心方法都得到了验证:合成故事可靠地将其目标区域的反应提升到基线以上,证实了 GCT 的简短解释捕捉到了皮层真正响应的内容。这些解释在底层脑预测模型最强的情况下也是最值得信赖的(模型越稳定,其解释在扫描仪中得到确认的可靠性就越高)。在已知选择性的区域验证了该方法后,研究人员将 GCT 转向了更困难的问题。

图2:六张脑表面可视化图显示了不同类别(包括地点和食物准备)的标准化BOLD响应。

图2. 不同主题下GCT故事的脑响应图谱。部分图谱复现了已知发现:解释“地点”在地点区域RSC、OPA和PPA产生强烈响应。其他图谱独立证实了较新的假说:“食物准备”激活了腹侧枕叶皮层靠近梭状回面孔区(FFA)的区域。还有一些(如“生日”)并未明确映射到任何已知结果,为未来研究指明了方向。

GCT 还足够敏锐,能够解决长期存在的模糊性。三个参与处理地点的邻近区域——压后皮层(RSC)、海马旁回地点区(PPA)和枕叶地点区(OPA)——通常被视为功能相似。最初,为一个区域编写的故事也会激活其他区域。但通过生成差异化刺激(旨在开启一个区域同时保持其邻近区域安静的故事),GCT 将三者区分开来。例如,RSC 对专有名词地点名称(如东京或康涅狄格州)的反应更强,而非一般地点。这是一种微妙的、区域特定的理论,原始预测模型本身无法提供。

除了已知区域,作者还发现了新的前额叶“微区域”。通过扫描候选位置的网格并仅保留最稳定的区域,GCT 揭示了这些此前未被映射的区域,它们对极其特定的概念敏感:一个选择性地对人与人之间的对话(如“说”或“告诉”这类词)响应,一个对提及时钟时间(“一点钟”)响应,一个对数字测量(“50英尺”)响应。这些区分是之前没有人去寻找的;它们之所以出现,是因为该方法能够提出一个假说并立即检验它。

意义与展望

GCT 的意义远超神经科学。研究人员越来越面临同样的困境:一个模型预测得很好,但无法解释任何东西。GCT 表明,数据驱动的模型不必成为研究的终点;它可以被提炼成可读的、可实验检验的理论,并且该理论可以通过按需生成新实验来与现实进行对照检验。

具体到神经科学领域,GCT 指向了一种更快速、更富含假说的皮层映射方式——AI 系统提出大脑区域可能编码的内容,闭环实验在同一项研究中确认或拒绝它。这种生成与验证的理念可以扩展到其他领域,在这些领域中,强大的预测模型已经超出了我们理解它们的能力。更广泛的教训是充满希望的:科学中黑箱模型的兴起并不一定意味着可读理论的退却。有了正确的框架,两者可以共同进步。

致谢

这项工作由微软研究院、加州大学伯克利分校(Alex Huth、Bin Yu、Sihang Guo 和 Aliyah Hsu)、哥伦比亚大学(RJ Antonello,共同牵头)以及加州大学旧金山分校(Shailee Jain)合作完成。我们也感谢研究参与者及更广泛的语言神经科学社区,他们的工具和数据集使这项研究成为可能。

阅读论文:《生成式因果测试以弥合语言神经科学中数据驱动模型与科学理论之间的鸿沟》,已被《自然·神经科学》接收,以及GitHub上的代码

查看原文