为什么人类生成的数据可能成为基础模型的瓶颈
基础模型通过在海量人类生成数据——文本、语音、代码和标注图像——上进行训练而获得了卓越的能力,但这些数据仅代表了可观察的行为,与产生这些行为的神经复杂性相比,其带宽极为有限[1]。锚定论文用一个简单的符号形式化了这一点:如果B(t)代表大脑活动,A(t)代表可观察行为,那么A(t)是B(t)的子集,而现有的神经影像数据B*(t)近似于B(t)[1]。作者认为,B*(t)包含A(t)中不存在的认知要素,将这种大脑生成的数据纳入训练可以帮助模型超越表层的统计规律[1]。这一理论框架借鉴了此前的证据,即神经影像数据能够从想象、尝试或内隐言语中解码自然语言,这表明只要数据质量和解码性能足够,所有人类生成的训练数据原则上都可以从大脑活动中推断出来[1]。
现实动机在于,人类生成数据的获取受限于认知努力,使其很可能成为未来模型发展的瓶颈[1]。该论文将大脑数据定位为与设备生成数据和人类生成数据并列的第三类数据,认为它提供了通往认知潜在空间的途径,该空间部分包含但远远超出可观察行为[1]。这是一种解读,而非已证实的发现:作者明确指出,仅用昂贵的神经影像数据来重建文本是低效的,真正的潜力在于揭示行为背后的生成过程[1]。
早期神经影像研究究竟支持什么
大脑数据能够提升模型性能这一主张在狭义领域具有实证基础。早期研究表明,神经影像数据可用于训练经典机器学习、深度学习或强化学习模型,以完成图像识别或机器人运动等任务[1]。与认知预测更为直接相关的是,一项利用人类连接组计划(Human Connectome Project,N=1050)数据的大规模研究结合了弥散、功能和结构MRI来预测认知能力,发现跨模态整合提升了大多数认知领域的预测准确率,但效应量中等——堆叠后最多解释不到10%的方差[4]。另一项针对青少年大脑认知发展研究(ABCD)的分析表明,多变量方法应用于结构和功能MRI时,约100名被试即可在复制样本中捕获可重复的脑-行为关联,且工作记忆任务fMRI在预测一般认知方面尤其具有充足的统计效力[5]。这些发现确立了大脑数据携带认知表型信息这一事实,但也揭示了一个重大缺口:预测认知分数的个体差异,并不等同于训练一个通用基础模型来进行推理、生成或跨领域整合概念。
锚定论文承认了这一空白,指出此前的研究主要是在经典机器学习、深度学习或强化学习模型传统应用的背景下进行的,而向更广泛、开放的基础模型的转变可能代表着一个认知转折点,关乎哪些神经信号最具前景[1]。该论文的贡献在于提出一个面向这一转变的框架,而非对其进行实证展示。
RLHB与CoTHB:利用有限脑数据的两种拟议路径
锚定论文提出了两种通用方法,以优先将有限的神经影像数据用于基础模型训练中战略性选择的高价值环节[1]。基于人脑的强化学习(RLHB)将神经信号用作奖励或反馈机制,有可能替代或补充基于人类反馈的强化学习(RLHF)中所使用的人类评分[1]。基于人脑的思维链(CoTHB)将利用神经数据来引导或验证中间推理步骤,类似于思维链提示,但其依据是真实的脑活动而非人类生成的示例[1]。论文将这些方法映射到四个认知层级——感知、评估、执行和整合——每个层级都与特定的脑区和认知过程相关联[1]。在感知方面,视觉、听觉和躯体感觉皮层被识别为相关区域,训练方法为模式解码,现有研究量为中等[1]。在评估方面,腹侧纹状体、腹内侧前额叶皮层、眶额皮层、杏仁核和脑岛等区域与奖励、价值、置信度和自我控制相关联,现有研究量较低[1]。执行涉及背外侧前额叶皮层、前扣带皮层、额极皮层、后顶叶皮层和前辅助运动区,负责规则表征、评估和动作选择,现有研究量极低[1]。整合涉及额下回、角回、颞顶联合区、内侧前额叶皮层和后扣带皮层,负责语言、概念整合、社会认知和自传体记忆,现有研究量较低[1]。
该论文还讨论了时间尺度同步与缩放作为技术挑战,指出神经影像数据具有噪声大、个体差异显著且难以解读的特点[1]。作者提出,群体层面的统计信息可能比个体层面的精确性更容易加以利用,从而容忍更高的变异性和噪声[1]。这是一项理论性提议:未提供任何实现细节、训练流程或性能基准。
竞争性方法与人脑训练方案的局限
锚点论文将基于大脑训练的基础模型定位为在当前架构扩展与探索受神经科学启发的替代方案之间的中间路线[1]。然而,相竞争的证据表明,改进基础模型的替代方法已经在产生实证结果。例如,JoyAI-Talker——一个全双工语音对话系统——采用多阶段语音-文本联合训练范式以及解耦的Duplex-Thinker-Talker架构,在共情语音交互基准上取得了有竞争力的表现,在直接设置下性别识别率达98.2%,年龄识别率达77.3%,情绪识别率达79.6%[2]。这项工作表明,基于人类生成数据——而非大脑数据——的架构与训练创新,能够解决诸如认知退化和副语言信息丢失等特定局限[2]。锚点论文并未将其提出的方法与此类替代方案进行比较,而实证结果的缺失使得直接比较无法实现。
局限性证据进一步制约了该提议。一项关于FAIR非洲脑数据的研究记录了严重的基础设施缺口:非洲仅有一台专用的研究型MRI扫描仪,临床扫描仪往往技术较旧(1.5T或0.3T),而高收入国家的标准为3T或7T [3]。这种稀缺性影响了数据的生成、共享和应用,并引发了关于将脑数据采集集中于经济发达地区的公平性担忧 [3]。锚定论文承认,神经影像数据的成本可能使数据采集集中于发达地区,但提出将模型建立在人类认知的普遍机制之上,或可部分抵消偏见 [1]。这一观点属于推测性假设,尚未经过实证检验。此外,该论文指出了伦理挑战,包括隐私、安全、匿名性、所有权以及保护思想自由的需要,因为脑生成数据先于自愿行为并可能预测之 [1]。这些挑战意义重大且尚未解决。
什么算作证据,以及哪些仍不确定
锚定论文讨论了对智能体、通用人工智能(AGI)和超级人工智能(ASI)的潜在影响,提出以大脑数据训练的基础模型可能是提升与人类价值观对齐以及模拟执行功能的现实且有效的中间路径[1]。论文还提出了神经科学与AI交叉领域的一个良性循环,即神经翻译和神经接口的进步可能使该策略随时间推移愈发具有现实意义[1]。然而,这些都是推测性展望。论文明确指出其属于理论探讨,并未提供实证训练结果或性能验证[1]。
来自其他研究的验证证据表明,脑数据能够在特定临床情境中预测认知结果。例如,基于海马体积的机器学习模型在区分阿尔茨海默病痴呆与健康对照者时达到了94.17%的准确率,并显著预测了基线和纵向认知功能[7]。另一项研究发现,将神经影像与生物流体标志物相结合,提高了帕金森病认知障碍的诊断准确率,其中结构和功能MRI的准确率与AUC值均超过80%[8]。弥散MRI已被证明能够提供关于老年人执行功能的独立信息,尽管它对未来认知变化并不敏感[9]。静息态EEG相位同步同时预测了多项认知指标,平均R²为0.60[10]。这些发现表明,脑数据确实携带针对特定认知结果的预测信号,但它们并未证明在此类数据上训练基础模型能够提升通用能力。机器学习算法的选择同样重要:一项研究将七种算法应用于同一多模态脑影像数据,发现脑预测年龄差与认知功能的关联方式存在显著差异,这表明算法选择是变异性的重要来源[6]。这意味着RLHB和CoTHB的成功将在很大程度上取决于目前尚未明确的方法学选择。
核心的未解问题是,B*(t)中那些不存在于A(t)的额外信息,是否足以克服神经影像数据在基础模型训练所需规模上的噪声、异质性和成本。锚定论文提供了一个框架和一个假设,但并未给出答案。
关于这些来源
本研究页面基于10项研究(9项同行评审,1项预印本)——发表于2017年至2026年间,其中6项来自2024年或之后,合计被引用148次——这些研究是从通过质量筛选的13项研究中选出的最相关研究,而这13项研究又是从超过5亿篇文献的数据库中检索到的99篇论文中筛选而来。
本文引用的文献
人工智能新策略:直接以人脑数据训练基础模型
锚点论文提出了一个直接基于人类大脑数据训练基础模型的理论框架,将局限性按感知、估值、执行和整合四个层面进行分类,并提出RLHB和CoTHB作为方法,但未提供任何实证训练结果或性能验证。
JoyAI-Talker:为共情语音智能体打造的全双工语音交互大模型
JoyAI-Talker是一种竞争性方法,它通过语音-文本联合训练和解耦架构实现了强大的共情语音交互性能,表明在人类生成数据上的架构创新可以在没有大脑数据的情况下解决特定局限。
FAIR非洲脑数据:挑战与机遇
这篇局限性论文记录了非洲FAIR脑数据面临的严重基础设施和公平性挑战,包括非洲仅有一台专用研究型MRI扫描仪以及较旧的临床扫描仪,制约了数据生成与共享。
整合跨神经影像模态可提升认知能力的预测准确性
这项验证性研究整合了人类连接组计划(N=1050)的扩散、功能和结构MRI来预测认知能力,发现多模态整合提升了预测准确性,但效应量仍属中等,最多只能解释不到10%的方差。
利用青少年大脑认知发展研究改进较小复制样本中基于神经影像的行为预测
这项验证研究利用ABCD研究数据表明,将多变量方法应用于结构和功能性MRI,能够在复制样本中约100名受试者的情况下捕捉到可重复的脑-行为关联,其中工作记忆任务fMRI在预测一般认知方面尤其具有较高的统计效力。
机器学习算法的选择会影响脑预测年龄差与认知功能之间的关联
这项验证研究将七种机器学习算法应用于多模态脑影像数据,发现脑预测年龄差与认知功能的关联方式存在显著差异,表明算法选择是变异性的一个重要来源。
基于海马体积多变量模式分析的阿尔茨海默病识别与认知功能预测
这项验证研究使用SVM和RVR对海马体积进行分析,以识别阿尔茨海默病并预测认知功能,在AD痴呆与健康对照的区分中达到94.17%的准确率,并能显著预测基线和纵向认知功能。
利用生物流体、神经影像和人工智能识别帕金森病中的认知障碍
这项验证性综述发现,将神经影像学与生物流体生物标志物相结合可提高帕金森病认知障碍的诊断准确性和预测能力,其中结构性和功能性MRI的准确率和AUC值均超过80%。
扩散MRI对预测老年人认知功能的独立增值作用
这项验证性研究发现,基于弥散MRI的白质微结构可提供关于老年人当前执行功能的独立信息,但对未来认知变化不敏感。
RID-Rihaczek相位同步方法应用于静息态EEG:同时预测视空间追踪、言语交流、执行功能、神经认知健康和智力
这项验证研究将RID-Rihaczek相位同步应用于静息态EEG,并同时预测多种认知指标,包括视空间追踪、言语交流、执行功能和智力,平均R²为0.60。
