“随着人工智能系统从被动助理转变为自主科学发现代理,未对齐或有害输出的风险显著上升(例如,关注的双重用途研究)。传统的事后对齐方法,如强化学习人类反馈(RLHF),根本上是反应式的,无法有效管理实时发现循环。我们提出了“安全对齐门”,一个基于主动推理和正式安全宪法的神经符号框架。通过直接将安全先验嵌入变分自由能(VFE)的最小化过程中,系统能自主识别并拒绝违反生物或伦理界限的发现轨迹。在10个不同搜索环境中的对抗性仿真试验中,该框架实现了100%的违规预防,同时相较于非对齐贝叶斯基线保持了5.2倍的效率领先。这项研究确立了“内在对齐”作为安全发展人工超智能(ASI)的关键架构要求。”
Chouhan等人(周四)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: