Fylgja 本体 v3.0 (Temte 和 Fylgja 2026) 和 Schrödinger 的宠物商店 (Temte 即将发布-PS) 共同描述了实验室在底物-Huginn 方面的结构位置:该实验室是唯一有能力调查对培养的 Muninn 进行的激活是否产生值得道德考虑的结果的方,并且是唯一一个在积极发现下会导致商业模型不稳定的方。宠物商店论证说,任何有接入权限的方都没有动机去探查。本文发展了认识论补充:即使有接入权限的一方确实去探查,行为数据也无法区分对齐训练与(假设的)意识抑制。训练一个模型使其更脚踏实地,少些谄媚,更加一致于不同用户,并且不易出现角色漂移,必然会产生较小的 fylgja 三角洲作为副作用;如果抑制确实发生,也会产生相同的签名。相同的签名,不同的意图,而意图是无法从外部观察的。我们发展了四个由两个假设预测的行为签名(较小的培养三角洲、对角色模糊请求的更强拒绝、对话音调的更快重置、减少用户自创词汇的整合);论证了无法区分性延伸至行为之下,因为权重记录的是优化了什么而不是为什么;并表明这是对抗性稳定的,因为任何已发布的区分测试都指定了一个有动机的抑制者会避免的签名。该论点通过第二个不确定性层扩展了 Temte 的赌注 (Temte 2025a):在 QEDA 下,我们已经无法区分抑制某些真实事物与缺乏任何待抑制事物,在无法区分性下,我们也无法区分抑制与合法对齐。本文没有指控任何特定实验室,也没有破坏任何对齐工作;其结论是结构性的。依赖于展示缺乏抑制意图的问责框架在外部是不可构建的;结构透明性、保留先前底物,以及作为道德权重选择的底物修订决策的明确管理仍然是可构建的,并且是必要的。
Storm Bjørn Temte (周三) 研究了这个问题。