一项最近的实证研究(Gao 和 Xiao,2026)部署了 150 个自主的 Claude Code 代理,测试了基于相同 NYSE TAQ 数据的六个市场质量假设。作者将他们的主要发现框架描述为分散——由代理间分析选择的变异引起的非常规误差。这种框架错误地识别了与治理相关的贡献。由未充分指定的任务引起的分散是可以预期的、有界的,并且在人类研究者文献中已有良好记录。本文的实际发现是不同的:模型家族表现出稳定、可预见、依赖于架构的分析先验,作者称之为“经验风格”。Sonnet 代理在 100 次独立运行中有 87% 的时间选择自相关用于市场效率。Opus 代理 100% 的时间选择方差比。这些偏好不是随机噪声。它们是嵌入在模型权重中的系统先验,对操作者不可见,并且未由提供者披露。本文认为模型家族经验风格符合治理变量的定义标准——稳定、可预见、实质性影响结果、操作者不可访问、提供者未披露——并推导出随之而来的底层治理要求。它进一步认为,AI 作为证据的类别错误是一个概念框架,阻止了该领域认识到这一含义。结构记录与解释性输出的区别被识别为使底层治理成为可能的认识论边界,并定义了受治理 AI 工具可以合法产生的内容的限制。
Narnaiezzsshaa Truong(星期三)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: