思维链提示及其变种使大型语言模型看起来像是在逐步推理,但这些步骤往往是独立的回合,仅在表面上相关;一个自信的模型可以呈现合成的形状,而实际上却是在伪造。功能认知框架(FCF),在这里作为一个名为“Dave”的运行系统实现,旨在测量和审计多智能体推理,而非假设它。主流方法通过更大的模型和逐渐增加的上下文窗口在空间上扩展能力,而FCF则在时间上扩展它。一个持续的协调者和一个小的固定核心小群体在一个单一商品GPU上推动多达二十四条并行思维谱系在一个三级内存层次结构上,并通过在短周期之间整合和修剪内存而保持长期一致性,而不是通过扩大上下文窗口。对于推理任务,每个融合的步骤都获得一个Shapley贡献评分和一个几何新颖性裁决,来区分真实合成和伪造;对于构建任务,工作被分解到方法级别,并通过一个固定循环保证,仅通过保持的门发送最佳通过候选,以确保没有错误的内容通过该门 -零错误通过,以大门的覆盖范围为准;成功的程序被提炼到一个校准门控的账本中并重复使用 - 基于经验的学习替代了早期、速度较慢的遗传方法。在一个预注册的五十二个软件模块和1131种方法的需求语料库上,该系统在一个隐性保持的门下发送了每个操作员测试过的方法和五十二个模块中的五十个,没有错误交付,并且大约十分之九的方法在第一次尝试中正确,构建时间约为一个半小时,且没有对生成代码进行手动编辑。对同一GPU的并发性研究显示,随着并行宽度的增加,整体吞吐量大约提高了十一倍,而工作依赖结构显示,改进的调度可以实现构建时间的进一步3.7倍减少。我们将FCF作为一种可再现的、自我审计的方式,提供在适度硬件上进行长期自主工作的路径;其自我监控信号作为功能性、可测量的工程指标严格报告,以便于可解释性和审计,而不是关于机器经验的主张。
Piotr Romanowski(周五)研究了这个问题。