公共ベンチマークスコア(TruthfulQA、MMLU、HellaSwag、ARC-Challenge、Arena Elo、MT-Bench、sycophancy rates)から27の大規模言語モデルをVoid Frameworkの三次元行動空間および複合ペクレ数にマッピングします。Peが単一のベンチマークが捉える以上の認知パフォーマンスを予測するかどうかをテストします。TruthfulQAを制御した部分相関は、PeがMMLU、HellaSwag、ARC-Challengeを有意に予測することを示します(全てp<0.02)。9つのベース整列モデルペアのペア分析は、整列が系統的にPeを増加させ、完全な符号の一貫性を示すことを示します(p=0.0002)。独立して測定されたデータのみを使用して、フレームワークの循環性のギャップに対処します。
Anthony W. Eckert(Mon,)がこの問題を研究しました。