تؤدي نماذج اللغة الكبيرة استدلالاً قريباً من بايزي لكنها تنتهك عدم تغيّر الترتيب على البيانات القابلة للتبادل. نحن نقوم بحل ذلك من خلال إظهار أن المحولات تقلل من الطول الشرطي الوصفي المتوقع (الانتروبيا المتقاطعة) على الترتيبات، E_π (Y Γ_π (X))، وهو ما يقبل تفسير تعقيد كولموغوروف حتى الثوابت المضافة، بدلاً من الطول الوصفي الثابت تحت التبادل (Y X). وهذا يجعلها بايزية في المتوقع، وليس في الإدراك. نستخلص (i) حداً لانتهاك المارتينغالي الكمي يظهر أن الانحرافات الناتجة عن الترتيب تتدرج كـ O(n) مع ثوابت؛ (ii) قانون فك الضغط على مستوى التوقع الذي يربط ميزانيات المعلومات بالموثوقية لدوال بيرنولي؛ و(iii) مخططي نشر يمكن نشرهم (B2T/RoH/ISR) للقرارات بشأن الإجابة/الامتناع. تجريبيًا، يتبع تشتت التباديل a+b n (Qwen2-7B b 0. 377، Llama-3. 1-8B b 0. 147)؛ تحسن خلطات التباديل من احتمال/دقة الحقيقة الأرضية؛ وتظهر استجابة الجرعة العشوائية أن الهلاوس تنخفض بمقدار 0. 13 لكل نات إضافي. تحقق مراجعة مسبقة محددة مع ISR=1. 0 تقارب 0٪ من الهلاوس عن طريق رفض محدد عند 24٪ من معدل الامتناع. الإطار يحول الهلاوس إلى إخفاقات ضغط قابلة للتنبؤ ويمكّن ميزانية معلومات مبدئية.
درس كلون وآخرون (سون ،) هذا السؤال.