تعمل أنظمة نماذج اللغة الكبيرة (LLM) بشكل متزايد من خلال تنفيذ متكرر متعدد الخطوات يشمل المحاولات المتكررة والتفرعات والتعديل والتنظيم والتقارب والسلوكيات المستمرة. توفر أنظمة instrumentation الحالية في وقت التشغيل بشكل أساسي تقارير على مستوى الطلب مثل الكمون واستهلاك الرموز وآثار التنفيذ وأحداث سير العمل، لكنها تقدم رؤية محدودة في كيفية تطور مسارات التنفيذ بمرور الوقت. يقدم هذا البحث إطارًا حتميًا لتحليل سلوك مسارات التنفيذ في سير العمل متعدد الخطوات لنماذج اللغة الكبيرة باستخدام إشارات لغوية وبنائية قابلة لإعادة التشغيل. يفصل التحليل بين سلوكيات الاستمرار والانحراف والتفرع والتقارب باستخدام قياسات مختصة بمسار التنفيذ. بدلاً من تقييم الدقة الدلالية أو جودة التفكير، 분석 الإطار الثبات الهيكلي بالنسبة لظروف التنفيذ الأصلية. عبر مجموعة مراقبة عبر مزودين من آثار قابلة لإعادة التشغيل تم التقاطها من نماذج OpenAI وAnthropic، نلاحظ ظاهرة عدم تطابق محلي ضد عالمي قابلة للتكرار: يمكن أن تظل الاستمرارية المحلية بين خطوات التنفيذ المتجاورة مرتفعة بينما تضعف الاستمرارية بالنسبة للمسار الأصلي بشكل تدريجي. هذا يخلق أنظمة قابلة للقياس حيث يبدو أن التنفيذ محليًا متماسكًا على الرغم من الانحراف الهيكلي عبر آفاق تنفيذ أطول. يقدم البحث أيضًا تشخيصات وقت التشغيل الحتمية بما في ذلك سرعة الانحراف، استقرار الانتقال، انحراف الفروع، وتقارب الفروع باستخدام فقط بدائيات هيكلية قابلة لإعادة التشغيل. تُظهر النتائج أن عائلات التنفيذ تُظهر سلوكيات انتقال متميزة وخصائص انحراف عبر سير العمل متعدد الخطوات. تشير النتائج إلى أن الاستمرار في أنظمة LLM المتكررة له تبعات وقت التشغيل تتجاوز فعالية الرموز وحدها. يتطلب التنفيذ متعدد الخطوات بشكل متزايد تحليل تطور حالة التنفيذ عبر آفاق استمرار مطولة بدلاً من تقارير على مستوى الطلب بشكل معزول.
درس V. P. (الثلاثاء) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: