Key points are not available for this paper at this time.
شهد ظهور المحولات breakthrough كبيرًا في نمذجة السلاسل، حيث قدمت بنية ذات أداء عالي قادرة على الاستفادة من التوازي في وحدات معالجة الرسوم (GPU). ومع ذلك، فإن المحولات تتطلب موارد حسابية كبيرة أثناء الاستنتاج، مما يحد من تطبيقاتها، خاصة في البيئات ذات الموارد المنخفضة (مثل الأجهزة المحمولة والمضمنة). لمعالجة ذلك، نحن (1) نبدأ من خلال إظهار أن الانتباه يمكن اعتباره شبكة عصبية متكررة خاصة (RNN) قادرة على حساب مخرجات RNN الخاصة بها (many-to-one) بكفاءة. ثم (2) نوضح أن النماذج الشائعة المعتمدة على الانتباه مثل المحولات يمكن اعتبارها كمتغيرات RNN. ومع ذلك، على عكس الشبكات العصبية المتكررة التقليدية (مثل LSTMs)، لا يمكن تحديث هذه النماذج بكفاءة مع الرموز الجديدة، وهي خاصية مهمة في نمذجة السلاسل. للتصدي لهذا، نقدم (3) طريقة جديدة فعالة لحساب مخرجات الانتباه (many-to-many) تعتمد على خوارزمية الفحص المسبق التوازي. بناءً على صياغة الانتباه الجديدة، نحن (4) نقدم Aaren، وحدة معتمدة على الانتباه يمكن أن (i) تُدرب بالتوازي (مثل المحولات) ولكن أيضًا (ii) تُحدث بكفاءة مع الرموز الجديدة، مما يتطلب فقط ذاكرة ثابتة للاستنتاجات (مثل الشبكات العصبية المتكررة التقليدية). تجريبيًا، نظهر أن Aaren تحقق أداءً مقارنًا مع المحولات على 38 مجموعة بيانات موزعة عبر أربعة إعدادات مشكلات تسلسلية شائعة: التعلم المعزز، التنبؤ بالأحداث، تصنيف السلاسل الزمنية، ومهام التنبؤ بالسلاسل الزمنية أثناء أن تكون أكثر كفاءة في الوقت والذاكرة.
قام Feng et al. (2024) بدراسة هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: