Key points are not available for this paper at this time.
لقد جذبت استخدامات التعلم المعزز في التحكم في إشارات المرور اهتمامًا متزايدًا مؤخرًا. تم اقتراح مجموعة متنوعة من طرق التعلم المعزز القائمة على القيمة للتعامل مع هذه المشكلة التقليدية في النقل وحققت أداءً أفضل مقارنةً بأساليب النقل التقليدية. ومع ذلك، تعتمد نماذج التعلم المعزز الحالية على بيانات تدريب ضخمة وموارد حسابية، مما قد يترتب عليه عواقب سلبية (مثل الازدحامات المرورية أو الحوادث) في العالم الحقيقي. في التحكم بإشارات المرور، تم اقتراح بعض الخوارزميات لتمكين التعلم السريع من الصفر، لكن القليل من الاهتمام يتم توجيهه إلى التعلم من خلال نقل وإعادة استخدام الخبرات المكتسبة. في هذه الورقة، نقترح إطارًا جديدًا يسمى MetaLight لتسريع عملية التعلم في السيناريوهات الجديدة من خلال توظيف المعرفة المكتسبة من السيناريوهات القائمة. MetaLight هو سير عمل للتعلم المعزز القائم على القيمة يستند إلى خوارزمية التعلم الميتا القائمة على التدرج الممثل (MAML)، والتي تتضمن تكييفًا فرديًا على مستوى دوري وتكييفًا على مستوى عالمي. علاوة على ذلك، يحسن MetaLight نموذج FRAP الرائد في التحكم بإشارات المرور من خلال تحسين هيكل النموذج الخاص به ونظام التحديث. تُظهر التجارب على أربعة مجموعات بيانات من العالم الحقيقي أن MetaLight المقترح لا يتكيف فقط بشكل أسرع وأكثر استقرارًا في سيناريوهات المرور الجديدة، ولكنه يحقق أيضًا أداءً أفضل.
درس زانغ وزملاؤه (الجمعة) هذا السؤال.
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: