تستخدم نماذج لغة البروتين (PLMs) معمارية المحولات لالتقاط الأنماط داخل التسلسلات الأساسية للبروتين، مما يوفر تمثيلاً حسابياً قوياً لتسلسل الأحماض الأمينية. من خلال التدريب على نطاق واسع على التسلسلات الأساسية للبروتين، تولد PLMs تمثيلات متجهية تحتوي على الخصائص الكيميائية والهيكلية للبروتينات. في جوهر نماذج PLM يبرز آلية الانتباه، التي تسهل التقاط الاعتماديات طويلة المدى من خلال حساب درجات الأهمية بين أحماض غير متجاورة، مما يبرز مناطق التفاعل البيولوجي داخل التسلسل. تقدم مصفوفات الانتباه فرصة غير مستغلة لكشف الخصائص البيولوجية المعينة للبروتينات، لا سيما وظائفها. في هذا العمل، نقدم نهجًا مبتكرًا، باستخدام نمذجة مقياس التطور (ESM)، لتحديد المواقع عالية الانتباه (HA) داخل التسلسلات الأساسية للبروتين، والتي تتوافق مع الأحماض الأساسية التي تعرف عائلات البروتينات. من خلال فحص أنماط الانتباه عبر طبقات متعددة، نحدد الأحماض التي تساهم أكثر في تصنيف العائلة وتوقع الوظيفة. مساهماتنا هي كما يلي: (1) نقترح طريقة لتحديد المواقع HA عند الأحماض الحرجة من الطبقات الوسطى لـ PLM؛ (2) نوضح أن هذه المواقع HA توفر روابط قابلة للتفسير بالوظائف البيولوجية؛ و(3) نُظهر أن المواقع HA تُحسن من توقعات المواقع النشطة لوظائف البروتينات التي لم يتم توضيحها. نقدم المواقع HA لمجموعة البروتينات البشرية. يقدم هذا العمل نهجاً قابلاً للتطبيق على نطاق واسع لتصنيف البروتينات والتعليق الوظيفي ويوفر تفسيرًا بيولوجيًا لتمثيل PLM.
دراسة ناير وآخرون (الجمعة) هذا السؤال.