Key points are not available for this paper at this time.
في مهام اكتشاف الأدوية، مثل الفحص الافتراضي، برز التعلم الآلي كوسيلة واعدة لتوقع الخصائص الجزيئية. تقليديًا، يتم حساب بصمات الجزيئات (تمثيلات عددية للجزيئات) من خلال خوارزميات قائمة على القواعد التي تُخضع الجزيئات لمساحة منفصلة Sparse. ومع ذلك، فإن هذه الخوارزميات تؤدي بشكل سيء في نماذج التنبؤ السطحية أو مجموعات البيانات الصغيرة. لمعالجة هذه المشكلة، نقدم SMILES Transformer. مستلهمًا من Transformer ونماذج اللغة المدربة مسبقًا من معالجة اللغة الطبيعية، يتعلم SMILES Transformer بصمات الجزيئات من خلال التدريب المسبق غير المراقب لنموذج اللغة من تسلسل إلى تسلسل باستخدام مجموعة ضخمة من SMILES، وهو نظام تمثيل نصي للجزيئات. قمنا بإجراء اختبارات على 10 مجموعات بيانات مقارنةً ببصمات موجودة وطرق ق قائمة على الرسوم البيانية، وأثبتنا تفوق الخوارزميات المقترحة في إعدادات البيانات الصغيرة حيث سهل التدريب المسبق التعميم الجيد. علاوة على ذلك، نحدد مقياسًا جديدًا لقياس دقة النموذج وكفاءة البيانات في وقت واحد.
قام هوندا وآخرون (الثلاثاء) بدراسة هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: