Key points are not available for this paper at this time.
لقد كانت الشبكات العصبية التفافيه (CNNs) ومحوّلات الرؤية (ViT) حاسمة في تقسيم الصور الطبية الحيوية، ومع ذلك، فإن قدرتها على إدارة الاعتمادات بعيدة المدى تظل محدودة بسبب المحلية الجوهرية والعبء الحسابي. لتجاوز هذه التحديات، نقترح في هذا التقرير الفني أولاً xLSTM-UNet، شبكة عصبية عميقة منظمة على شكل UNet تستفيد من Vision-LSTM (xLSTM) كهيكل أساسي لتقسيم الصور الطبية. تم اقتراح xLSTM مؤخرًا كخلف لموديلات الذاكرة قصيرة وطويلة الأمد (LSTM) وقد أظهرت أداءً متفوقًا مقارنة بالمحوّلات ونماذج الفضاءات الحالة (SSMs) مثل Mamba في معالجة اللغة العصبية (NLP) وتصنيف الصور (كما هو موضح في تنفيذ Vision-LSTM، أو ViL). هنا، xLSTM-UNet التي صممناها تمتد النجاح في مجال تقسيم الصور الطبية الحيوية. من خلال دمج نقاط القوة لاستخراج الخصائص المحلية من الطبقات الالتفافية مع قدرات التقاط الاعتمادات البعيدة المدى لـ xLSTM، تقدم xLSTM-UNet حلاً قويًا لتحليل شامل للصور. نحن نتحقق من فعالية xLSTM-UNet من خلال التجارب. تظهر نتائجنا أن xLSTM-UNet تتجاوز باستمرار أداء الشبكات الرائدة المعتمدة على CNN وTransformer وMamba في مجموعات بيانات متعددة في التقسيم الطبي الحيوي بما في ذلك الأعضاء في تصوير الرنين المغناطيسي للبطن، والأدوات في الصور التنظيرية، والخلايا في الصور المجهرية. مع التجارب الشاملة التي تم إجراؤها، يبرز هذا التقرير الفني الإمكانيات المعمارية المعتمدة على xLSTM في تعزيز تحليل الصور الطبية الحيوية في كل من 2D و3D. الكود، والنماذج، ومجموعات البيانات متاحة للجمهور على http://tianrun-chen.github.io/xLSTM-UNet/
درس تشين وآخرون (Mon,) هذا السؤال.