الملخص: يوجد كمية هائلة من المعلومات الزراعية على الورق أو الوسائط الإلكترونية في شكل غير رقمي وغير منظم. من الممكن الحصول على معلومات مفصلة حول النباتات الزراعية بصيغة قابلة للقراءة آليًا من خلال استخراج وتحليل البيانات من مصادر نصية غير منظمة. تقيّم هذه الدراسة فعالية نماذج اللغة الكبيرة (LLMs) في استخراج بيانات أنواع المحاصيل من السجلات الزراعية باللغة الروسية، وتحديداً السجل الحكومي الروسي لإنجازات التربية (أكثر من 30,000 نوع). تم اختيار GPT-3.5 Turbo (حيث تمثل GPT المحول المدرب مسبقًا)، وGPT-4o، وGPT-4o-mini من OpenAI كنماذج لغوية تستخدم تقنيات الضبط السريع وعدد قليل من العبارات (FSPT) والتدريب الدقيق (FT). تم إجراء تقييم بشري لجودة استخراج البيانات على 250 وصفًا لنوع من قبل ثلاثة مراجع، وهم متخصصون في مجال الزراعة. أظهر نموذج GPT-4o أفضل نتيجة لاستخراج البيانات باستخدام FSPT (F1 = 0.967). جاء النموذج في المقدمة في التعرف على المعلمات
درس سولداتكينا وآخرون (صيف،) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: