ملخص يُعدّ筛筛 رأس المال المخاطر مشكلة توقع نادرة غير متوازنة حيث ينتج عن نسبة صغيرة فقط من المؤسسين نتائج قصوى، بينما تهدر الإيجابيات الزائفة انتباه المحللين ورأس المال. تطلع هذه الدراسة على أنماط فشل المعايرة لنماذج اللغة الكبيرة المحلية على VCBench، وهو معيار لتوقع نجاح المؤسسين استنادًا إلى الملفات الشخصية المجهولة قبل التأسيس. نقوم بتقييم استدلال Ollama المحلي باستخدام نوعين من Qwen، qwen3: 32b وQwen3-30B-A3B-GGUF: Q4KM، على مجموعات فرعية مص validated بأبعاد 120 ملفًا، ونقارن هذه النتائج بإحصائيات تافهة وموحدة TF-IDF مُقيمة على كل من مجموعة 120 ملفًا وتجميع بيانات التحقق العامة البالغة 900 ملف. تجد الدراسة أن هندسة الإيعاز تغير معدل الإيجابية المتوقعة بدلاً من تحسين التمييز بشكل موثوق. تزيد مطالبات Few-Shot من الاسترجاع بشكل رئيسي من خلال توقع العديد من الإيجابيات، بينما تكون مطالبات Vanilla أكثر تحفظًا ولكن لا تزال تحتفظ بفترات ثقة عريضة. تُظهر مصنّف LR-TF-IDF بسيط أداءً أقوى في F0.5 على بيانات التحقق المتاحة مقارنة بتكوينات مطالبات LLM المحلية المجربة. تدفع هذه النتائج نحو وضع معيار تقارير لمعايير LLM لحالات الحدث النادرة: يجب الإبلاغ عن معدل الإيجابية المتوقعة، والأساسيات التافهة، وتحليل الدقة والاسترجاع، وعدد مصفوفة الالتباس، وفترات الثقة جنبًا إلى جنب مع أي درجة Fβ.
درس سمير آدم أنور محمد صالح (الثلاثاء) هذا السؤال.