Key points are not available for this paper at this time.
संगठनात्मक निर्णयकर्ता को एआई टूल्स का मूल्यांकन करना चाहिए, यह देखते हुए कि ऐसे टूल्स के बेहतर प्रदर्शन का बढ़ता दावा किया जा रहा है। हालांकि, ज्ञान कार्य की गुणवत्ता को मापना चुनौतीपूर्ण है, जिससे यह सवाल उठता है कि ऐसे संदर्भों में एआई प्रदर्शन का कैसे मूल्यांकन किया जाए। हम इस प्रश्न की जांच एक प्रमुख अमेरिकी अस्पताल के फील्ड अध्ययन के माध्यम से करते हैं, यह देखते हुए कि प्रबंधकों ने पांच अलग-अलग मशीन-लर्निंग (एमएल) आधारित एआई टूल्स का मूल्यांकन कैसे किया। प्रत्येक टूल ने मानक एआई सटीकता के माप के अनुसार उच्च प्रदर्शन की रिपोर्ट की, जो कि योग्य विशेषज्ञों द्वारा प्रदान किए गए ग्राउंड ट्रुथ लेबल्स पर आधारित थे। हालांकि, इन टूल्स को प्रायोगिक रूप से आजमाते समय यह सामने आया कि इनमें से कोई भी अपेक्षाओं को पूरा नहीं करता। स्पष्टीकरण की तलाश में, प्रबंधक विशेषज्ञों के जानकारियों की उच्च अनिश्चिता का सामना करने लगे, जो ग्राउंड ट्रुथ लेबल्स में कैद होती है, जिसका उपयोग एमएल मॉडल को प्रशिक्षित और मान्य करने के लिए किया जाता है। व्यवहार में, विशेषज्ञ इस अनिश्चितता का सामना समृद्ध ज्ञान-हॉव प्रथाओं के द्वारा करते हैं, जो इन एमएल आधारित टूल्स में शामिल नहीं की गई थीं। एआई के जानकारियों और विशेषज्ञों के ज्ञान-हॉव के बीच केdisconnect की खोज ने प्रबंधकों को प्रत्येक टूल के जोखिमों और लाभों को बेहतर तरीके से समझने में सक्षम बनाया। यह अध्ययन दिखाता है कि एमएल मॉडल में उपयोग किए जाने वाले ग्राउंड ट्रुथ लेबल्स को वस्तुनिष्ठ रूप से मानना खतरनाक है जब अंतर्निहित ज्ञान अनिश्चित हो। हम अपने अध्ययन के विकास, प्रशिक्षण और ज्ञान कार्य के लिए एआई के मूल्यांकन के लिए निहितार्थों को रेखांकित करते हैं।
लेबोविट्ज़ इत्यादि (बुध,) ने इस प्रश्न का अध्ययन किया।