Key points are not available for this paper at this time.
एक दशक की सक्रिय अनुसंधान के बावजूद, बहुत बड़े स्रोत कोड भंडार के लिए क्लोन डिटेक्टरों की स्पष्ट कमी है, विशेष रूप से करीबी क्लोन का पता लगाने के लिए जहां क्लोन किए गए कोड में महत्वपूर्ण संपादन गतिविधियाँ हो सकती हैं। हम SourcererCC प्रस्तुत करते हैं, जो एक टोकन-आधारित क्लोन डिटेक्टर है जो तीन प्रकार के क्लोन को लक्षित करता है, और एक मानक कार्यस्थल का उपयोग करके बड़े अंतर-प्रोजेक्ट भंडार के लिए स्केलेबिलिटी प्राप्त करने के लिए एक इंडेक्स का लाभ उठाता है। SourcererCC एक अनुकूलित उल्टा-सूचकांक का उपयोग करता है ताकि दिए गए कोड ब्लॉक के संभावित क्लोन को जल्दी से क्वेरी किया जा सके। टोकन क्रम पर आधारित छानने की ह्यूरिस्टिक्स का उपयोग इंडेक्स के आकार को काफी कम करने, क्लोन का पता लगाने के लिए आवश्यक कोड-ब्लॉक तुलनाओं की संख्या, साथ ही एक संभावित क्लोन का निर्णय करने के लिए आवश्यक टोकन-तुलनाओं की संख्या को कम करने के लिए किया जाता है। हम SourcererCC की स्केलेबिलिटी, निष्पादन समय, पुनःकाल और सटीकता का मूल्यांकन करते हैं, और इसे चार सार्वजनिक रूप से उपलब्ध और अत्याधुनिक उपकरणों के साथ तुलना करते हैं। पुनःकाल को मापने के लिए, हम दो हालिया बेंचमार्क का उपयोग करते हैं, (1) वास्तविक क्लोन का एक बड़ा बेंचमार्क, BigCloneBench, और (2) हजारों बारीक कृत्रिम क्लोन के लिए एक म्यूटेशन/इंजेक्शन-आधारित ढांचा। हमें पता चलता है कि SourcererCC दोनों उच्च पुनःकाल और सटीकता प्रदान करता है, और एक मानक कार्यस्थल का उपयोग करके एक बड़े अंतर-प्रोजेक्ट भंडार (250MLOC) के लिए स्केल करने में सक्षम है।
सजनानी और सहयोगियों (सन,) ने इस प्रश्न का अध्ययन किया।