Key points are not available for this paper at this time.
يعد البحث عن التشابه القابل للتوسع جوهر العديد من تطبيقات التعلم الكبير أو تعدين البيانات. مؤخرًا، أظهرت العديد من نتائج الأبحاث أن هناك نهجًا واعدًا يتمثل في إنشاء رموز هاش مضغوطة وفعالة تحافظ على تشابه البيانات. وعند الإشارة إلى الكفاءة، فإننا نعني انخفاض الارتباط (وبالتالي انخفاض الازدواجية) بين الرموز الناتجة. ومع ذلك، فإن معظم طرق التجزئة الحالية مصممة فقط لبيانات المتجهات. في هذه الورقة، نقوم بتطوير خوارزمية تجزئة جديدة لإنشاء رموز فعالة لبيانات واسعة النطاق بأشكال عامة باستخدام أي دالة نواة، بما في ذلك النوى على المتجهات، والرسوم البيانية، والتسلسلات، والمجموعات، وما إلى ذلك. بدءًا من فكرة مشابهة للتجزئة الطيفية، تم اقتراح صيغ وحلول جديدة بحيث يمكن تمثيل دالة هاش قائمة على النواة بشكل صريح وتحسينها، وتطبيقها مباشرة لحساب رموز هاش مضغوطة لعينات جديدة بأشكال عامة. علاوة على ذلك، ندمج تقنيات فعالة، مثل تقريب نايسترم، لتقليل تعقيد الوقت والمساحة لمؤشرات البحث، مما يجعل خوارزميتنا قابلة للتوسع مع مجموعات بيانات ضخمة. ميزة مهمة أخرى لطريقتنا هي القدرة على التعامل مع أنواع متنوعة من التشابه وفقًا لمتطلبات المهمة الفعلية، بما في ذلك كل من تشابه الميزات والتشابه الدلالي مثل اتساق التسميات. نقوم بتقييم طريقتنا باستخدام مجموعات بيانات بشكل كبير بما في ذلك بيانات المتجهات وغير المتجهات حتى 1 مليون عينة. تظهر نتائجنا الشاملة أن الطريقة المقترحة تتفوق على عدة نهج متقدمة في جميع المهام، مع تحقيق مكاسب كبيرة لمعظم المهام.
درس هي وآخرون (سون،) هذا السؤال.