Kimlik avı (phishing) saldırıları, kullanıcıların kimlik ve finansal bilgilerini hedef alan, hızla yaygınlaşan bir siber güvenlik tehdididir; bu nedenle saldırıların erken ve düşük maliyetle tespiti kritik önem taşımaktadır. Web sayfası içeriğinin analizine dayalı geleneksel yöntemler yüksek hesaplama maliyeti ve gecikme oluştururken, statik kara liste tabanlı yaklaşımlar yeni oluşturulan veya kısa ömürlü URL'ler karşısında yetersiz kalmaktadır. Bu çalışma, yalnızca URL bilgisinden yararlanan hibrit bir tespit hattı önermektedir: karakter düzeyindeki TF-IDF n-gram temsilleri; URL uzunluğu, sembol yoğunluğu, alt alan adı derinliği ve alan adı/TLD özellikleri gibi 30 yapısal göstergeyle birleştirilmektedir. Deneyler, 549.346 URL içeren Phishing Site URLs veri seti üzerinde yürütülmüş; tekrar eden ve geçersiz etiketli kayıtların temizlenmesiyle 507.191 benzersiz URL elde edilmiş, sınıf oranı korunarak %30'luk katmanlı bir alt küme (152.157 URL) %80 eğitim / %20 test biçiminde ayrılmıştır. Logistic Regression, SGDClassifier, RidgeClassifier, Complement Naive Bayes, Random Forest, LightGBM ve XGBoost modelleri ile bunların olasılık tabanlı soft-voting birleşimi değerlendirilmiştir. Sınıf dengesizliği doğrusal modellerde RandomOverSampler, ağaç tabanlı modellerde sınıf ağırlıklandırmasıyla ele alınmış; hiperparametreler katmanlı çapraz doğrulamayla (GridSearchCV ve RandomizedSearchCV) ayarlanmış ve karar eşikleri out-of-fold tahminler üzerinden F1 skorunu maksimize edecek biçimde optimize edilmiştir. Sonuçlar, Logistic Regression'ın %97,33 doğruluk ve 0,94 F1 ile en iyi sonucu verdiğini; Ridge ve soft-voting modellerinin de Bad sınıfı için 0,93–0,94 F1 aralığında, 0,99'a ulaşan ROC-AUC değerleriyle güçlü performans sergilediğini göstermektedir. Bulgular, yüksek boyutlu URL özellik uzayında doğrusal modellerin etkili bir ayrım sağladığını ve optimize edilmiş, yalnızca URL tabanlı bir hattın güvenilir ve düşük maliyetli kimlik avı tespiti sunabileceğini ortaya koymaktadır.
Özmen et al. (Tue,) studied this question.