Ne gösteriyor
Özellik önemi, modelin her değişkene ne kadar dayandığını sıralıyor.
Yüksek önem: model, tahmininde o değişkene çok güveniyor. Düşük önem: o değişken tahmini az etkiliyor.
Bir çubuk grafik olarak sunuluyor genelde: en üstte en önemli değişken, aşağı doğru azalan sırayla.
Bu, modelin “içini görmenin” bir yolu. Kara kutunun neye baktığını anlatıyor.
Nedensellik değil
En büyük tuzak: özellik önemi, nedensellik göstermiyor.
Bir değişkenin önemli olması, o değişkenin sonuca sebep olduğu anlamına gelmiyor. Model sadece o değişkenle tahmin arasında bir ilişki bulmuş.
O ilişki tesadüf olabilir, üçüncü bir faktörden gelebilir, ya da veri sızıntısı olabilir. Özellik önemi bunları ayırt etmiyor.
Yüksek önemli bir değişken gördüğünüzde, “demek ki bu sonucu belirliyor” çıkarımı yanlış. Sadece “model bunu kullanıyor” demek.
Ölçüm yöntemi değiştiriyor
Özellik önemi tek bir şey değil, birkaç farklı yöntemle hesaplanıyor ve farklı sonuç veriyor.
Bazı yöntemler, çok kategorili ya da sürekli değişkenlere yapay olarak yüksek önem veriyor. Yani önem sıralaması, kullanılan yönteme bağlı olabiliyor.
Bir özellik önemi grafiği gördüğünüzde, hangi yöntemle hesaplandığını sorun. Farklı yöntemler farklı sıralama verebilir ve bu, sonucun ne kadar güvenilir olduğunu etkiler.
Korelasyonlu değişkenler
Çoklu doğrusallık, özellik önemini de bozuyor.
İki değişken birbirine benziyorsa, model önemi ikisi arasında keyfi biçimde dağıtıyor. Biri yüksek, öteki düşük önem alabiliyor, halbuki ikisi aynı bilgiyi taşıyor.
Bu, yanıltıcı bir sıralama üretiyor. Düşük önemli görünen bir değişken, aslında yüksek önemli olanla aynı bilgiyi taşıyor olabilir.
Yani özellik önemi sıralamasını, “bu değişken değersiz” diye okumayın. Belki sadece başka bir değişkenle örtüşüyor.
Ne işe yarıyor
Sınırlarına rağmen özellik önemi faydalı.
Modelin mantıklı şeylere mi baktığını kontrol etmeye yarıyor. Model, teorik olarak anlamlı değişkenlere önem veriyorsa, güven artıyor. Anlamsız ya da tesadüfi görünen değişkenlere önem veriyorsa, sızıntı ya da aşırı uyum şüphesi doğuyor.
Gu, Kelly ve Xiu’nun çalışması, farklı ML yöntemlerinin aynı baskın değişkenlerde (momentum, likidite, volatilite) birleştiğini buldu. Bu tür bir tutarlılık, özellik öneminin gerçek bir sinyali yakaladığına işaret ediyor.
Nasıl okumalı
Bir özellik önemi grafiği gördüğünüzde şunları sorun.
Bu nedensellik değil, sadece modelin neye dayandığı.
Hangi yöntemle hesaplanmış? Farklı yöntemler farklı sıralama verir.
Önemli değişkenler teorik olarak anlamlı mı? Anlamsız değişkenlere yüksek önem, sızıntı işareti.
Korelasyonlu değişkenler var mı? Düşük önem, örtüşmeden kaynaklanabilir.
Ve farklı modeller aynı değişkenlerde mi birleşiyor? Tutarlılık, gerçek sinyal işareti.
Sıradaki
Sıradaki yazıda SHAP değerlerini ele alıyoruz. Özellik öneminin daha gelişmiş hali ve tek bir tahmini nasıl açıkladığı.
Bu yazı bilgilendirme amaçlıdır, yatırım tavsiyesi değildir.