Sorun ne
İki özellik birbirine çok benzediğinde, model hangisinin ne kadar katkı yaptığını ayırt edemiyor.
Sonuç: katsayılar kararsızlaşıyor. Verinin küçük bir bölümünü değiştirdiğinizde katsayılar ciddi biçimde oynayabiliyor. Hatta işaret değiştirebiliyor.
Modelin toplam tahmin gücü çok bozulmuyor ama yorumlanabilirliği kayboluyor. “Hangi faktör önemli” sorusuna cevap veremiyorsunuz.
Somut örnek
Diyelim iki özellik neredeyse aynı. Model şu iki ağırlığı da seçebilir: her ikisine 0,5 vermek ya da birine 5 verip diğerine eksi 4,5 vermek.
İkisi de eğitim verisine benzer uyum sağlıyor. Ama ikincisi son derece kırılgan. Örnek dışında iki özellik biraz ayrıştığında sonuç patlıyor.
Optimizasyon algoritması, ikisi arasında ayrım yapamıyor. Ve genelde kırılgan olanı seçiyor, çünkü eğitim verisine bir kıl payı daha iyi uyuyor.
Nasıl fark edilir
Katsayı işaretleri teoriye ters çıkıyor. Düşük volatilitenin iyi olduğunu biliyorsunuz ama model pozitif katsayı veriyor. Bu, başka bir özellikle çakışmadan kaynaklanıyor olabilir.
Küçük veri değişiklikleri katsayıları çok oynatıyor. Veriyi biraz kırpıp modeli yeniden çalıştırın. Katsayılar ciddi değişiyorsa sorun var.
Katsayılar alışılmadık derecede büyük. Yukarıdaki örnekteki gibi.
Özellikler arası korelasyon matrisi. En basit teşhis. 0,8 üstü korelasyonlar dikkat gerektiriyor.
Çözümler
Birini çıkarın. En basiti. İki özellik neredeyse aynıysa, ikisini birden tutmanın faydası yok.
Biz idiyosinkratik volatiliteyi test edip toplam volatiliteye çok yakın sonuç verdiğini görünce, basitlik için toplam volatiliteyi tuttuk. Tam olarak bu mantık.
Birleştirin. İki benzer özelliğin ortalamasını alıp tek bir özellik yapmak.
Düzenlileştirme uygulayın. Katsayı cezası, aşırı büyük ve birbirini götüren katsayıları engelliyor.
Ağırlıkları hiç fit etmeyin. Bizim çözümümüz. Katsayı tahmin etmiyorsanız, kararsız katsayı sorunu da olmuyor.
Bu sonuncusu, çoklu doğrusallığı tamamen ortadan kaldırıyor. Eşit ağırlıkla topladığınızda, iki benzer özellik sadece o boyuta iki kat ağırlık vermiş oluyor. Bu bir miktar dengesizlik yaratıyor ama patlayan katsayı riski yok.
Faktör modellerinde de aynı sorun
Bu, Fama-French yazımızda anlattığımız Türkiye testlerindeki tutarsızlığın olası sebeplerinden biri.
Faktörler arası korelasyon yüksek olduğunda, katsayılar örneklem ve dönem seçimine çok duyarlı hale geliyor. Farklı çalışmalar farklı işaretler bulabiliyor.
Yani “bu çalışma şunu buldu, öteki bunu” durumunun bir kısmı, gerçek bir anlaşmazlık değil, kararsız tahmin.
Pratik kural
Modelinize yeni bir özellik eklemeden önce, mevcut özelliklerle korelasyonuna bakın.
Yüksekse iki seçeneğiniz var: eklemeyin ya da mevcut olanı çıkarıp yenisini koyun. İkisini birden tutmayın.
Ve modelinizin katsayılarına bakarken, işaretlerin teoriyle uyumlu olup olmadığını kontrol edin. Uyumsuz bir işaret, çoklu doğrusallığın en görünür belirtisi.
Sıradaki
Bir sonraki yazıda model birleştirmeyi ele alıyoruz. Birden fazla modelin oyunu almak neden işe yarıyor ve bizim denememizde neden marjinal kaldı.
Bu yazı bilgilendirme amaçlıdır, yatırım tavsiyesi değildir.