Belirtiler
Eğitim ile test arasında büyük uçurum. En temel işaret. Model eğitim verisinde harika, test verisinde vasat. Öğrenme eğrisindeki büyük boşluk.
Şüpheli derecede yüksek performans. Getiri tahmininde yüksek AUC ya da yüksek R-kare. Bu problem için beklenmeyen bir başarı, aşırı uyum ya da sızıntı işareti.
Kırılganlık. Veriyi biraz değiştirince, ya da farklı bir döneme uygulayınca performans çöküyor.
Anlamsız değişken önemleri. Model, teorik olarak alakasız değişkenlere yüksek önem veriyor. Gürültüde örüntü bulmuş olabilir.
Model karmaşıklığı
Aşırı uyum riski, model karmaşıklığıyla artıyor.
Çok parametreli, çok esnek bir model, gürültüye uyacak kapasiteye sahip. Az parametreli basit model, bu kapasiteye sahip değil, bu yüzden daha dayanıklı.
Bu, düzenlileştirme yazımızdaki denge. Model karmaşıklaştıkça eğitim performansı artıyor ama örnek dışı performans bir noktadan sonra düşüyor.
Bir ML çıktısında, kullanılan modelin karmaşıklığı ile eldeki veri miktarını karşılaştırın. Az veriye karmaşık model, aşırı uyum reçetesi.
En etkili test
Aşırı uyumu (ve sızıntıyı) yakalamanın en güçlü testi: rastgele karıştırılmış hedef.
Hedef değişkeni (getiriyi) rastgele karıştırıyorsunuz, böylece hiçbir gerçek ilişki kalmıyor. Modeli tekrar çalıştırıyorsunuz.
Model hâlâ iyi sonuç veriyorsa, sorun var. Çünkü öğrenilecek gerçek bir şey kalmadığı halde bir şey “öğreniyor”. Bu, ya aşırı uyum ya sızıntı.
Bu test basit ve çok etkili. Yeni bir ML kurulumunda ilk yapılacak şeylerden biri olmalı. Bir çalışma bunu yapmışsa, güven verici.
Örnek dışı çöküş
Aşırı uyumun kesin kanıtı, gerçek örnek dışı testte çöküş.
Bizim random forest denememiz bunu net gösterdi. Eğitimde harika, örnek dışı 2021 sonrası dönemde Sharpe 1,79’dan 1,23’e düştü.
Bu düşüş, aşırı uyumun imzası. Model, eğitim döneminin gürültüsünü öğrenmişti ve o gürültü gelecekte tekrarlanmadı.
Bir ML iddiasında, gerçek örnek dışı performans verilmiş mi? Sadece eğitim ya da iyimser çapraz doğrulama performansı verilmişse, aşırı uyum gizli olabilir.
Basit model karşılaştırması
Aşırı uyumu değerlendirmenin bir yolu, basit bir modelle karşılaştırmak.
Karmaşık ML modeli, basit bir modeli (mesela eşit ağırlıklı kompozit) örnek dışında yeniyor mu?
Yenemiyorsa, karmaşıklık boşuna. Model, ek karmaşıklığını gürültüye harcamış.
Bizim deneyimimizde basit kompozit, random forest’ı örnek dışında yendi. Bu, karmaşıklığın değer katmadığının, aksine aşırı uyum getirdiğinin kanıtıydı.
Nasıl okumalı
Bir ML çıktısında aşırı uyum belirtilerini arayın.
Eğitim ile örnek dışı performans arasında büyük uçurum var mı?
Performans, bu problem için şüpheli derecede yüksek mi?
Rastgele karıştırılmış hedefle test edilmiş mi?
Basit bir modele karşı karşılaştırılmış mı ve onu örnek dışında yeniyor mu?
Ve en önemlisi: gerçek örnek dışı performans verilmiş mi, yoksa sadece eğitim/çapraz doğrulama mı? İkincisi, aşırı uyumu gizleyebilir.
Sıradaki
Sıradaki yazıda makine öğrenmesi makalelerindeki performans iddialarını ele alıyoruz. Bu iddiaların neden sık abartıldığını ve nasıl değerlendirileceğini göreceğiz.
Bu yazı bilgilendirme amaçlıdır, yatırım tavsiyesi değildir.