FINEMAR

Finansın en ünlü makine öğrenmesi makalesi bizim bulgumuzun tersini söylüyor

Finemar Araştırma23 Temmuz 20263 dk okuma

Kendi denememizde random forest modeli örnek dışı dönemde çöktü ve basit bir toplama işlemine yenildi. Bunu yazdık.

Ama bu alanın en çok atıf alan makalesi tam tersini söylüyor.

Gu, Kelly ve Xiu’nun 2020’de Review of Financial Studies’te yayınladığı çalışma, makine öğrenmesi tahminlerinin yatırımcıya büyük ekonomik kazanç sağladığını, bazı durumlarda literatürdeki regresyon bazlı stratejilerin performansını ikiye katladığını gösteriyor. En iyi performansı ağaçlar ve sinir ağları veriyor ve bu kazancın kaynağı, diğer yöntemlerin kaçırdığı doğrusal olmayan etkileşimler.

Bu ciddi bir çelişki gibi görünüyor. Bakalım gerçekten öyle mi.

Ölçek farkı devasa

En büyük fark veri.

Gu, Kelly ve Xiu ABD piyasasında 30 binden fazla hisse ve yaklaşık altmış yıllık aylık veri kullanıyor. Yüzlerce özellik var.

Bizim elimizde 567 hisse ve on dört yıl var.

Bu fark kulağa “bizde daha az veri var” gibi geliyor ama mesele daha derin. Makine öğrenmesi modellerinin ihtiyaç duyduğu şey bağımsız gözlem sayısı.

Aynı ay içindeki tüm hisseler aynı piyasa şokuna maruz kalıyor. Yani bir aydaki 500 gözlem, 500 bağımsız bilgi parçası değil. Gerçek bağımsız birim sayısı ay sayısına yakın. Bizde bu birkaç yüz. Onlarda yedi yüzün üstünde ve her ayda kat kat fazla kesitsel çeşitlilik var.

Esnek modeller veri açlığı çeker. Aç kaldıklarında gürültüyü öğrenirler.

Sinyal gürültü oranı

İkinci fark, tahmin edilmeye çalışılan şeyin ne kadar öngörülebilir olduğu.

Aylık hisse getirilerinde açıklanabilen varyans oranı her piyasada düşük. Ama gelişmekte olan bir piyasada kur şokları, politika değişiklikleri ve likidite kesintileri bu oranı daha da düşürüyor.

Türkiye’de 2018 kur şoku, 2020 pandemi, 2021 sonrası hızlı yükseliş ve enflasyon muhasebesine geçiş art arda geldi. Her biri kesitsel ilişkileri farklı şekilde bozdu.

Model bu dönemlerin birinden öğrenip diğerine uyguladığında, öğrendiği şey artık geçerli değil.

Aslında aynı şeyi buluyoruz

En ilginç kısım burası.

Gu, Kelly ve Xiu’nun bulgularından biri şu: test ettikleri bütün yöntemler aynı baskın tahmin sinyalleri üzerinde birleşiyor. Momentum, likidite ve volatilite varyasyonları.

Bizim kompozit skorumuzun içindeki faktörlere bakın. Volatilite var. Hacim oranı ve likidite var. Fiyatın 52 haftalık zirveye oranı, yani momentum var.

Yani onların karmaşık modellerle bulduğu baskın sinyaller, bizim elle koyduğumuz faktörlerle büyük ölçüde aynı.

Bu bize şunu düşündürdü: belki de makine öğrenmesinin bizim ölçeğimizdeki katkısı, hangi faktörlerin önemli olduğunu bulmak. O iş zaten yapılmış ve sonucu yayınlanmış durumda. Biz sonucu doğrudan kullanabiliyoruz.

Modelin kendisini kurmaya gerek kalmadan, modelin öğrettiği şeyi alabiliyorsunuz.

Ağırlıkları fit etmemenin değeri

Bizim kompozitimizde faktör ağırlıkları veriden öğrenilmiyor. Hepsi eşit ve işaretleri teoriden geliyor.

Bu, ilk bakışta ilkel bir tercih gibi görünüyor. Neden elinizdeki veriyi kullanıp en iyi ağırlıkları bulmayasınız.

Cevap şu: fit edilmiş her parametre, örnek dışında bozulabilecek bir nokta demek. Fit edilmemiş modelin bozulacak bir parametresi yok.

Küçük örneklemde bu takas net biçimde basitlik lehine. Büyük örneklemde tersine dönebilir. Gu, Kelly ve Xiu büyük örneklemde çalışıyor, biz küçük örneklemde. İkimizin de kendi ölçeğinde doğru tercihi yapıyor olması mümkün.

Peki ne zaman makine öğrenmesi denemeli

Kendi deneyimimizden çıkardığımız pratik ölçütler şunlar.

Gerçek bağımsız gözlem sayınız binlerle ifade ediliyorsa deneyebilirsiniz. Yüzlerle ifade ediliyorsa muhtemelen zaman kaybı.

Doğrusal olmayan gerçek bir etkileşim beklemek için sebebiniz varsa anlamlı. Sadece “belki bulur” diye kurulan model genelde bulmuyor.

Örnek dışı testiniz gerçekten örnek dışı olmalı. Aynı veriyi hem model seçiminde hem testte kullanıyorsanız, aldığınız sonuç sahte.

Ve sonucu basit bir alternatifle karşılaştırın. Basit alternatifi yenmiyorsa karmaşıklığın bedeli boşa gidiyor.

Sonuç

İki bulgu çelişmiyor, farklı ölçeklerde farklı şeyler söylüyor.

Onların mesajı: yeterince veri ve doğru kurulumla makine öğrenmesi gerçek katkı sağlıyor ve baskın sinyaller momentum, likidite, volatilite.

Bizim mesajımız: bizim ölçeğimizde o baskın sinyalleri doğrudan kullanmak, onları yeniden keşfetmeye çalışmaktan daha iyi sonuç veriyor.

İkisi bir arada okununca ortaya iyi bir çalışma yöntemi çıkıyor. Büyük çalışmaların bulduğu faktörleri alın, kendi ölçeğinizde basit ve dayanıklı biçimde uygulayın.

Kaynaklar

Bu yazı bilgilendirme amaçlıdır, yatırım tavsiyesi değildir.

Makine ÖğrenmesiAraştırmaKantitatif

Bu analizleri kendi hisseleriniz için yapın

586 BIST hissesinin bilanço, çarpan, temettü ve model skorları Finemar terminalinde hazır.

Ücretsiz Dene →

İlgili Yazılar

Bu içerik yatırım tavsiyesi değildir; eğitim ve bilgilendirme amaçlıdır.