FINEMAR

Çapraz doğrulama skorları: bir modelin gerçek performansı

Finemar Araştırma14 Eylül 20262 dk okumaGüncelleme: 27 Temmuz 2026

Ne yapıyor

Çapraz doğrulama, veriyi parçalara bölüp modeli bir parçada test ediyor, diğerlerinde eğitiyor. Bunu her parça için tekrarlayıp ortalama alıyor.

Amaç, modelin görmediği veride nasıl performans göstereceğini tahmin etmek. Eğitim performansı yanıltıcıdır (aşırı uyum), çapraz doğrulama daha dürüst olması beklenir.

Standart makine öğrenmesinde bu iyi çalışıyor. Finansta bir sorun var.

Zaman serisi sorunu

Standart çapraz doğrulama, veriyi rastgele bölüyor. Zaman serisinde bu felaket.

Rastgele bölme, 2020 verisiyle model kurup 2018’i tahmin etmeye çalışmak demek. Yani gelecekle geçmişi tahmin ediyorsunuz. Veri sızıntısının ders kitabı hali.

Sonuç: çapraz doğrulama skoru olduğundan çok yüksek çıkıyor. Model harika görünüyor ama gerçekte, ileriye doğru tahmin ettiğinde çöküyor.

Bir finans ML çalışmasında standart çapraz doğrulama kullanılmışsa, skorlarına güvenmeyin. Muhtemelen şişkin.

Doğru yöntem

Zaman serisinde çapraz doğrulama, zaman sıralı olmalı.

Eğitim her zaman testten önce gelmeli. Walk-forward: sadece geçmişle model kur, geleceği test et, ilerle.

Ve eğitim ile test arasına boşluk (arınma) koymak. Komşu dönemler birbirine bağımlı, özellikle örtüşen pencerelerle hesaplanmış özellikler kullanılıyorsa.

Bir çalışma “zaman serisi çapraz doğrulaması” ya da “walk-forward” diyorsa, doğru yolda. “K-katlı çapraz doğrulama” diyorsa ve zaman sıralamasından bahsetmiyorsa, dikkat.

Test setine kaç kez bakıldı

Çapraz doğrulamanın en sinsi tuzağı: aynı test setine defalarca bakmak.

Bir model kuruyorsunuz, çapraz doğrulama skoruna bakıyorsunuz, beğenmeyip ayar yapıyorsunuz, tekrar bakıyorsunuz. Bunu yeterince yaparsanız, çapraz doğrulama skoru artık dürüst değil.

Çünkü modeli, o test setinde iyi görünecek şekilde ayarladınız. Test seti, dolaylı olarak eğitim setine dönüştü.

Gerçek örnek dışı test, sadece bir kez bakılan settir. Bir çalışma “en iyi modeli çapraz doğrulamayla seçtik” diyorsa, o skor iyimser olabilir.

Deneme sayısı

Çok sayıda model konfigürasyonu denenip en iyi çapraz doğrulama skoruna göre biri seçildiyse, o skor şişkin.

Yüz model deneyip en iyi çapraz doğrulama skorunu raporlamak, çoklu test. En iyi skor, şansın da katkısını içeriyor.

Bu yüzden bir “en iyi çapraz doğrulama skoru”, kaç model denendiğine bağlı. Deflated Sharpe mantığı burada da geçerli: deneme sayısı skoru şişiriyor.

Bizim yaklaşımımız

Random forest denememizde bu sorunları yaşadık.

Model eğitim (ve iyimser çapraz doğrulama) performansında harikaydı. Gerçek örnek dışı testte, 2021 sonrası dönemde, Sharpe 1,79’dan 1,23’e düştü.

Fark, tam olarak çapraz doğrulama skorunun neden güvenilmez olabileceğini gösteriyor. İyimser bir iç skor, gerçek gelecekte tutmadı.

Nasıl okumalı

Bir çapraz doğrulama skoru gördüğünüzde şunları sorun.

Zaman sıralı mı, rastgele mi bölünmüş? Finansta rastgele bölme sızıntı üretir.

Eğitim ile test arasında boşluk var mı?

Test setine kaç kez bakılmış? Model o skora göre ayarlandıysa, skor iyimser.

Kaç model konfigürasyonu denenip en iyisi mi seçilmiş?

Ve gerçek, tek seferlik örnek dışı test yapılmış mı? Bu, çapraz doğrulama skorundan daha güvenilir.

Sıradaki

Sıradaki yazıda öğrenme eğrilerini ele alıyoruz. Bir modelin ne kadar veriyle ne kadar öğrendiğini gösteren bu grafikler nasıl okunur.

Bu yazı bilgilendirme amaçlıdır, yatırım tavsiyesi değildir.

BacktestMakine Öğrenmesi

Bu analizleri kendi hisseleriniz için yapın

586 BIST hissesinin bilanço, çarpan, temettü ve model skorları Finemar terminalinde hazır.

Ücretsiz Dene →

Bu konuyu sitede incele

İlgili Yazılar

Bu içerik yatırım tavsiyesi değildir; eğitim ve bilgilendirme amaçlıdır.