KonuAnlatım.com

Eğitim ve Test Verisi

Yapay Zekâ · Bölüm 27Yapay ZekâDers

Bu derste makine öğrenmesinin en temel uygulamalarından biri olan eğitim ve test verisi kavramını sıfırdan işliyoruz: model neden kendi gördüğü örneklerle ölçülmez, veri hangi oranlarda bölünür, doğrulama seti ne işe yarar? Konunun büyük resmini görmek için makine öğrenmesi nedir? dersimize bakabilirsin; alanın tamamı içinse Yapay Zekâ dersleri sayfamıza göz atabilirsin.

Eğitim Verisi ve Test Verisi Nedir?

Eğitim verisi, modelin öğrenirken kullandığı örnekler topluluğudur: her örnekte bir girdi (örneğin bir evin metrekaresi ve oda sayısı) ile çoğu zaman bu girdiye ait doğru cevap, yani etiket bulunur. Etiketli örneklerle çalışma düzeni denetimli öğrenme yaklaşımının temelini oluşturur. Test verisi ise modelin eğitim sırasında hiç görmediği, kenara ayrılmış örneklerdir; modelin yeni veriler üzerindeki gerçek başarısını ölçmek için en sonda kullanılır.

Bunu sınav hazırlığına benzetebilirsin: eğitim verisi, çözümlü sorularla çalışmandır; test verisi ise gerçek sınavdır. Sınavdaki sorular çalıştıklarının birebir aynısı olsaydı, yüksek puan konuyu öğrendiğini değil, ezberlediğini gösterirdi. Makine öğrenmesinde de beklenen şey ezber değil, genellemedir: modelin görmediği örneklerde de doğru davranması gerekir.

Neden Veriyi Bölüyoruz?

Bir modelin yalnızca eğitim verisindeki başarısına bakmak yanıltıcıdır, çünkü model bu örnekleri zaten görmüştür. Aşırı öğrenme denen durumda model, eğitim verisini adeta ezberler: eğitim hatası neredeyse sıfıra iner, buna karşılık yeni verideki başarısı düşer. Bu yüzden performans her zaman modelin görmediği bir parça üzerinde ölçülmelidir. Ezberleme ile genelleme dengesini overfitting nedir? dersimizde ayrıntılarıyla işliyoruz.

Eğitim, Doğrulama ve Test Olarak Üçe Bölme

Uygulamada veri çoğu zaman üç parçaya ayrılır ve her parçanın görevi birbirinden farklıdır:

  1. Eğitim seti: Model, öğrenmesi gereken örüntüleri bu veri üzerinden çıkarır. Genellikle verinin en büyük payı buraya verilir.
  2. Doğrulama seti: Eğitim sırasında modelin gidişatını izlemek, öğrenme hızı ve katman sayısı gibi ayarları seçmek, aşırı öğrenmeyi erken fark etmek için kullanılır.
  3. Test seti: Tüm eğitim ve ayarlama işi bittikten sonra, modele tek seferlik nihai sınav gibi uygulanır.

Oranlar için tek bir kural yoktur: küçük ve orta ölçekli veri setlerinde %80 eğitim - %20 test ya da %70 - %15 - %15 yaygın seçimlerdir. Veri milyonlarca örneğe ulaştığında test ve doğrulama payının yüzdesi küçültülür; örnek sayısı az olsa bile mutlak adet yeterince büyümüştür. Kritik uyarı şu: test setine bakıp model üzerinde ayar çevirmeye devam edersen, test seti sessizce ikinci bir eğitim setine dönüşür ve sonuçları artık güvenilir olmaz. Doğruluk, hata kareler ortalaması gibi ölçütleri model değerlendirme dersimizde topluca inceledik.

Veriyi Bölerken Dikkat Edilecek Noktalar

  • Karıştır: Veri sıralı geliyorsa, örneğin tüm pozitif örnekler başta ise, bölmeden önce satırlar karıştırılmalıdır; aksi hâlde test seti tek yönlü ve yanıltıcı olur.
  • Tabakalandır: Sınıflar dengesizse, örneğin verinin %95'i negatif %5'i pozitifse, her parçaya aynı sınıf oranlarında örnek gitmesi sağlanmalıdır. Bu tür problemleri sınıflandırma dersimizde görebilirsin.
  • Zamana saygı göster: Hava, satış ya da döviz gibi zamanla değişen verilerde rastgele bölme yapılmaz; geçmiş eğitim için, gelecek test için ayrılır. Aksi hâlde model bir bakıma geleceği görmüş olur.
  • Sızıntıyı önle: Ölçekleme gibi hazırlık adımları yalnızca eğitim setinde öğrenilmeli, aynı dönüşüm ardından test setine uygulanmalıdır. Aynı kaydın iki parçada birden yer alması da sızıntı sayılır.
  • Küçük veride çapraz doğrulama: Veri azken tek bir bölmeye güvenmek risklidir; k-katlı çapraz doğrulamada veri k parçaya bölünür, model k kez eğitilip test edilerek daha güvenilir bir ortalama elde edilir.

Sık Yapılan Hatalar ve Yanılgılar

  • "Eğitim başarısı %99 ise model mükemmeldir" yanılgısı: Bu sayı yalnızca görülen örneklerdeki başarıdır; model ezberlemiş olabilir. Karar her zaman ayrı tutulan verideki sonuca göre verilir.
  • Test setini tekrar tekrar kullanmak: Her denemede test sonucuna bakıp modeli değiştirmek test setini yıpratır; seçim işi doğrulama setinde kalmalı, test yalnızca sonda kullanılmalıdır.
  • Bölmeyi unutup tüm veriyle ölçmek: Yeni başlayanların en sık hatasıdır; modeli eğittiğin aynı veriyle değerlendirmek yüksek ama anlamsız bir sonuç verir.
  • İkiz kayıtları fark etmemek: Aynı cümlenin ya da fotoğrafın kopyaları eğitim ve test setine ayrı düşerse başarı yapay biçimde yükselir; bölmeden önce yinelenenler temizlenmelidir.
  • "Veri ne kadar çoksa o kadar iyi" varsayımı: Miktar önemliyse de kalite, çeşitlilik ve temizlik en az miktar kadar belirleyicidir; hatalı etiketlenmiş binlerce örnek, doğru etiketlenmiş yüzlerce örnekten daha kötü sonuç verebilir.

Konu yalnızca akademik bir ayrıntı da değildir: günümüz büyük dil modellerinde eğitim metinleri ile test için ayrılan soru bankalarının iç içe geçmesi, yani veri kirliliği sorunu 2024-2025 döneminde yapay zekâ geliştiren ekiplerin en çok tartıştığı başlıklardan biri hâline gelmiştir. Eğitim ve test verisini doğru ayırmak, bu yüzden hem temel bir kavram hem de güncel bir mühendislik meselesidir.

Sık Sorulan Sorular

Eğitim verisi ile test verisi arasındaki fark nedir?

Eğitim verisi, modelin örüntüleri öğrenirken gördüğü örneklerdir; test verisi ise modelin hiç görmediği, performansını ölçmek için kenara ayrılan örneklerdir. Model, eğitim verisindeki değil test verisindeki başarısıyla değerlendirilir.

Eğitim, doğrulama ve test verisi oranları nasıl olmalıdır?

Küçük ve orta ölçekli veri setlerinde %80-%20 ya da %70-%15-%15 gibi oranlar yaygındır. Veri çok büyüdükçe test ve doğrulama payının yüzdesi küçültülebilir; önemli olan her parçanın görevini karıştırmamak ve test setini yalnızca sonda kullanmaktır.

Model eğitim verisinde başarılı ama test verisinde başarısızsa bu ne anlama gelir?

Bu tablo genellikle aşırı öğrenmeye (overfitting) işaret eder: model eğitim örneklerini ezberlemiş ama genelleme yapamamıştır. Daha fazla ve çeşitli veri, sadeleştirilmiş model ve doğrulama setiyle erken durdurma gibi yöntemlerle bu durum giderilmeye çalışılır.

Dersler

Tümü →