KonuAnlatım.com

Model değerlendirme

Yapay Zekâ · Bölüm 30Yapay ZekâDers

Bu derste bir makine öğrenmesi modelinin gerçekten işe yarayıp yaramadığını nasıl ölçeceğimizi, yani model değerlendirme konusunu baştan sona işliyoruz: veriyi bölme, doğruluk, hassasiyet, duyarlılık, F1 skoru ve hata metrikleri. Serinin tamamı için Yapay Zekâ dersleri sayfamıza bakabilirsin.

Model Değerlendirme Nedir?

Model değerlendirme, eğittiğimiz makine öğrenmesi modelinin daha önce hiç görmediği veriler üzerinde ne kadar başarılı çalıştığını ölçme sürecidir. Soru şudur: model, gördüğü örnekleri ezberledi mi yoksa gerçekten öğrendi mi? Eğitim verisinde %99 başarıya ulaşan bir model, gerçek hayatta aynı başarıyı göstermeyebilir; çünkü yüksek eğitim puanı yalnızca modelin o örnekleri iyi bildiğini kanıtlar.

Bu yüzden değerlendirme, model geliştirmenin ayrılmaz parçasıdır: model seçimi, hiperparametre ayarları ve üretime alma kararı hep bu ölçümlere dayanır. Değerlendirmesiz ilerlemek, sınava girmeden not almayı ummak gibidir.

Değerlendirmenin Temeli: Veriyi Doğru Bölmek

Değerlendirmenin ilk kuralı: model, sınavındaki veriyle asla eğitilmez. Bu yüzden eldeki veri üç parçaya bölünür; ayrıntısını eğitim ve test verisi dersinde işledik, rollerini hatırlayalım:

  • Eğitim kümesi: Modelin örüntüleri öğrendiği ana veri; genellikle en büyük pay buraya ayrılır.
  • Doğrulama kümesi: Model ayarlarını denemek ve farklı modelleri karşılaştırmak için kullanılan ara sınav.
  • Test kümesi: Modelin hiç dokunmadığı son sınav; gerçek performansın rapor edildiği veri.

Veri az olduğunda tek bir bölme işi şansa bırakabilir. Yaygın çözüm çapraz doğrulamadır (cross-validation): veri k parçaya bölünür, model her turda k-1 parçayla eğitilip kalan parçayla sınanır ve bu k kez yinelenir. Ortalama alınan puan, tek bir şanslı bölmenin sonucu değildir.

Sınıflandırma Modellerini Ölçmek

Karışıklık matrisi: dört sonuç

Sınıflandırma modellerinin (spam/normal e-posta, hasta/sağlıklı gibi) performansını anlamak için tahminler gerçeğe göre dört duruma ayrılır; bu tabloya karışıklık matrisi (confusion matrix) denir. Bir spam filtresi üzerinden bakalım:

  • Doğru pozitif (TP): Spam olan e-postayı spam olarak yakalamak.
  • Doğru negatif (TN): Normal e-postayı normal olarak geçmek.
  • Yanlış pozitif (FP): Normal bir e-postayı yanlışlıkla spam sanmak.
  • Yanlış negatif (FN): Gerçek bir spam e-postayı kaçırmak.

Dört hücrenin hepsi her problemde aynı ağırlıkta değildir; hangi hatanın daha pahalı olduğu, hangi metriğe öncelik vereceğimizi belirler.

Doğruluk, hassasiyet, duyarlılık ve F1 skoru

Metriklerden önce klasik tuzlağa bakalım: 1.000 e-postadan 950'si normal, 50'si spam olsun. Hiçbir e-postayı spam diye işaretlemeyen bir model bile %95 doğruluk alır; çünkü normal e-postaların tamamını bilir. Tek başına doğruluğun neden yanıltıcı olduğunu gösteren en net örnek budur.

  • Doğruluk (accuracy): Tüm tahminlerin yüzde kaçının doğru olduğunu gösterir: (TP + TN) / tüm örnekler. Sınıflar dengeliyken iyi bir ilk bakıştır.
  • Hassasiyet (precision): Modelin “spam” dediği e-postaların yüzde kaçı gerçekten spamdir: TP / (TP + FP). Yanlış alarmların pahalı olduğu yerde kritiktir.
  • Duyarlılık (recall): Gerçek spam'lerin yüzde kaçını yakalamıştır: TP / (TP + FN). Kaçırmaların pahalı olduğu yerde kritiktir.
  • F1 skoru: Hassasiyet ile duyarlılığın harmonik ortalamasıdır; ikisini tek bir sayıda dengeler ve dengesiz veri setlerinde doğruluktan çok daha güvenilirdir.

Öncelik uygulamaya göre değişir: hastalık taramasında yanlış negatif (hastayı sağlıklı sanmak) çok pahalı olduğu için duyarlılık öne çıkar; spam filtresinde yanlış pozitif (önemli e-postayı engellemek) kullanıcıyı üzdüğü için hassasiyet. Sınıflandırma probleminde bu ölçütlerin genel yerini sınıflandırma dersinde bulabilirsin.

Regresyon Modellerinde Hata Metrikleri

Model sayı tahmin ediyorsa (ev fiyatı, yarının sıcaklığı gibi) doğru-yanlış saymak yerine tahminin gerçeğe yakınlığı ölçülür; ayrıntısı regresyon dersindedir. En sık kullanılan üç hata ölçütü şunlardır:

  • MAE (ortalama mutlak hata): Farkların mutlak değerlerinin ortalaması; “ortalama kaç birim yanıldım?” sorusuna doğrudan cevap verir ve aykırı değerlerden az etkilenir.
  • MSE (ortalama kare hata): Farkların karesini aldığı için büyük hataları sert biçimde cezalandırır; hata on katına çıkarsa ceza yüz katına çıkar.
  • RMSE: MSE'nin kareköküdür; hata birimini tekrar tahmin birimiyle aynı hâle getirir, bu yüzden yorumlamak kolaydır.

İki modeli karşılaştırırken düşük hata her zaman daha iyidir; yalnızca metriğin birimini (TL, metre, derece) hesaba katmayı unutma.

Aşırı ve Eksik Öğrenmeyi Teşhis Etmek

Değerlendirme yalnızca puan üretmez; modelde neyin ters gittiğini de söyler. Bunun için eğitim puanı ile test puanı birlikte okunur:

  • İki puan da düşükse model eksik öğrenmiş demektir: sorun, modelin verilere göre fazla basit kalmasıdır.
  • Eğitim puanı çok yüksek, test puanı belirgin biçimde düşükse model aşırı öğrenmiş demektir: veriyi ezberlemiştir.
  • İki puan da yüksek ve birbirine yakınsa model gerçekten iyi genelliyor demektir.

Bu iki tabloyu nasıl düzelteceğini Overfitting nedir? ve Underfitting nedir? derslerinde anlattık; burada bilmen gereken, teşhisin ana aracının bu değerlendirme ölçümleri olduğudur.

Sık Yapılan Hatalar ve Yanılgılar

  1. “Doğruluğum %99, modelim mükemmel” demek: Dolandırıcılık tespiti gibi dengesiz veri setlerinde azınlık sınıfını hiç öğrenmeyen bir model bile çok yüksek doğruluk alabilir. Doğruluğun yanında daima hassasiyet ve duyarlılığa bak.
  2. Eğitim verisiyle değerlendirme yapmak: Öğrenciye sınav sorularını önceden vermek gibidir; puan yüksek görünür ama hiçbir şey ölçmez.
  3. Veri sızıntısı (data leakage): Ölçekleme gibi ön işlemleri veriyi bölmeden önce tüm veriye uygulamak, test kümesinden bilgiyi eğitime taşır ve puanı olduğundan daha parlak gösterir.
  4. Test kümesini tekrar tekrar kullanmak: Her denemeden sonra modele göre ayar yapmak, test kümesini fiilen doğrulama kümesine dönüştürür; son puan artık gerçekçi değildir.
  5. Tek metriğe bağlı kalmak: F1'i yüksek iki modelden biri uygulamada çok yavaş olabilir. İyi bir değerlendirme, hata ölçütlerinin yanında hız, maliyet ve yorumlanabilirliği de gözetir.

Güncel bir not: 2024-2025 itibarıyla büyük dil modelleri de aynı mantıkla değerlendiriliyor; genel bilgi, kod yazma ve akıl yürütme alanlarındaki standart testlere (benchmark) tabi tutulup kamuya açık sıralamalarda karşılaştırılıyorlar. Yine de tek bir benchmark puanı, gerçek kullanım başarısını garanti etmez; tıpkı tek bir doğruluk sayısının modelin gerçek iyiliğini söylememesi gibi.

Özetle model değerlendirme, bir kez yapılıp geçilecek bir adım değil; model ve veri değiştikçe yinelenen sürekli bir disiplindir. Bütün bu çerçeveyi Makine öğrenmesi nedir? dersinde bulabilirsin.

Sık Sorulan Sorular

Model değerlendirme nedir?

Model değerlendirme, eğitilmiş bir makine öğrenmesi modelinin görmediği veriler üzerinde ne kadar başarılı olduğunu ölçme sürecidir. Amaç, modelin eğitim verisini ezberleyip ezberlemediğini değil, yeni veriye ne kadar iyi genellediğini ortaya koymaktır.

Doğruluk (accuracy) ile hassasiyet (precision) arasındaki fark nedir?

Doğruluk, tüm tahminlerin yüzde kaçının doğru olduğunu ölçer; hassasiyet ise modelin pozitif dediği örneklerin yüzde kaçının gerçekten pozitif olduğunu ölçer. Dengesiz veri setlerinde doğruluk yanıltıcı olabildiği için yanlış alarmın pahalı olduğu durumlarda hassasiyete, kaçırmanın pahalı olduğu durumlarda duyarlılığa bakılır.

Çapraz doğrulama (cross-validation) nedir, neden kullanılır?

Verinin k parçaya bölünüp modelin her turda k-1 parça ile eğitilip kalan parçayla sınandığı ve puanların ortalamasının alındığı bir değerlendirme yöntemidir. Performans ölçümünü tek bir bölmenin şansına bırakmadığı için özellikle az veri varsa daha güvenilir sonuç verir.

Dersler

Tümü →