Model eğitimi nedir?
Bu derste yapay zekânın kalbindeki süreci, yani model eğitimini sıfırdan anlatıyoruz: model veriden nasıl öğrenir, kayıp fonksiyonu ne işe yarar, aşırı öğrenme neden sorundur? Konu, Yapay Zekâ dersleri serimizin bu ünitesindeki en uygulayıcı başlıklardan biridir.
Model Eğitimi Nedir?
Model eğitimi, bir yapay zekâ modelinin örnek veriler üzerinden örüntüleri çıkararak görevini yapmayı öğrenme sürecidir. Eğitim sırasında modelin parametre adı verilen iç ayarları kademeli olarak güncellenir; amaç, modelin yalnızca eğitim verisinde değil, hiç görmediği yeni örneklerde de doğru sonuçlar üretebilmesidir. Kısacası model eğitimi, veriden yararlanarak bir tahmin makinesinin ayarını yapmak demektir.
Bir benzetme: eğitilen model, soru çözerek sınava hazırlanan bir öğrenci gibidir. Öğrenci her yanlışında nerede hata yaptığını görüp kendini düzeltir; model de her tahmininden sonra hata miktarını ölçer ve ayarlarını bu hatayı azaltacak yöne çevirir. Bu döngü binlerce, hatta milyonlarca kez yinelendiğinde model görevi büyük ölçüde öğrenmiş olur.
Eğitim Süreci Adım Adım
Süreç, basitten karmaşığa tüm modellerde aynı ana hatları izler. Örnek olarak ev fiyatı tahmini yapan bir modeli ele alalım:
- Veri hazırlığı: Evin metrekaresi, oda sayısı ve ilçesi gibi özelliklerle birlikte gerçek satış fiyatlarını içeren bir veri seti hazırlanır. Verinin bu sürecdeki rolü için Yapay zekâda veri dersine bakabilirsin.
- İlk tahmin: Parametreleri rastgele seçilmiş model ilk tahminlerini yapar. Bu tahminler başta tamamen yanlıştır; tıpkı gitar çalmaya yeni başlayan birinin ilk akorları tutturamaması gibi.
- Hatanın ölçülmesi: Tahminler ile gerçek fiyatlar karşılaştırılır ve aradaki fark, kayıp fonksiyonuyla tek bir sayıya çevrilir.
- Ayarların güncellenmesi: Parametreler, hatayı azaltacak yönde küçük adımlarla değiştirilir.
- Tekrar: 2-4. adımlar veri setinin tamamı üzerinden defalarca yinelenir. Modelin veri setinin tamamını bir kez görmesine bir epoch (epok) denir; eğitimlerde bu döngü genellikle onlarca kez döner.
Kayıp Fonksiyonu: Modelin Hata Notu
Modelin ne kadar yanlış yaptığını tek bir sayı hâlinde veren matematiksel ölçüme kayıp fonksiyonu (loss function) denir. Kayıp, modelin eğitim sırasında aldığı hata notudur: düşük kayıp iyi tahmin, yüksek kayıp kötü tahmin demektir. Eğitimin bütün amacı bu sayıyı mümkün olduğunca düşürmektir.
Geri Yayılım ve Gradyan İnişi
Peki hangi parametre ne kadar değişecek? Hatayı modelin katmanları boyunca geriye doğru izleyerek her parametrenin hataya katkısını hesaplayan yönteme geri yayılım (backpropagation) denir. Ardından gradyan inişi (gradient descent) devreye girer: tüm parametreler hatayı azaltacak yönde biraz çekilir. Bu, sisli bir dağdan inmeye benzer; her adımda en çok alçalan yön seçilir. Adımların büyüklüğüne öğrenme oranı (learning rate) adı verilir: çok büyük seçilirse model hedefi aşıp başarısız olur, çok küçük seçilirse öğrenme aşırı yavaşlar.
Eğitim, Doğrulama ve Test Verisi
Modeli eğitmek yetmez; ne kadar iyi öğrendiğini de dürüstçe ölçmek gerekir. Bu yüzden veri genellikle üç parçaya bölünür:
- Eğitim verisi: Modelin parametreleri güncelleyerek öğrendiği kısımdır; genellikle verinin en büyük payını alır.
- Doğrulama verisi: Eğitim sırasındaki deneme sınavıdır. Kaç epoch dönüleceği ya da öğrenme oranının kaç seçileceği gibi kararlar, modelin bu kısımdaki başarısına bakılarak verilir.
- Test verisi: Eğitim boyunca hiç gösterilmeyen, sona saklanan bölümdür. Eğitim bittikten sonra modelin gerçek hayattaki performansını ölçmek için bir kez kullanılır.
Kritik kural şudur: Test verisine bakarak model ayarlamak, sınav sorularını önceden görüp çalışmaya benzer; elde edilen başarı yanıltıcı olur. Bu yüzden test verisi gerçekten son ana kadar saklanır.
Aşırı Öğrenme ve Eksik Öğrenme
Eğitimin iki klasik tuzağı vardır ve ikisi de modelin gerçek görevde başarısız olmasına yol açar:
- Aşırı öğrenme (overfitting): Model, eğitim verisini neredeyse ezberler. Eğitim başarısı çok yükselirken hiç görmediği verideki başarısı düşer; tıpkı yalnızca geçmiş yılın sorularını ezberleyip yeni soru tipinde çöken öğrenci gibi. En belirgin işareti, eğitim ve test başarısı arasındaki büyük makastır.
- Eksik öğrenme (underfitting): Model ya çok basit kaldığı ya da yeterince eğitilmediği için verideki örüntüyü bile yakalayamaz; hem eğitimde hem testte başarısı düşüktür.
Aşırı öğrenmeyle başa çıkmak için sık kullanılan önlemler şunlardır:
- Daha fazla ve daha çeşitli veriyle eğitmek
- Doğrulama başarısı düşmeye başladığı anda eğitimi durdurmak (early stopping)
- Parametrelerin aşırı büyümesini engelleyen düzenlileştirme (regularization) yöntemleri kullanmak
- Sinir ağlarında eğitim sırasında bazı nöronları rastgele geçici kapatan dropout tekniğini uygulamak
Sık Yapılan Hatalar ve Yanılgılar
- “Model veriyi hafızasına kaydediyor.” Hayır; sağlıklı bir eğitim ezber değil genelleme üretir. Model, milyonlarca örnekten çıkan ortak örüntüleri parametrelerine işler. Tamamen ezberleyen model, aşırı öğrenmiş demektir.
- “Eğitim verisinde başarılıysa işi bitmiştir.” Gerçek başarı yalnızca hiç görülmemiş doğrulama ve test verisiyle anlaşılabilir.
- “Kayıp neredeyse sıfırsa model mükemmeldir.” Aşırı düşük kayıp çoğu zaman aşırı öğrenmenin işaretidir; başarı garantisi değildir.
- “Daha büyük model her zaman daha iyidir.” Veri kalitesi, görev uygunluğu ve doğru ayarlar en az model büyüklüğü kadar belirleyicidir.
- “Eğitim bir kez yapılır ve biter.” Pratikte yinelemelidir: sonuç beklentiyi karşılamazsa veri, model yapısı veya ayarlar değiştirilip yeniden eğitilir.
Güncel Modellerde Eğitim Nasıl Yapılıyor?
2024-2025 döneminde konuşabilen yapay zekâ asistanlarının (ChatGPT, Gemini, Claude gibi) arkasındaki büyük dil modelleri genellikle iki aşamada eğitilir. Önce ön eğitim (pre-training) aşamasında model, devasa metin yığını üzerinde bir sonraki kelimeyi tahmin etmeyi öğrenir; bu sırada dilin yapısı ve akıl yürütme örüntüleri parametrelere işlenir. Ardından ince ayar (fine-tuning) aşamasında insanlarca hazırlanmış soru-cevap örnekleri ve insan geri bildirimi (RLHF) ile model, talimatlara uyan yardımcı bir asistana dönüştürülür. Llama ve Mistral gibi ağırlıkları açıklanmış modellerin yaygınlaşmasıyla şirketler ve araştırmacılar, ön eğitilmiş modelleri kendi verileriyle yeniden eğiterek özelleştirebiliyor. Görüntü üreten modellerde de aynı mantık işler: model, metin-görsel eşleşmelerinden görsel örüntüleri öğrenir.
Sürecin uygulamadaki bütün adımlarını görmek istersen Model eğitimi nasıl yapılır? dersine, eğitilen nesnenin temeline inmek istersen Model nedir? dersine göz at. Eğitim, makine öğrenmesi alanının kalbinde yer alır; etiketli veriyle çalışan bu sürecin kuramsal çerçevesi için Denetimli öğrenme dersine de bakabilirsin.
Sık Sorulan Sorular
Model eğitimi nedir?
Model eğitimi, bir yapay zekâ modelinin örnek veriler üzerinden örüntüleri çıkararak görevini yapmayı öğrenme sürecidir. Model her örnek için tahmin üretir, hatası kayıp fonksiyonuyla ölçülür ve parametreleri hatayı azaltacak yönde güncellenir; bu döngü, model görmediği örneklerde de doğru sonuç üretebilene dek tekrarlanır.
Model eğitimi ile ince ayar (fine-tuning) arasındaki fark nedir?
Model eğitimi, parametrelerin veriyle şekillendirildiği bütün süreci anlatır. İnce ayar ise bunun özel bir türüdür: önceden eğitilmiş bir model alınır ve belirli bir göreve ya da veriye uyarlanmak için daha kısa ve hafif bir eğitim daha yapılır.
Eğitim, doğrulama ve test verisi arasındaki fark nedir?
Eğitim verisi, modelin parametreleri güncelleyerek öğrendiği kısımdır. Doğrulama verisi, eğitim sırasında başarıyı ölçüp ayarları seçmek için kullanılan deneme sınavıdır. Test verisi ise eğitim boyunca hiç gösterilmeyip eğitim bitince gerçek performansı ölçmek için bir kez kullanılan bölümdür.