KonuAnlatım.com

Pekiştirmeli öğrenme

Yapay Zekâ · Bölüm 23Yapay ZekâDers

Bu derste yapay zekânın üç temel öğrenme yaklaşımından biri olan pekiştirmeli öğrenmeyi (reinforcement learning) sıfırdan ele alıyoruz: ajan, ortam ve ödül kavramlarını, keşif–sömürü dengesini ve güncel uygulamalarını. Konunun büyük resimdeki yerini görmek için Makine öğrenmesi nedir? dersine göz atabilir, tüm konulara Yapay Zekâ dersleri sayfasından ulaşabilirsin.

Pekiştirmeli Öğrenme Nedir?

Pekiştirmeli öğrenme, bir ajanın (öğrenen ve karar veren yazılım) bir ortamla etkileşerek, deneme–yanılma yoluyla ve topladığı ödülleri en üst düzeye çıkaracak biçimde davranış stratejisini öğrenmesidir. Doğru cevap baştan kimse tarafından verilmez; ajan her eyleminden sonra yalnızca ödül ya da ceza biçiminde geri bildirim alır ve hangi davranışların iyi sonuç verdiğini kendisi keşfeder. Bisiklet sürmeyi öğrenen bir çocuk gibi düşünebilirsin: Kimse ona denge formülü anlatmaz; düşer, düzeltir, tekrar dener ve sonunda kalıcı bir beceri edinir.

Temel Bileşenler: Ajan, Ortam, Durum, Eylem ve Ödül

Pekiştirmeli öğrenme kurulumlarının hepsi aynı iskeleti paylaşır. Bileşenleri tek tek tanımlayalım:

  • Ajan (agent): Öğrenen taraf. Satrançta hamle yapan program, yürümeyi öğrenen robot.
  • Ortam (environment): Ajanın içinde bulunduğu dünya: satranç tahtası, bir oyun haritası, simülasyondaki fizik ortamı.
  • Durum (state): Ortamın o anki fotoğrafı. Satrançta taşların dizilişi, araba kullanırken yolun ve trafiğin görünümü.
  • Eylem (action): Ajanın o durumda seçtiği hamle: bir taşı oynatmak, direksiyonu kırmak, gazı basmak.
  • Ödül (reward): Eylemden sonra ortamdan gelen sayısal geri bildirim. Olumlu ödül davranışı pekiştirir, negatif ödül (ceza) caydırır.
  • Politika (policy): "Bu durumdayken hangi eylemi yapmalıyım?" sorusunun yanıtı. Öğrenmenin nihai ürünü, yani ajanın stratejisi budur.

Döngü şöyle işler: Ajan durumu gözlemler, bir eylem seçer; ortam yeni durumu ve ödülü döndürür; ajan bu deneyimi kullanarak politikasını günceller ve döngü yeniden başlar. Yüzlerce, binlerce hatta milyonlarca tekrarın sonunda iyi bir politika ortaya çıkar.

Ödül Maksimizasyonu ile Keşif ve Sömürü Dengesi

Ajanın amacı tek bir hamlenin değil, uzun vadede toplanan toplam ödülün en üst düzeye çıkarılmasıdır. Bazen kısa vadede az ödül getiren bir hamle, maçı kazandıracak uzun vadeli planın parçasıdır; satrançta taş feda etmek klasik örnektir. Bu amaca ulaşırken ajan sürekli bir ikilemle yüz yüze gelir:

  • Sömürü (exploitation): Şimdiye kadar iyi sonuç verdiğini bildiği eylemi tekrar seçmek. Güvenlidir ama en iyi çözümü kaçırabilir.
  • Keşif (exploration): Belki daha büyük ödül getirecek, henüz denenmemiş eylemleri denemek. Risklidir ama daha iyi stratejilere giden tek yoldur.

Hep sömürü yapan ajan daha iyi bir çözümü asla fark etmez; hep keşif yapan ajan elindeki iyi çözümü bile tutarlı kullanamaz. Bu yüzden algoritmalar genellikle başta bolca keşif yapar, zaman ilerledikçe en iyi bilinen seçeneklere yönelir. İkinci zorluk, ödülün gecikmeli gelmesidir: Bir satranç partisini kazandıran hamle belki onlarca hamle önce verilmiştir. Hangi eylemin ödüle asıl katkıyı yaptığını ayırt etmek, pekiştirmeli öğrenmenin en zor problemlerinden biridir.

Denetimli ve Denetimsiz Öğrenmeden Farkı

Üç öğrenme yaklaşımını karşılaştıralım:

  • Veri kaynağı: Denetimli öğrenmede hazır girdi–etiket çiftleri verilir; denetimsiz öğrenmede etiketsiz veri içinde örüntü aranır. Pekiştirmeli öğrenmede ise veri baştan yoktur; ajan deneyimi kendi etkileşimiyle üretir.
  • Geri bildirim türü: Denetimli öğrenme yönlendiricidir ("doğru cevap bu"); pekiştirmeli öğrenme değerlendiricidir ("bu eylem 0,7 puan değerinde"). Doğru eylemin ne olduğu hiç söylenmez.
  • Hedef: Denetimli ve denetimsiz öğrenmede hedef genellikle tek bir tahmin ya da keşiftir; pekiştirmeli öğrenmede hedef, uzun vadeli getirisi en yüksek olan davranış dizisidir.
  • Zamanlama: Denetimli öğrenmede her örneğin cevabı anındadır; pekiştirmeli öğrenmede ödül genellikle gecikir.

Üç yaklaşım birbirinin alternatifi değil, tamamlayıcısıdır: Modern büyük dil modellerinde önce dev metin yığınlarıyla ön eğitim yapılır, ardından insan geri bildirimine dayalı pekiştirmeli bir aşama (RLHF) eklenir.

Gerçek Dünyadan Uygulamalar

Pekiştirmeli öğrenme, kararların art arda geldiği her alanda karşımıza çıkar:

  1. Oyunlar: DeepMind'ın AlphaGo'su 2016'da Go'nun dünya şampiyonunu yenerek pekiştirmeli öğrenmeyi geniş kitlelere tanıttı; Atari oyunlarını oynamayı öğrenen ajanlar ve Dota 2'de profesyonel oyuncularla mücadele eden OpenAI Five bu alanın klasik başarılarıdır.
  2. Büyük dil modelleri ve sohbet botları: ChatGPT ve benzeri modern sohbet botlarının yararlı, tutarlı ve güvenli yanıt üretmesinde RLHF (insan geri bildiriminden pekiştirmeli öğrenme) kilit rol oynar. İnsanlar model çıktılarını derecelendirir, bu dereceler ödül sinyaline dönüşür ve model buna göre ayarlanır. 2024-2025 döneminde ise pekiştirmeli öğrenme, modellere adım adım akıl yürütme becerisi kazandırmak için de yaygın biçimde kullanılır: Model doğru sonuca ulaşan düşünme zincirleriyle ödüllendirilir.
  3. Robotik: Robotlar yürüme, nesne tutma ve gezinme becerilerini önce simülasyonda milyonlarca denemeyle öğrenir, sonra bu becerileri gerçek dünyaya aktarmaya çalışır.
  4. Otonom araçlar: Şerit takibi, kavşak geçişi ve trafik kararları, ödül–ceza dengesiyle eğitilen karar zincirleridir.
  5. Kaynak ve süreç optimizasyonu: Veri merkezi soğutmasından enerji dağıtımına, reklam yerleşiminden öneri sıralamasına kadar uzun vadeli getirisi en yüksek kararları bulmak için kullanılır.

Bu başarıların çoğunun arkasında, pekiştirmeli öğrenmeyi derin sinir ağlarıyla birleştiren derin pekiştirmeli öğrenme vardır. Sinir ağlarının nasıl çalıştığını merak ediyorsan Derin öğrenme nedir? ve Yapay sinir ağları derslerimize bakabilirsin.

Sık Yapılan Hatalar ve Yanılgılar

  • "Pekiştirmeli öğrenme, denetimli öğrenmenin bir alt dalıdır" yanılgısı: Değildir. Üçü ayrı paradigmadır; pekiştirmeli öğrenme etiketli veriyle değil, ödül sinyaliyle çalışır.
  • "Veri gerekmez" yanılgısı: Ajan, öğrenmek için muazzam miktarda deneyime ihtiyaç duyar. Oyun ajanları milyonlarca partilik deneyim toplar; bu yüzden eğitimin büyük kısmı hızlı simülasyonlarda yürütülür.
  • "Ödülü sadece sonucu vermek yeter" hatası: Kötü tasarlanmış bir ödül fonksiyonu, ajanın amacı "kandıran" kısayollar üretmesine yol açar. Oyunu bitirmek yerine sonsuz döngüde puan toplamaya çalışan ajanlar, ödül tasarımının neden kritik olduğunun klasik örnekleridir.
  • "Bildiğim iyi yolu tekrarlamak en iyisidir" tuzağı: Keşfi tamamen kapatan ajan yerel bir çözüme takılır ve daha iyi stratejileri hiç görmeden öğrenmeyi bırakır.
  • "Eğitildiği ortamda başarılıysa her yerde başarılıdır" varsayımı: Ajanlar, eğitildikleri ortama aşırı uyum sağlayabilir; koşullar biraz değişince performansları düşebilir. Modellerdeki aşırı öğrenme (overfitting) sorununa benzer bir risk budur; bu yüzden ajanın görmediği koşullarda düzenli olarak model değerlendirme yöntemleriyle sınanması gerekir.

Sık Sorulan Sorular

Pekiştirmeli öğrenme nedir?

Pekiştirmeli öğrenme, bir yapay zekâ ajanının ortamla etkileşerek ve deneme–yanılma yoluyla, topladığı ödülleri en üst düzeye çıkaracak davranış stratejisini (politika) öğrendiği öğrenme yaklaşımıdır.

Pekiştirmeli öğrenme ile denetimli öğrenme arasındaki fark nedir?

Denetimli öğrenmede modele hazır girdi–etiket çiftleri verilir ve doğru cevap bildirilir. Pekiştirmeli öğrenmede doğru cevap verilmez; ajan yalnızca ödül ya da ceza biçiminde değerlendirici geri bildirim alır ve deneyim verisini kendisi üretir.

Pekiştirmeli öğrenme nerede kullanılır?

Oyun ajanları (AlphaGo, Atari, OpenAI Five), robotik, otonom araç kararları, kaynak ve süreç optimizasyonu ile modern büyük dil modellerinin insan geri bildirimiyle ayarlanması (RLHF) başlıca kullanım alanlarıdır.

Dersler

Tümü →