Transformer mimarisi
Bu derste ChatGPT, Gemini ve benzeri büyük dil modellerinin ortak temeli olan Transformer mimarisini sıfırdan anlatıyoruz: neden ortaya çıktığını, temel bileşenlerini, RNN ile farklarını ve sık yapılan yanılgıları. Konuyu daha geniş çerçevesiyle görmek istersen Yapay Zekâ dersleri bölümümüze göz atabilirsin.
Transformer Mimarisi Nedir?
Transformer, bir dizideki tüm öğelerin birbirine aynı anda bakmasını sağlayan dikkat (attention) mekanizması üzerine kurulu bir derin öğrenme mimarisidir. 2017 yılında Google araştırmacılarının yayımladığı Attention Is All You Need adlı makaleyle tanıtıldı ve kısa sürede doğal dil işlemede standart hâline geldi. Bugün sohbet botlarından çeviri sistemlerine, kod asistanlarından arama motorlarına kadar pek çok teknoloji bu mimarinin üzerine kuruludur.
Neden Transformer'a İhtiyaç Duyuldu?
Transformer'dan önce metin gibi dizileri işlemek çoğunlukla RNN mimarileriyle yapılıyordu. RNN'ler cümleyi kelime kelime, soldan sağa okur. Bu sıralı işleyiş iki ciddi sorun yaratıyordu:
- Hız: Her kelime bir öncekinin sonucunu beklediği için işlemler paralel yapılamıyor; devasa veriyle model eğitmek pratik olmaktan çıkıyordu.
- Unutma: Uzun dizilerde baştaki bilgi sona doğru zayıflıyordu. 'Ali yıllar önce Ankara'ya taşındı' cümlesinden sonra gelen 'oradaki işimi çok sevdim' ifadesinde 'orada'nın Ankarayı göstermesi, model için zor yakalanan bir bağdı.
Transformer bu iki sorunu kökten çözdü: diziyi sırayla okumak yerine tüm konumlar aynı anda işlenir, kelimeler arasındaki ilişkiler dikkat mekanizmasıyla doğrudan kurulur.
Transformer'ın Temel Bileşenleri
Transformer da öteki yapay sinir ağları gibi katmanlar hâlinde örgütlüdür; onu farklı kılan, içine yerleştirilmiş dikkat katmanlarıdır. Bileşenleri tek tek görelim.
Tokenleştirme ve Gömme (Embedding)
Model metni olduğu gibi işlemez; önce metin küçük parçalara bölünür. Bu parçalara token denir. Her token, sayılardan oluşan bir vektöre dönüştürülür; anlamca yakın kelimeler bu vektör uzayında birbirine yakın durur. Örneğin 'kedi' ile 'köpek' vektörleri, 'kedi' ile 'mikrofon' vektörlerinden daha yakındır.
Öz Dikkat (Self-Attention)
Öz dikkat, her tokenin cümledeki öteki tokenlerle ne kadar ilişkili olduğunu hesaplayan mekanizmadır. Her token için üç vektör üretilir:
- Query (sorgu): Bu kelime neyin peşinde, neyi arıyor?
- Key (anahtar): Bu kelime kendisiyle ilgili ne sunuyor?
- Value (değer): Eşleşme olursa aktarılacak asıl bilgi ne?
Her kelimenin sorgusu, öteki tüm kelimelerin anahtarlarıyla karşılaştırılır ve bir benzerlik puanı çıkar; puanlar, hangi kelimenin bilgisinin ne ölçüde karışacağını belirler. Böylece 'yüz' kelimesi 'Havuzda yüz dersi aldım' cümlesinde 'havuz'a, 'Yüzünü yıkadı' cümlesinde ise yıkama eylemine bağlanır. Anlam, tek tek kelimeden değil bağlamdan hesaplanır.
Çok Başlı Dikkat (Multi-Head Attention)
Tek bir dikkat hesabı tek bir bakış açısı verir. Bu yüzden model aynı anda birçok dikkat başı çalıştırır: bir baş özne–yüklem gibi gramer ilişkilerini, bir baş anlam öbeklerini, bir baş uzak kelimeler arasındaki bağları izler. Başların çıktıları birleştirilerek zengin bir temsil elde edilir.
Konumsal Kodlama ve Destekleyici Katmanlar
Kelimeler aynı anda işlendiği için model, sıra bilgisini dışarıdan alır: her tokenin vektörüne, konumunu anlatan sayısal bir desen eklenir; buna konumsal kodlama denir. 'Ali Ayşe'ye kitabı verdi' ile 'Ayşe Ali'ye kitabı verdi' aynı kelimeleri içerdiği için bu bilgi olmadan ikisi ayırt edilemezdi. Dikkat katmanlarının ardından her konumda ayrı bir ileri beslemeli ağ çalışır; artık bağlantılar (residual connections) bilgiyi katmanlar boyunca sağlıklı biçimde taşır. Katman kavramının temellerini Katmanlar dersinde bulabilirsin.
Kodlayıcı ve Kod Çözücü: Üç Model Ailesi
Orijinal Transformer iki bloktan oluşur: girdiyi anlamlandıran kodlayıcı (encoder) ve çıktıyı üreten kod çözücü (decoder). Bu iki blok, günümüz modellerinin üç büyük ailesini doğurmuştur:
- Yalnızca kodlayıcı: Metni anlamlandırma ve sınıflandırma görevlerinde kullanılır; temsilcisi BERT'tir. Duygu analizi gibi metin sınıflandırma işlerinde yaygındır.
- Yalnızca kod çözücü: Bir sonraki tokeni tahmin ederek metin üretir; GPT ailesi bu yapıdadır ve ChatGPT gibi sohbet modellerinin çoğu bu ailedendir.
- Kodlayıcı ve kod çözücü birlikte: Çeviri, özetleme gibi girdiden çıktıya dönüşüm gerektiren görevlerde kullanılır; T5 bu aileye iyi bir örnektir.
Transformer ile RNN Arasındaki Temel Farklar
İki mimariyi yan yana koyduğumuzda Transformer'ın kısa sürede standart hâline gelmesi anlaşılır:
- İşleme biçimi: RNN sıralı çalışır; Transformer diziyi paralel işler.
- Eğitim ölçeği: Paralellik sayesinde Transformer'lar çok daha büyük veri ve model boyutuyla eğitilebilir.
- Uzun bağlam: Transformer, cümlenin başıyla sonu arasındaki ilişkiyi doğrudan kurar; RNN'de bu bilgi adım adım zayıflar.
- Donanım uyumu: Transformer'ın paralel yapısı GPU'larla ideal eşleşir; bu sinerji olmadan büyük dil modelleri mümkün olmazdı. Ayrıntı için GPU ve yapay zekâ dersimize bakabilirsin.
Sık Yapılan Hatalar ve Yanılgılar
Transformer'ı öğrenirken karşılaşılan yaygın yanılgıları tek tek düzeltelim:
- 'Transformer kelime sırasını umursamaz.' Dikkat mekanizması sırayı kendiliğinden bilmez ama konumsal kodlama bu bilgiyi açıkça sağlar; sıra model için kritiktir.
- 'Dikkat, insanca anlamaktır.' Öz dikkat istatistiksel bir ilişki ölçer; anlıyormuş gibi görünen davranış, çok büyük veri üzerinde bu ilişkilerin öğrenilmesinin sonucudur.
- 'ChatGPT Transformer'ın tamamını kullanır.' Günümüz sohbet modellerinin çoğu yalnızca kod çözücü bloğu kullanır; içinde ayrı bir kodlayıcı yoktur.
- 'Transformer yalnızca metin içindir.' Aynı mimari; görüntü işlemede (Vision Transformer), ses tanımada ve protein yapısı araştırmalarında da kullanılır.
- 'Dikkat başı sayısı arttıkça model kesinlikle iyileşir.' Baş sayısı tek başına performansı belirlemez; veri kalitesi, model boyutu ve eğitim süreci en az o kadar etkilidir.
2024–2025 döneminde Transformer, yalnızca sohbet modellerinin değil; metin, görsel ve sesi birlikte işleyen çok modelli sistemlerin, uzun bağlamlı kod asistanlarının ve telefonlarda çalışabilen küçük dil modellerinin de temelidir. Mimarinin doğal dil işleme alanına etkisini NLP nedir? dersinde geniş biçimde ele aldık. Bir sonraki adım olarak bir dil modelinin metni nasıl parçalara ayırdığını incelemek, konuyu sağlamlaştırmanın en iyi yoludur.
Sık Sorulan Sorular
Transformer mimarisi nedir?
Tüm kelimelerin birbirine aynı anda bakmasını sağlayan dikkat (attention) mekanizması üzerine kurulu derin öğrenme mimarisidir. 2017'de tanıtılmış olup ChatGPT, Gemini ve benzeri büyük dil modellerinin temelini oluşturur.
Transformer ile RNN arasındaki fark nedir?
RNN metni kelime kelime sırayla işler ve uzun dizilerde baştaki bilgiyi kaybeder. Transformer tüm kelimeleri aynı anda işler, dikkat mekanizmasıyla uzak ilişkileri doğrudan kurar ve GPU'larda paralel eğitilebildiği için çok daha hızlıdır.
GPT ile BERT arasındaki fark nedir?
İkisi de Transformer temellidir. GPT yalnızca kod çözücü (decoder) bloğunu kullanır ve bir sonraki kelimeyi tahmin ederek metin üretir; BERT yalnızca kodlayıcı (encoder) bloğunu kullanır ve anlamlandırma ile sınıflandırma görevlerinde güçlüdür.