KonuAnlatım.com

Dil modeli nedir?

Yapay Zekâ · Bölüm 44Yapay ZekâDers

Bu derste yapay zekânın en önemli yapı taşlarından biri olan dil modelini (language model) sıfırdan ele alıyoruz: ne işe yaradığını, nasıl çalıştığını, tarihçesini ve bu konudaki yaygın yanılgıları. Telefonunuzdaki klavye önerisinden ChatGPT'ye kadar pek çok teknolojinin arkasında bir dil modeli çalışır. Serinin tamamı için Yapay Zekâ dersleri bölümümüze bakabilirsin.

Dil Modeli Nedir?

Dil modeli, bir metinde sıradaki kelimenin ne olacağını olasılıklara dayanarak tahmin eden yapay zekâ modelidir. Matematiksel dille söylemek gerekirse “bu kelimelerden sonra hangi kelime gelir?” sorusunun cevabını bir olasılık dağılımı hâlinde hesaplar ve bu dağılımı devasa metin yığınlarından öğrenir. Dil modelleri, doğal dil işlemenin (NLP) merkezindedir; alanın genel çerçevesi için NLP nedir? dersine bakabilirsin.

Dil modellerinin iki temel işlevi vardır: değerlendirme ve üretme. Değerlendirme, verilen bir cümlenin dile ne kadar doğal geldiğini puanlamaktır; üretme ise bu puanlama bilgisini kullanarak yeni metin yazmaktır. Klavyenizin yanlış yazılan kelimeyi düzeltirken birincisini, sonraki kelimeyi önerirken ikincisini kullandığını düşünün.

Dil Modeli Nasıl Çalışır: Sıradaki Kelimeyi Tahmin Etme

Model, eğitimde kitaplar, web sayfaları ve makalelerden oluşan devasa bir metin yığını üzerinden geçer: her adımda metnin bir parçasını görüp sıradaki parçayı tahmin eder, yanıldığında hata sinyaliyle iç ağırlıklarını biraz düzeltir. Bu işlem milyarlarca kez tekrarlandığında model, grameri, anlam ilişkilerini ve dünyaya dair pek çok bilgiyi istatistiksel olarak edinmiş olur. Süreç dört basamakta özetlanabilir:

1. Metin tokenlara bölünür

Model kelimeleri tek bir bütün olarak değil, kelime parçaları hâlinde işler; bu parçalara token denir. Örneğin “okullarda” kelimesi “okul” + “larda” biçiminde ayrılabilir. Kavramın ayrıntısı için Token nedir? dersine göz atın.

2. Tokenlar sayılara çevrilir

Bilgisayar kelimelerle değil sayılarla çalıştığı için her token, anlamını temsil eden uzun bir sayı listesine dönüştürülür. Bu gösterime embedding denir; benzer anlamlı ifadeler bu sayı uzayında birbirine yakın konumlanır. Ayrıntılar Embedding nedir? dersinde.

3. Bağlama göre olasılıklar hesaplanır

Model, o ana kadar okuduğu tüm tokenlara bakarak (aynı anda görebildiği uzunluğa bağlam penceresi denir) sözlüğündeki her aday için bir olasılık üretir. “Ankara, Türkiye'nin ______” kalıbında “başkenti” olasılığı çok yüksek, “limanı” olasılığı oldukça düşük çıkar.

4. Bir token seçilir ve döngü sürer

Seçilen token metne eklenir; model artık daha uzun bir bağlam için yeniden tahmin yapar, yani yanıtlar aslında token token üretilir. Üretim sırasındaki sıcaklık (temperature) ayarı rastgelelik düzeyini belirler; bu yüzden aynı soru her seferinde birebir aynı yanıtı almayabilir.

N-gram'dan LLM'lere: Kısa Bir Tarihçe

Dil modeli kavramı, günümüzdeki büyük modellerden çok daha eski ve köklüdür. Evrimi kabaca şu başlıklarla özetlanabilir:

  • 1980'ler–2010'lar: N-gram adı verilen istatistiksel modeller, metinde yan yana gelen kelime gruplarını sayarak çalışırdı ancak yalnızca birkaç önceki kelimeye bakabiliyordu.
  • 2013–2017: Kelimelerin sayı vektörleriyle gösterilmesi (word2vec) ve RNN/LSTM gibi sinir ağları, modellerin anlam benzerliklerini yakalamasını sağladı.
  • 2017: Transformer mimarisi yayımlandı; “dikkat” (attention) mekanizması sayesinde model, cümledeki uzak kelimeler arasındaki ilişkileri de görebildi ve eğitim çok daha büyük ölçeğe taşındı.
  • 2018–2020: BERT ve GPT aileleri ortaya çıktı; GPT-3 ile model boyutu büyüdükçe yeni yeteneklerin kendiliğinden belirdiği görüldü.
  • 2022: ChatGPT'nin yayımlanması dil modellerini uzman aracından milyonların günlük aracına dönüştürdü.
  • 2024–2025: Modeller metnin yanında görüntü ve sesi de işler hâle geldi; akıl yürütme odaklı modeller, telefonlarda çalışan küçük modeller ve açık ağırlıklı aileler (Llama, Mistral gibi) yaygınlaştı.

Bu evrimin ortak paydası hiç değişmedi: hepsi aynı temel görevi, yani sıradaki tokeni tahmin etmeyi öğrenir. Değişen şey, görevin yerine getirildiği mimari ile veri ve parametre ölçeğidir.

Dil Modeli, LLM ve Üretken Yapay Zekâ Arasındaki İlişki

Bu üç kavram sık karıştırılır; oysa iç içe geçmiş halkalardır:

  • Dil modeli: Sıradaki tokeni tahmin eden her model bu tanıma girer; küçük modeller de dil modelidir.
  • Büyük dil modeli (LLM): Milyarlarca parametreyle eğitilmiş, geniş dünya bilgisi taşıyan dil modeli türüdür; sohbet botlarının motoru budur. Ayrıntı için LLM nedir? dersine bakın.
  • Üretken yapay zekâ: En geniş şemsiye kavramdır; görsel, ses ve video üreten modelleri de kapsar. Üretken yapay zekâ nedir? dersi bu ayrımı işler.

Dil Modeli Nerelerde Kullanılır?

Dil modelleri bugün fark ettiğimizden çok daha geniş bir alanda sessizce çalışır:

  • Akıllı klavyeler: Sonraki kelime önerisi ve yazım düzeltme.
  • Sohbet asistanları: ChatGPT, Claude, Gemini gibi ürünlerin çekirdeği bir dil modelidir; bu ürünlerin çalışma biçimi için Chatbotlar nasıl çalışır? dersine bakabilirsin.
  • Makine çevirisi: Modern çeviri sistemlerinin ürettiği akıcı cümleler büyük ölçüde dil modeli bileşeninden gelir; ayrıntı Makine çevirisi dersinde.
  • Konuşma tanıma: Sesli asistanlar, aday kelimeler arasından en anlamlı cümleyi dil modelinin puanlamasıyla seçer.
  • Metin işleme görevleri: Metin özetleme, Duygu analizi ve Metin sınıflandırma gibi görevler günümüzde çoğunlukla dil modeli tabanlı yaklaşımlarla çözülür.
  • Kod yardımcıları: Kod tamamlama araçları, programlamayı da bir dil olarak modelleyerek satır önerir.

Sık Yapılan Hatalar ve Yanılgılar

Konuya yeni başlayanların en sık düştüğü yanılgılar şunlardır:

  • “Model her şeyi bilir.” Modelin bilgisi eğitim verisindeki örüntülerle sınırlıdır; eğitimin tamamlanmasından sonraki gelişmeleri kendiliğinden bilemez. Bazı ürünler web aramasıyla bu boşluğu kapatır.
  • “Model eğitim metinlerini ezbere saklar.” Veri, kelimesi kelimesine değil örüntüler hâlinde sıkıştırılır; bu yüzden model hiç görmediği cümleleri de kurabilir.
  • “Akıcı yazan model doğrudur.” Modelin hedefi doğruluk değil olasılıksal akıcılıktır; kendinden emin görünen yanlış bilgiler üretebilir. Buna halüsinasyon denir; kritik bilgileri mutlaka başka kaynaklardan doğrulayın.
  • “Dil modeli demek ChatGPT demektir.” ChatGPT, bir dil modelinin üzerine kurulmuş bir üründür; ayrıca her dil modeli sohbet etmez, bazıları yalnızca cümle puanlar.
  • “Model kelimeleri insan gibi anlar.” Anlam, modelde istatistiksel örüntüler olarak yaşar; insan gibi bilinçli bir kavrayış yoktur. Yine de bu örüntüler pratikte şaşırtıcı biçimde iş görür.

Son bir not: Modelden alacağın çıktının kalitesi, ona nasıl soru sorduğuna bağlıdır; bu beceri prompt yazımıdır ve Prompt nedir? dersinde ayrıntılı işlenir. ChatGPT'nin bu motoru nasıl kullandığını merak ediyorsan ChatGPT nasıl çalışır? dersine geçebilirsin.

Sık Sorulan Sorular

Dil modeli nedir?

Dil modeli, bir metinde sıradaki kelimenin (tokenın) ne olacağını olasılıklara dayanarak tahmin eden yapay zekâ modelidir. Milyarlarca örnek cümleden dilin örüntülerini öğrenir; hem cümleleri puanlamak hem de yeni metin üretmek için kullanılır.

Dil modeli ile LLM arasındaki fark nedir?

LLM (büyük dil modeli), dil modelinin çok büyük boyutlu bir türüdür. Küçük dil modelleri klavye önerisi gibi dar görevler için yeterlidir; LLM'ler ise milyarlarca parametreyle eğitilir ve sohbet, yazı yazma, kod gibi geniş görevleri üstlenir.

Dil modelleri neden yanlış bilgi üretir?

Çünkü görevleri doğru bilgiyi aktarmak değil, bağlama en olası gelen kelimeyi üretmektir. Model, akıcı ama gerçeğe uymayan cümleler kurabilir; buna halüsinasyon denir. Bu yüzden çıktılar güvenilir kaynaklarla doğrulanmalıdır.

Dersler

Tümü →