Embedding nedir?
Bu derste yapay zekânın "anlam haritası" sayılan embedding kavramını sıfırdan işliyoruz: kelimelerin ve cümlelerin sayılara nasıl çevrildiğini, benzerliğin nasıl ölçüldüğünü ve hangi uygulamalarda kullanıldığını bol örnekle anlatıyoruz. Konunun çerçevesi için NLP nedir? dersine, tüm seriler için Yapay Zekâ dersleri sayfamıza bakabilirsin.
Embedding Nedir?
Embedding, kelimeleri, cümleleri veya bütün belgeleri sabit uzunlukta sayı listelerine, yani vektörlere dönüştürme işlemidir. Amaç, anlamı sayısal biçimde korumaktır: anlamca yakın ifadelerin vektörleri de sayısal uzayda birbirine yakın çıkar. Örneğin "kedi" ile "köpek" vektörleri birbirine yakınken, "kedi" ile "kira sözleşmesi" vektörleri uzakta olur.
Tek tek sayıların hiçbiri tek başına özel bir anlam taşımaz; anlam, vektörün bütününde kodlanır. Günümüz modellerinde bu liste birkaç yüzden birkaç bin sayıya kadar uzanabilir. Embedding sayesinde bilgisayar, metni harf dizisi olarak değil, uzayda konumu olan noktalar olarak işler; anlam sorusu da "hangi noktalar yakın?" sorusuna dönüşür.
Embedding Nasıl Oluşturulur?
Embedding'ler, devasa metin yığınları üzerinde eğitilen modeller tarafından üretilir. Temel fikir, dağılımsal hipotez diye bilinen gözlemdir: aynı bağlamlarda geçen kelimeler anlamca yakındır. Model, "soğuk" kelimesini "ılık" ve "serin" gibi kelimelerle sık sık aynı cümlelerde gördüğü için, bu kelimelerin vektörlerini uzayda birbirine yakın yerleştirir.
Kelime düzeyinden cümle düzeyine
Yolculuk kelime düzeyinde başladı: 2013 tarihli word2vec ve onu izleyen GloVe gibi yöntemler her kelimeye tek ve sabit bir vektör verdi. Transformer mimarlı günümüz modelleri ise bağlama göre değişen vektörler üretir; "yüz" kelimesi "yüzmek" ve "yüz numara" bağlamlarında farklı vektörler alır.
Bugün ticari tarafta OpenAI'ın text-embedding-3 ailesi ve Cohere Embed, açık kaynak tarafta sentence-transformers, BGE ve E5 aileleri yaygın kullanılıyor; modern modellerin çoğu çok dillidir, yani Türkçe bir cümleyle İngilizce karşılığı uzayda aynı bölgeye yerleşir. Modeller metni işlemeden önce küçük parçalara ayırır; bu parçalara token denir ve ayrıntısını Token nedir? dersinde bulabilirsin.
Anlamı Sayılarla Görmek: Küçük Bir Örnek
Soyut fikri somutlaştırmak için her kelimeyi yalnızca üç sayıyla temsil edelim; gerçekte listede çok daha fazla sayı olur:
- "kral" → [0.95, 0.90, 0.80]
- "kraliçe" → [0.95, -0.90, 0.80]
- "adam" → [0.10, 0.85, 0.75]
- "kadın" → [0.10, -0.85, 0.75]
Bu sayıları sırasıyla "kraliyetlik", "erillik-kadınlık" ve "canlılık" diye düşünebilirsin; ama bu etiketler yalnızca anlaşılır olsun diye var. Gerçek modellerde boyutların adı yoktur; anlamları, modelin kendi öğrendiği soyut özelliklerdir. Örneğin asıl güzelliği vektörlerin üzerinde aritmetik yapabilmektir: kral - adam + kadın ≈ kraliçe işlemi, word2vec'in ünlü örneğinde yaklaşık olarak doğru çıkar. Yani model, "kraliyet" kavramını cinsiyetten bağımsız bir yön olarak öğrenmiştir.
Benzerlik Nasıl Ölçülür?
İki vektörün ne kadar yakın olduğunu ölçmenin en yaygın yolu kosinüs benzerliğidir: iki vektör arasındaki açıya bakar, uzunluklarına aldırış etmez. Skor 1'e yaklaştıkça anlamlar yaklaşır, 0 civarındaki skorlar ilgisizliği, negatif değerler zıt yönlülüğü gösterir. Aynı iş için nokta çarpım ve Öklid mesafesi de kullanılabilir.
- "Bugün hava çok sıcak" ↔ "Hava bugün gerçekten sıcak" → yüksek benzerlik
- "Bugün hava çok sıcak" ↔ "Yarın finallerim başlıyor" → düşük benzerlik
Buradaki ifadeler temsilidir; önemli olan fikir, aynı düşünceyi farklı kelimelerle söyleyen cümlelerin yakalanabilmesidir. Anahtar kelime araması, "sıcak" kelimesini geçmeyen "Bugün oldukça bunaltıcıydı" cümlesini kaçırmaya eğilimlidir; anlamsal arama ise onu da bulur.
Embedding Ne İşe Yarar?
- Anlamsal arama ve RAG: Kullanıcının sorusu vektöre çevrilir, belge havuzunda en yakın parçalar bulunur ve cevap bu parçalardan üretilir. Şirket içi dokümanlarla çalışan asistanlar bu düzenekle çalışır; genel akışı RAG nedir? dersinde işliyoruz.
- Metin sınıflandırma: Vektör, sınıflandırıcının girdisi olur; spam ayrımı ve konu etiketleme bu sayede kolaylaşır. Ayrıntı için Metin sınıflandırma dersine bakabilirsin; duygu yönü ağır basan örnekler için Duygu analizi dersi aynı düzlemi kullanır.
- Öneri sistemleri: Beğendiğin yazının vektörüne yakın içerikler sıraya sokulur; "buna benzerler" listeleri çoğunlukla embedding üzerinedir.
- Kümeleme ve konu keşfi: Etiket olmadan, binlerce müşteri yorumu uzayda kümelere ayrılır ve başlıklar kendiliğinden ortaya çıkar.
- Yinelenen içerik tespiti: Farklı ifadelerle yazılmış aynı sorular ("Şifremi unuttum" / "Şifre sıfırlama") tek grup altında toplanır.
Sık Yapılan Hatalar ve Yanılgılar
- "Embedding, anahtar kelime aramasının gelişmişi" sanmak. İkisi farklı iş yapar: biri harf eşleşmesi, öteki anlam yakınlığı; güçlü arama sistemleri ikisini birlikte kullanır.
- Modelin "anladığını" düşünmek. Embedding, istatistiksel bir öğrenmenin ürünüdür; insan anlamındaki bir kavrayış değildir.
- Yüksek benzerlik skorunu doğruluk sanmak. İki metnin birbirine benzemesi, ikisinin de doğru olduğu anlamına gelmez.
- Embedding modeliyle sohbet modelini karıştırmak. Embedding modeli yalnızca vektör üretir; yazı yazan ve sohbet eden taraf LLM nedir? dersinin konusudur, altındaki mekanizmayı merak edenler Dil modeli nedir? dersine bakabilir.
- Vektörden metnin geri alınabileceğini sanmak. Dönüşüm kayıplıdır; vektör metnin kendisi değil, anlamının sıkıştırılmış bir haritasıdır.
Kısaca özetlersek: embedding, anlamı geometriye çeviren köprüdür ve modern yapay zekâ uygulamalarının çoğu bu köprüden geçer. Resmin bütününü görmek istersen komşu ünitedeki Üretken yapay zekâ nedir? dersine de göz atabilirsin.
Sık Sorulan Sorular
Embedding nedir?
Embedding, kelimeleri, cümleleri veya belgeleri sabit uzunlukta sayı listelerine (vektörlere) dönüştürme işlemidir. Anlamca yakın metinlerin vektörleri sayısal uzayda birbirine yakın olur; böylece bilgisayar anlamı geometri üzerinden işler.
Embedding ile token arasındaki fark nedir?
Token, metnin modele verilmeden önce bölündüğü küçük parçadır; embedding ise metnin anlamı temsil eden sayı dizisine dönüştürülmüş hâlidir. Kısaca token parçalama, embedding sayısallaştırma adımıdır.
Kosinüs benzerliği nedir?
İki embedding vektörü arasındaki açıyı ölçen benzerlik ölçüsüdür. Skor 1'e yaklaştıkça iki metin anlamca yakın sayılır; 0 civarı ilgisizliği, negatif değerler zıt yönlülüğü gösterir.