KonuAnlatım.com

Denetimsiz Öğrenme

Yapay Zekâ · Bölüm 22Yapay ZekâDers

Bu derste makine öğrenmesinin üç temel yaklaşımından biri olan denetimsiz öğrenmeyi sıfırdan işliyoruz: etiketsiz veriden ne kastedildiğini, denetimli öğrenmeden farkını, başlıca görevlerini ve sık yapılan yanılgılarını somut örneklerle ele alacağız. Konuyu büyük resmin içinde görmek isteyenler Makine öğrenmesi nedir? dersine, serinin tamamına ise Yapay Zekâ dersleri kategorimize bakabilir.

Denetimsiz Öğrenme Nedir?

Denetimsiz öğrenme, etiketsiz veriden verinin gizli yapısını, örüntülerini ve doğal gruplarını keşfetmeyi amaçlayan makine öğrenmesi yaklaşımıdır. Etiketsiz demek, veride doğru cevap sütununun bulunmaması demektir: bir müşteri tablosunda yaş, şehir, alışveriş sıklığı ve harcama tutarı vardır ama 'bu müşteri yıl sonunda terk eder mi?' diye işaretlenmiş bir alan yoktur. Modelin elinde ne soru ne cevap anahtarı vardır; kimsenin göstermediği benzerlikleri ve sıra dışı durumları kendisi çıkarır. Bu yüzden denetimsiz öğrenme bir keşif aracıdır: 'Bu veriyle neyi tahmin ederim?' değil, 'Bu verinin yapısı bana ne anlatıyor?' sorusuna cevap arar.

Somut bir örnekle düşünelim. Bir e-ticaret sitesi, on binlerce müşterisinin alışveriş geçmişine sahip olsun ve kimse müşterilere 'premium' ya da 'fırsat avcısı' etiketi vermemiş olsun. Denetimsiz bir algoritma, harcama sıklığına, sepet büyüklüğüne ve ürün tercihine bakarak müşterileri doğal gruplara ayırabilir; işletme bu gruplara sonradan anlam yükler ve her biri için ayrı kampanya tasarlar. Etiket verilmedi ama ortaya anlamlı bir yapı çıktı.

Denetimli Öğrenme ile Farkı Nedir?

İki yaklaşımı ayıran temel nokta şudur: denetimli öğrenmede cevap anahtarı vardır, denetimsiz öğrenmede yoktur. Denetimli öğrenmede model, etiketli örneklerden girdi ile çıktı arasındaki ilişkiyi öğrenir ve yeni veriler için tahmin üretir; denetimsiz öğrenmede tahmin edilecek bir hedef yoktur, model verinin iç yapısını çözer. Farkları yan yana koyalım:

  • Veri: Denetimli tarafta her örnek bir etiketle gelir; denetimsiz tarafta yalnızca öznitelikler vardır.
  • Amaç: Biri yeni verilerde tahmin üretmek, diğeri verideki gizli yapıyı keşfetmektir.
  • Değerlendirme: Denetimli modeller doğruluk ve hata metrikleriyle net biçimde ölçülür; denetimsiz sonuçların değerlendirilmesi daha dolaylıdır.
  • Örnek: E-postaları 'spam / spam değil' diye etiketleyip model kurmak denetimlidir; aynı e-postaları konularına göre gruplamak denetimsizdir.

Makine öğrenmesinin üçüncü yaklaşımı olan, ödül ve ceza döngüsüyle öğrenmenin nasıl işlediğini Pekiştirmeli öğrenme dersinde; denetimli tarafın bütün ayrıntılarını ise Denetimli öğrenme dersinde bulabilirsin.

Denetimsiz Öğrenmenin Başlıca Görevleri

Denetimsiz öğrenme tek bir teknik değil, ortak bir felsefeyi paylaşan görevler ailesidir. En yaygın dört görevi tanıyalım:

Kümeleme

Benzer örnekleri aynı grupta toplayan, farklıları ayrı gruplara yerleştiren görevdir; müşteri segmentasyonu ve belge gruplama bu alana girer. Algoritmalarını ve ayrıntılarını ayrı bir derste işlediğimiz için burada uzatmıyoruz: ayrıntılar Kümeleme dersinde.

Boyut İndirgeme

Veri yüzlerce sütundan oluşuyorsa hesaplama zorlaşır, anlamlı yapı gürültünün altında kalır. Boyut indirgeme, bilgiyi büyük ölçüde koruyarak veriyi daha az sayıda bileşene indirger; PCA bu alanın klasik yöntemidir. t-SNE ve UMAP gibi teknikler ise yüksek boyutlu veriyi iki boyutlu haritaya indirgeyerek gözle incelenebilir kılar.

Birliktelik Kuralları (Sepet Analizi)

'X'i alan müşterilerin büyük bölümü Y'yi de alıyor' biçimindeki ilişkileri bulur. Market zincirlerinin raf düzenini ve ürün önerilerini bu analizle planlaması klasiktir; 'bebek bezi ile bira birlikte satılır' hikâyesi de yöntemin ünlü vakasıdır.

Anomali (Aykırılık) Tespiti

Verinin genel akışından sapan nadir örnekleri yakalar. Kullanıcının alışılmadık bir saatte, daha önce hiç alışveriş yapmadığı bir ülkeden yüksek tutarlı işlem geçirmesi normal örüntüye uymaz ve sistem alarm üretir. Dolandırıcılık tespiti ve makine arızasının erkenden fark edilmesi başlıca alanlarıdır.

Denetimsiz Öğrenme Nerede Karşımıza Çıkar?

  • Müşteri segmentasyonu: E-ticaret ve telekom şirketleri müşterileri davranış örüntülerine göre gruplar; kampanyalar kişiye özel olur.
  • Öneri sistemleri: Dizi ve müzik platformları, izleme ve dinleme kalıpları benzer olan kullanıcıları gruplayarak 'bunu beğenebilirsin' önerisini üretir.
  • Güvenlik: Bankacılıkta olağandışı harcamalar, siber güvenlikte alışılmadık ağ trafiği anomali tespitiyle yakalanır.
  • Büyük dil modelleri: 2024-2025 döneminin en çok konuşulan yapay zekâ sistemleri olan ChatGPT ve benzeri büyük dil modelleri, internetten derlenen devasa etiketsiz metin yığınları üzerinde, bir sonraki kelimeyi tahmin etme göreviyle eğitilir. Bu yaklaşımın adı kendinden denetimli öğrenmedir ve etiket maliyeti ödemeden veriden öğrenme fikrinin en büyük ölçekli uzantısıdır. Sistemlerin altındaki mimariyi merak edenler Derin öğrenme nedir? dersine bakabilir.

Güçlü ve Zayıf Yönleri

Yöntemin en büyük gücü, etiket maliyeti ödemeden ham veriden değer çıkarabilmesidir; dünyadaki verinin büyük bölümü etiketsizdir. Buna karşılık sınırlarını da bilmek gerekir:

  • Güçlü: Etiket gerektirmez; ham veriyle çalışır ve keşif için idealdir.
  • Güçlü: İnsanın gözünden kaçan yapıları ortaya çıkarabilir; model kurulmadan önce veriyi tanımak için kullanılır.
  • Zayıf: Sonuçların işe yararlığını ölçmek zordur; bulunan grupların iş açısından anlamlı çıkacağı garanti değildir.
  • Zayıf: Sonuçlar ölçeklemeye ve ayar seçimine duyarlıdır; aynı veri farklı ayarlarla bambaşka gruplar üretebilir.

Sık Yapılan Hatalar ve Yanılgılar

  1. 'Kümeleme ile sınıflandırma aynı şeydir' sanmak: Kümeleme etiketsiz gruptur; sınıflandırma ise önceden tanımlı etiketleri öğrenen denetimli bir görevdir.
  2. 'Etiket yoksa ön işleme de gerekmez' demek: Tam tersine, öznitelikler ortak bir ölçeğe getirilmezse büyük değerli değişkenler benzerlik hesabını ele geçirir ve sonuç bozulur.
  3. Algoritmanın bulduğu gruba hazır anlam yüklemek: Model yalnızca 'grup 1, grup 2' der; 'bunlar sadık müşteriler' yorumunu insan yapar ve veriyle sınanmalıdır.
  4. 'Zaten değerlendirilemez' diye pes etmek: Zordur ama imkânsız değildir; siluet skoru gibi iç ölçütler yol gösterir. Denetimli taraftaki Eğitim ve test verisi ayrımına benzer bir titizlik burada da gerekir.
  5. Grup sayısını keyfe göre seçmek: Küme sayısı rastgele değil, dirsek yöntemi gibi araçlarla veriye bakılarak seçilmelidir; aksi hâlde anlamsız gruplar çıkar.

Sonuç olarak denetimsiz öğrenme, doğru cevabın verilmediği yerde bile veriden değer üreten, makine öğrenmesinin keşif ayağıdır. Denetimli öğrenme tahminin, pekiştirmeli öğrenme kararın alanıyken, denetimsiz öğrenme veriyi anlamlandırmanın ilk kapısıdır. Model başarısını ölçmenin genel çerçevesini Model değerlendirme dersinde bulabilir; üç yaklaşımı tamamladıktan sonra Makine öğrenmesi nedir? dersindeki büyük resmi ikinci kez okumanı öneririz.

Sık Sorulan Sorular

Denetimsiz öğrenme nedir?

Denetimsiz öğrenme, etiketsiz veriden verinin gizli yapısını, örüntülerini ve doğal gruplarını keşfeden makine öğrenmesi yaklaşımıdır. Doğru cevap sütunu olmadığı için model, benzerlikleri ve sıra dışı durumları kendisi bulur.

Denetimsiz öğrenme ile denetimli öğrenme arasındaki fark nedir?

Denetimli öğrenmede her örnek bir etiketle gelir ve model tahmin yapmayı öğrenir; denetimsiz öğrenmede etiket yoktur ve amaç verideki gizli yapıyı keşfetmektir. Değerlendirme de buna paraleldir: denetimli tarafta doğruluk gibi net ölçütler varken, denetimsiz tarafta başarı daha dolaylı ölçülür.

Denetimsiz öğrenme nerede kullanılır?

Müşteri segmentasyonu, öneri sistemleri, sepet analizi, boyut indirgeme ve dolandırıcılıkta anomali tespiti başlıca kullanım alanlarıdır. Büyük dil modellerinin etiketsiz metinle yapılan ön eğitimi de bu fikrin en büyük ölçekli uygulamasıdır.

Dersler

Tümü →