KonuAnlatım.com

Kümeleme

Yapay Zekâ · Bölüm 26Yapay ZekâDers

Bu derste makine öğrenmesinin en çok kullanılan denetimsiz görevlerinden kümelemeyi (clustering) baştan sona işliyoruz: benzer veriler nasıl gruplanır, hangi algoritmalar çalışır, sonuçlar nasıl yorumlanır? Yaklaşımın çerçevesini hatırlamak isteyenler Denetimsiz öğrenme dersimize, serinin tamamını görmek isteyenler Yapay Zekâ dersleri kategorimize göz atabilir.

Kümeleme Nedir?

Kümeleme, etiketsiz verideki benzer örnekleri doğal gruplara ayırma görevidir. Veride "doğru cevap" sütunu yoktur; algoritma yalnızca özelliklere bakarak "bunlar birbirine benziyor, aynı grupta olsun" diyerek kümeler oluşturur. Somutlaştıralım: bir müzik uygulaması dinleyicilerini dinlediği tür, saat ve cihaz bilgilerine göre gruplara ayırıp her gruba ayrı duyuru gönderebilir. Ya da bir fotoğraf uygulaması aynı kişinin karelerini otomatik olarak tek albümde toplayabilir — bu da baştan sona bir kümeleme problemidir.

Benzerlik çoğunlukla uzaklıkla ölçülür. Her örnek, özellikleri sayıya çevrilmiş bir nokta gibi düşünülür: müşteriyi (yaş, aylık harcama, alışveriş sıklığı) üç boyutlu bir uzayda tek bir nokta olarak hayal edebilirsin. Birbirine yakın noktalar aynı kümeyi, uzak noktalar farklı kümeleri oluşturur. "Elmalar bir torbada, portakallar öbür torbada" gibi görünür ama gerçekte kümelerin sınırları nadiren bu kadar nettir; işin zorluğu tam da burada başlar.

Kümeleme ile Sınıflandırma Arasındaki Fark

İkisi de veriyi gruplara ayırır ama başlangıç noktaları tamamen farklıdır. Sınıflandırma denetimli bir görevdir: model, önceden etiketlenmiş örneklerden öğrenir ve yeni bir örnek için bilinen sınıflardan birini tahmin eder. Kümelemede ise tanımlı sınıf yoktur; model verinin yapısına bakıp grupları kendisi keşfeder ve bunlara "küme 1, küme 2" gibi geçici adlar verir. İki görevi yan yana koyarsak fark netleşir:

  • Etiket: Sınıflandırmada vardır; kümelemede yoktur.
  • Amaç: Sınıflandırmada yeni örnekleri doğru sınıfa atamak; kümelemede verinin doğal yapısını keşfetmek.
  • Sonuç: Sınıflandırmanın çıktısı "spam / spam değil" gibi sabit ve anlamlı sınıflardır; kümelemenin çıktısı, insanın sonradan anlam vermesi gereken gruplardır.
  • Değerlendirme: Sınıflandırmada doğruluk gibi net ölçütler vardır; kümelemede "iyi küme" yargısı daha dolaylıdır.

Popüler Kümeleme Algoritmaları

Pek çok kümeleme algoritması vardır; üçü hem yaygın kullanılıyor hem de mantığı kavraması kolaydır.

K-Means (K-Ortalamalar)

En bilinen algoritmadır. Adındaki K, verinin kaç kümeye ayrılacağını gösterir. Çalışma adımları şöyledir:

  1. K adet merkez noktası rastgele seçilir.
  2. Her örnek, en yakın olduğu merkezin kümesine atanır.
  3. Her kümenin merkezi, o kümedeki noktaların ortalamasıyla güncellenir.
  4. Merkezler yer değiştirmeyi bırakana dek 2. ve 3. adımlar yinelenir.

K-Means hızlı ve açıklayıcıdır; bu yüzden her zaman ilk denenen yöntemdir. Ama zayıf yanları vardır: küme sayısını baştan sen söylemek zorundasın, küre biçimli ve benzer büyüklükte kümelerde iyi çalışır, aykırı değerlerden kolayca etkilenir.

Hiyerarşik Kümeleme

Bu yaklaşım bir ağaç gibi çalışır: başta her örnek kendi kümesidir; en benzer kümeler adım adım birleştirilir (ya da tersine, tek büyük küme parçalanır). Sonuç, kümelerin iç içe geçişini gösteren ağaç diyagramıdır (dendrogram). Avantajı, küme sayısını baştan seçmek zorunda olmaman ve ağacın belli bir yüksekliğinden keserek farklı sayıda kümeleri deneyebilmen; dezavantajı ise büyük veri setlerinde yavaşlamasıdır.

DBSCAN

DBSCAN, yoğunluk fikrine dayanır: sıkı duran nokta topluluklarını küme sayar, seyrek bölgedeki noktaları ise gürültü, yani aykırı değer ilan eder. Hilal ya da halka biçimli, küre olmayan kümeleri bile bulabilir ve aykırı değerlere dirençlidir; küme sayısını kullanıcı seçmez, bunun yerine yoğunluk ayarları verilir. Günümüzde anomali tespiti yapan sistemlerde sıklıkla karşına çıkar.

Küme Sayısını Seçmek ve Sonuçları Değerlendirmek

K-Means'ta K'yı seçmek pratikte en kritik karardır. Bunun için sık kullanılan ipucu dirsek yöntemidir: farklı K değerleri için kümelerin sıkılığı ölçülür ve grafikte iyileşmenin yavaşladığı "dirsek" noktası makul aday sayılır. Bir diğer yaygın ölçüt olan siluet puanı ise her noktanın kendi kümesine ne kadar yakın, komşu kümeye ne kadar uzak olduğunu tek bir sayıya indirger; puana göre kümelerin ayrışıp ayrışmadığı hakkında fikir edinilir.

Sayısal ölçütler tek başına yetmez. Kümelerin gerçek dünyada bir anlamı olmalıdır: "1. küme genç ve sık alışveriş yapanlar, 2. küme seyrek gelen ama büyük harcama yapanlar" gibi bir okuma yapılamıyorsa matematiksel olarak mükemmel görünse bile o kümeleme kullanılmaz. Bu yüzden sonuçlar her zaman alan bilgisine danışılarak yorumlanır. Model performansını ölçmenin genel çerçevesini merak ediyorsan Model değerlendirme dersine bakabilirsin.

Kümeleme Gerçek Hayatta Nerede Kullanılır?

  • Müşteri segmentasyonu: Pazarlama ekipleri müşterileri harcama alışkanlığına göre kümeleyip her segmente ayrı kampanya tasarlar.
  • Belge ve haber gruplama: Binlerce makale konusuna göre otomatik kümelendiğinde "gündemde şu an kaç ayrı olay var?" sorusuna cevap bulunur.
  • Anomali tespiti: Hiçbir kümeye ait olmayan, tek başına duran noktalar şüphelidir; bankacılıkta olağandışı harcama ve siber güvenlikte alışılmadık ağ trafiği böyle yakalanır.
  • Görüntü organizasyonu: Fotoğraf uygulamaları benzer kareleri ve aynı kişinin yüzlerini otomatik albümlerde toplar.
  • Modern yapay zekâ boru hatlarında vektör kümeleme: Günümüzde metinler büyük dil modelleriyle sayı vektörlerine (embedding) çevrilir; bu vektörler kümelendiğinde binlerce belge konularına göre ayrılır, tekrar eden içerikler ayıklanır ve arama sistemleri benzer soruları gruplayarak daha düzenli çalışır. Arama ve asistan mimarilerinde kümeleme, arka planda veriyi düzenleyen sessiz bir araç olarak yaygınlaştı.

Sık Yapılan Hatalar ve Yanılgılar

  1. Özellikleri ölçeklemeden çalışmak: Yaş (0–100) ile yıllık gelir (binlerce lira) aynı uzayda karşılaştırılırsa gelir her şeyi domine eder ve kümeleme fiilen yalnızca gelire göre yapılır. Değişkenleri standartlaştırmak atlanmaması gereken ilk adımdır.
  2. Küme etiketlerini gerçek sınıf sanmak: "Küme 2" bir isim değil, sıra numarasıdır; algoritmayı yeniden çalıştırmak numaraları değiştirebilir. Etiketlere anlamı insan yükler.
  3. Küme sayısını keyfe göre seçmek: "Bana dört segment lazım" demek ile verinin doğal yapısına bakmak aynı şey değildir; keyfi seçim sonuçları saptıran başlıca sebeptir.
  4. Aykırı değerleri temizlemeden başlamak: Uçtaki birkaç hatalı kayıt K-Means merkezini ciddi biçimde oynatabilir ve kümeleri bozabilir.
  5. Tüm değişkenleri olduğu gibi dökmek: Alakasız değişkenler benzerlik ölçümünü bulandırır; konuyla ilgili özellikleri seçmek ya da boyut indirgeme uygulamak sonuçları belirgin biçimde iyileştirir.
  6. Sonuçları tek başına yorumlamak: Kümeleme keşiftir, kesin yargı değildir; "veri bana şunu söylüyor" cümlesi mutlaka alan uzmanıyla birlikte sınanmalıdır.

Kümelemeyi doğru kurgulayan bir öğrenci, makine öğrenmesinin büyük resmini de daha iyi görür: denetimli yöntemlerin nerede parladığını, etiketsiz verinin nerede tek başına değer üretebildiğini kavramak için Makine öğrenmesi nedir? dersiyle başlayıp seriyi sırayla izlemek en verimli yoldur.

Sık Sorulan Sorular

Kümeleme nedir?

Kümeleme, etiketsiz verideki benzer örnekleri doğal gruplara ayıran denetimsiz öğrenme görevidir. Algoritma doğru cevap sütunu olmadan, yalnızca özellik benzerliklerine bakarak kümeleri kendisi keşfeder.

Kümeleme ile sınıflandırma arasındaki fark nedir?

Sınıflandırmada sınıflar önceden bilinir ve model etiketli örneklerden öğrenerek tahmin yapar; kümelemede sınıf tanımı yoktur ve model verideki doğal grupları keşfeder. Çıkan "küme 1, küme 2" adları, insanın sonradan anlam vermesi gereken geçici etiketlerdir.

K-Means algoritması nasıl çalışır?

K adet merkez noktası rastgele seçilir; her örnek en yakın merkezin kümesine atanır, merkezler küme ortalamalarıyla güncellenir ve merkezler yer değiştirmeyi bırakana dek bu iki adım yinelenir. Hızlı ve açıklayıcıdır ama küme sayısını baştan vermek gerekir.

Dersler

Tümü →