Sınıflandırma
Bu derste makine öğrenmesinin en yaygın görevlerinden biri olan sınıflandırmayı sıfırdan ele alıyoruz: ne olduğunu, günlük hayattaki somut örneklerini, türlerini, kuruluş adımlarını ve en sık yapılan hataları. Konu, Yapay Zekâ dersleri serimizin Makine Öğrenmesi ünitesinde yer alıyor.
Sınıflandırma Nedir?
Sınıflandırma, bir makine öğrenmesi modelinin her örneği önceden belirlenmiş kategorilerden birine atama görevidir. Modelin girdisi bir örnektir, çıktısı ise bir sınıf etiketidir: e-posta spam mi temiz mi, tümör iyi huylu mu kötü huylu mu, müşteri yorumu olumlu mu olumsuz mu. Sınıflandırma, denetimli öğrenme yaklaşımının iki ana görevinden biridir; model, doğru cevapları yani etiketleri bilinen örneklerden öğrenir. Konuya ilk kez adım atıyorsan önce makine öğrenmesi nedir dersine bakman işini kolaylaştırır.
Sınıflandırma, farkında olmasan da günlük hayatın pek çok yerinde sessizce çalışır:
- E-posta servislerinin spam filtresi, gelen her mesajı spam ya da temiz olarak ayrıştırır.
- Telefonlardaki yüz kilidi, kameraya gelen görüntünün cihazın sahibine ait olup olmadığına karar verir.
- Bankalar kart işlemlerini anlık olarak olağan ya da şüpheli diye işaretleyerek dolandırıcılığı yakalar.
- Sosyal medya platformları paylaşımları zararlı içerik kategorilerine göre otomatik sınıflandırır; 2024-2025 döneminde yapay zekâ ile üretilmiş içeriklerin işaretlenmesinde de aynı yaklaşım kullanılıyor.
- Tıbbi görüntüleme sistemleri röntgen üzerindeki şüpheli bölgeleri önceden işaretleyerek doktora yardımcı olur.
Temel Kavramlar: Özellik, Etiket ve Sınıf
Üç temel terimi spam filtresi örneği üzerinden netleştirelim. Özellik (feature), modelin karar vermek için baktığı ölçülerdir: mesajda geçen kelimeler, gönderici adresi, bağlantı sayısı. Etiket (label), her örneğin doğru cevabıdır: bu e-posta spam ya da temiz. Sınıf (class) ise kategorilerin her birinin adıdır; spam ve temiz bu problemin iki sınıfıdır.
Modeller çoğu zaman doğrudan karar vermek yerine önce bir olasılık hesaplar: bu e-postanın spam olma olasılığı yüzde 97 gibi. Sistem bu olasılık belirli bir eşiği geçerse mesajı spam klasörüne taşır. Bu ayrıntı önemlidir, çünkü eşik değeri değiştirilerek modelin davranışı ayarlanabilir: eşiği yükseltmek yanlış alarmları azaltır ama bazı spam mesajların gözden kaçmasına yol açabilir.
Sınıflandırma Türleri
Problemin yapısına göre üç temel tür vardır.
İkili sınıflandırma
Yalnızca iki sınıf vardır: spam-temiz, hasta-sağlıklı, dolandırıcılık var-yok. Gerçek hayatta en sık karşılaşılan türdür.
Çok sınıflı sınıflandırma
İkiden fazla sınıf vardır ama her örnek yalnızca birine ait olabilir: el yazısı bir rakamın 0-9 arasından birine atanması ya da bir haber başlığının spor, ekonomi ve sağlık kategorilerinden birine yerleştirilmesi gibi.
Çok etiketli sınıflandırma
Bir örnek aynı anda birden fazla etiket alabilir: bir fotoğrafta hem deniz hem insan etiketi bulunabilir, bir film hem komedi hem aksiyon olarak işaretlenebilir. Video platformlarının içerik etiketleme sistemleri bu türe iyi örnek verir.
Sınıflandırma Modeli Nasıl Kurulur?
Sık kullanılan yöntemler
Sınıflandırma tek bir algoritmanın adı değil, bir görevdir; aynı görevi farklı yöntemlerle çözmek mümkündür:
- Karar ağaçları: Evet-hayır sorularıyla adım adım karara varan, anlaşılması kolay modeller.
- Naive Bayes: Olasılık hesabına dayanır; spam filtrelerinin klasiğidir.
- En yakın komşular (KNN): Yeni örneği, kendine en çok benzeyen etiketli örneklerin sınıfına atar.
- Lojistik regresyon: Adında regresyon geçse de aslında ikili sınıflandırmada kullanılan temel bir yöntemdir.
- Derin sinir ağları: Görüntü ve ses gibi karmaşık verilerde günümüzün en güçlü yaklaşımıdır; ayrıntılar derin öğrenme nedir ve yapay sinir ağları derslerinde.
Adım adım süreç
Spam filtresi örneği üzerinden süreci izleyelim:
- Veri topla ve etiketle: Binlerce e-postayı topla, her birinin spam mi temiz mi olduğunu işaretle.
- Özellikleri hazırla: Modelin kullanacağı bilgileri belirle; kelimeler, gönderici, bağlantı sayısı gibi.
- Veriyi böl: Veri setini eğitim ve test parçasına ayır; ayrıntılar eğitim ve test verisi dersinde.
- Modeli eğit: Model, eğitim örneklerine bakarak hangi özelliklerin hangi sınıfa işaret ettiğini öğrenir.
- Başarıyı ölç: Modeli hiç görmediği test örneklerinde değerlendir; ölçütleri model değerlendirme dersinde bulabilirsin.
- Kullan ve güncelle: Modeli gerçek hayata al; spam göndericiler taktik değiştirdikçe modeli yeni verilerle tazele.
Sınıflandırma, Regresyon ve Kümeleme Farkı
Bu üç görev sıkça birbirine karıştırılır. Aradaki farkı tek bakışta görelim:
- Sınıflandırma hangi kategori sorusunu yanıtlar; çıktı ayrık bir etikettir: spam ya da temiz.
- Regresyon ne kadar sorusunu yanıtlar; çıktı sürekli bir sayıdır: ev fiyatı, yarının sıcaklığı. Konunun tamamı regresyon dersinde.
- Kümeleme etiketi olmayan veride modelin kendisi benzer örnekleri gruplar; sınıflandırmada ise sınıflar baştan bellidir. Kümeleme etiket gerektirmediği için denetimsiz öğrenme kapsamındadır; ayrıntılar kümeleme dersinde.
Kısaca formül şudur: elinde etiketli veri varsa ve kategori tahmin ediyorsan sınıflandırma; sayı tahmin ediyorsan regresyon; hiç etiket yoksa kümeleme söz konusudur.
Sık Yapılan Hatalar ve Yanılgılar
Sınıflandırmayı öğrenirken en çok düşülen tuzaklar şunlardır:
- Yüzde 99 doğruluk her zaman iyidir sanılır: Bin işlemde yalnızca 10 tanesi dolandırıcılıksa, her şeye temiz diyen saf bir model bile yüzde 99 doğru olur ama tek bir dolandırıcılığı yakalamaz. Bu yüzden tek ölçüye bakılmaz.
- Sınıflandırma ile kümeleme aynı sanılır: Kümelemede etiket yoktur, grupları model kendisi bulur; sınıflandırmada sınıflar önceden tanımlıdır. Bu fark, denetimli öğrenme ile denetimsiz öğrenmeyi ayıran temel çizgidir.
- Ezber iyi öğrenmedir sanılır: Model eğitim verisinde kusursuz ama yeni örneklerde zayıfsa ezber yapmıştır; bu durumun adı ve çözüm yolları overfitting nedir dersinde. Tam tersi, model hiçbir örüntü yakalayamıyorsa underfitting nedir dersindeki durum söz konusudur.
- Modelin cevabına koşulsuz güvenilir: Modeller olasılık üretir ve bazen kendinden emin biçimde yanılabilir. Sağlık ya da güvenlik gibi kritik alanlarda son karar insan denetiminde verilmelidir.
- Daha çok veri her şeyi çözer sanılır: Veri miktarı kadar etiket kalitesi de belirleyicidir; yanlış etiketlenmiş ya da tek tip örneklerden oluşan bir veri seti, taraflı bir model üretir.
Sık Sorulan Sorular
Sınıflandırma nedir?
Sınıflandırma, makine öğrenmesi modelinin her örneği önceden belirlenmiş kategorilerden birine atamasıdır. E-postayı spam ya da temiz olarak ayırmak tipik bir örnektir; model, doğru cevapları yani etiketleri bilinen örneklerden öğrenir.
Sınıflandırma ile regresyon arasındaki fark nedir?
Sınıflandırmanın çıktısı ayrık bir kategoridir (spam ya da temiz gibi); regresyonun çıktısı ise sürekli bir sayıdır (ev fiyatı, sıcaklık gibi). Kategori tahmin ediyorsan sınıflandırma, miktar tahmin ediyorsan regresyon kullanılır.
Sınıflandırma modelinin başarısı nasıl ölçülür?
Doğruluk (accuracy), hassasiyet (precision), duyarlılık (recall) ve F1 skoru en yaygın ölçütlerdir. Sınıflar dengesizse tek başına doğruluk yanıltıcı olur; bu yüzden birden fazla ölçü birlikte değerlendirilir.