Regresyon
Bu derste makine öğrenmesinin temel görevlerinden biri olan regresyonu sıfırdan işliyoruz: ne olduğu, gerçek hayattan örnekleri, sınıflandırma ile farkı, nasıl çalıştığı, yaygın türleri ve başarı ölçümü. Konuya temelden girmek isteyenler için Makine öğrenmesi nedir? dersini öneririz; tüm seriyi görmek için Yapay Zekâ dersleri sayfasına bakabilirsin.
Regresyon Nedir?
Regresyon, bir girdiye bakarak sürekli ve sayısal bir değer tahmin etmeye çalışan bir makine öğrenmesi görevidir. “Bu ev kaç para eder?”, “yarın hava kaç derece olacak?”, “bu üründen haftaya kaç adet satılır?” gibi soruların cevabı bir sınıf ya da etiket değil, sayıdır; işte bu tür sorular regresyonun alanına girer. Regresyon, denetimli öğrenme kapsamındadır: modele, doğru cevapları (etiketleri) bilinen yüzlerce ya da binlerce örnek gösterilir ve model, girdi ile sayısal sonuç arasındaki ilişkiyi öğrenir. Örneğin evlere ait m², oda sayısı ve kat bilgisiyle gerçek satış fiyatlarını içeren bir tablo, basit bir fiyat tahmin modelini eğitmek için yeterlidir.
Regresyon Gerçek Hayatta Nerelerde Kullanılır?
Regresyon, farkında olmasak da günlük hayatta kullandığımız pek çok uygulamanın arka planında çalışır:
- Konut fiyat tahmini: Emlak platformları, evin özelliklerine göre tahmini bir değer üretir.
- Varış süresi tahmini: Harita uygulamalarının “28 dakika sonra varsınız” demesi, trafiğe göre yapılan bir regresyon tahminidir.
- Talep ve stok öngörüsü: Market zincirleri, hangi üründen yarın kaç adet satılacağını tahmin ederek raf ve depo planlar.
- Enerji tüketimi: Elektrik şebekesi, hava sıcaklığı ve saat bilgisine göre saatlik tüketim öngörüsü yapar.
- Sağlık: Yaş, tansiyon ve tahlil değerlerine göre kan şekeri düzeyi ya da risk skoru tahmini.
Regresyon ile Sınıflandırma Arasındaki Fark
İkisi de denetimli öğrenme görevidir; ayrıştırıcı nokta çıktının türüdür:
- Regresyon: Çıktı sürekli bir sayıdır. “Bu ev 2,4 milyon TL.” Cevaplar arasındaki sıralama ve uzaklık anlamlıdır.
- Sınıflandırma: Çıktı bir kategoridir. “Bu e-posta spam / spam değil.” Cevap, belirli etiketler içinden seçilir.
- Aynı veri iki soruya da hizmet edebilir: “Ev kaç para eder?” regresyondur; “Bu ev pahalı mı ucuz mu?” sınıflandırmadır.
Görev seçimi, hata ölçümünü ve model seçimini de değiştirir. Karar ağaçları ve sinir ağları gibi bazı modeller iki görevde de kullanılabilir. Sınıflandırmanın tüm ayrıntılarını Sınıflandırma dersinde ayrıca işliyoruz.
Regresyon Nasıl Çalışır ve Hangi Türleri Vardır?
En temel hâli basit doğrusal regresyondur: tek bir girdi ile çıktı arasına bir doğru oturtulur. Denklem okuldan tanıdıktır: y = a·x + b. Modelin işi, veriye en iyi uyan a (eğim) ile b (kesişim) sayılarını bulmaktır. Bunun için model, kendi tahminleri ile gerçek değerler arasındaki farkların karelerini toplar ve bu toplamı en küçük düzeye indiren çifti seçer; bu yönteme en küçük kareler denir. Somut bir örnek: model, daire kiralarından kira = 250 × m² + 3.000 bağıntısını öğrenmiş olsun; 80 m²lik bir daire için tahmin 250 × 80 + 3.000 = 23.000 TL olur.
İlişkinin yapısına göre farklı türler seçilir:
- Çoklu doğrusal regresyon: Birden fazla girdi kullanır (m² + oda sayısı + kat…); her girdi kendi ağırlığıyla katkı verir.
- Polinom regresyon: İlişki doğru değil de eğriyse (verim önce artıp sonra düşüyorsa gibi) eğrisel bir model kurulur. Derece arttıkça aşırı öğrenme riski büyür.
- Ridge ve Lasso: Gereksiz büyük ağırlıkları cezalandırarak modeli sadeleştiren düzenlileştirmeli türlerdir; girdi sayısı çok olduğunda tercih edilir.
- Karar ağacı tabanlı modeller (rastgele orman, gradyan artırma): Tablo türü verilerde 2024-2025 itibarıyla hâlâ en güçlü ve en yaygın seçeneklerdendir.
- Sinir ağları: Çok büyük ve karmaşık veride (görüntü, metin, sensör dizileri) tercih edilir; bu ailenin ayrıntıları derin öğrenme alanının konusudur.
Regresyon Modelinin Başarısı Nasıl Ölçülür?
Regresyonda “doğru mu tahmin etti?” sorusunun cevabı bir etiket değildir; tahmin ile gerçek değer arasındaki uzaklığa bakılır. En yaygın ölçütler şunlardır:
- MAE (ortalama mutlak hata): Tahminler gerçekte ortalamada kaç birim sapyor? Yorumu en kolay ölçüttür: “ortalama 90 bin TL şaşıyor” gibi.
- MSE ve RMSE: Hataların karesini alır; büyük sapmaları çok daha ağır cezalandırır. RMSE'de karekök alındığı için sonuç tahminle aynı birimde okunur.
- R² (determinasyon katsayısı): Modelin, verideki değişimin ne kadarını açıkladığını 0-1 arasında tek bir sayıyla özetler; 1'e yaklaşmak iyidir.
Kritik kural şu: Bu ölçütler, modelin hiç görmediği örnekler üzerinde hesaplanmalıdır. Bu yüzden veriyi eğitim ve test olarak bölmek zorunludur; ayrıntı için Eğitim ve test verisi dersine bakabilirsin. Ölçütlerin tamamı Model değerlendirme dersinde; model veriye hiç oturamıyorsa Underfitting nedir?, eğitim verisinde parlayıp testte düşüyorsa Overfitting nedir? dersleri doğru adrestir.
Sık Yapılan Hatalar ve Yanılgılar
- “Regresyon = doğrusal regresyon” sanmak. Doğrusal regresyon yalnızca bir modeldir; regresyon, sayısal değer tahmini yapan tüm görevin adıdır.
- Lojistik regresyonu regresyon sanmak. Adında “regresyon” geçse de lojistik regresyon bir sınıflandırma algoritmasıdır; “spam / spam değil” gibi kategoriler üretir, sayı tahmin etmez.
- Korelasyonu nedensellik sanmak. Model iki değişken arasında ilişki görebilir; bu, birinin diğerine neden olduğu anlamına gelmez. Dondurma satışı ile havuz kazaları birlikte artar ama dondurma kazalara neden olmaz; ikisini de besleyen şey sıcaklıktır.
- Veri aralığının dışına tahmin yapmak (dış kestirim). 40-120 m² dairelerle eğitilen bir modelin 600 m²lik bir malikaneyi doğru fiyatlaması beklenemez.
- Aykırı değerleri göz ardı etmek. Yanlış girilmiş tek bir fiyat, hataların karesi üzerinden öğrenen modelleri ciddi biçimde yanıltabilir.
- Başarıyı eğitim verisiyle övmek. Ezber yapan model eğitim verisinde kusursuz görünür; gerçek başarı yalnızca görülmemiş test verisinde anlamlıdır.
Üretken yapay zekânın gündemi belirlediği 2024-2025 döneminde bile şirketlerin fiyat, talep ve süre gibi sayısal tahmin ihtiyaçlarının büyük bölümünü regresyon tabanlı modeller karşılamaya devam ediyor. Bu temeli sağlam kurmak, ileride yapay sinir ağlarına geçtiğinde de işini kolaylaştıracaktır.
Sık Sorulan Sorular
Regresyon nedir?
Regresyon, girdilere bakarak sürekli ve sayısal bir değer tahmin etmeye çalışan denetimli öğrenme görevidir. Ev fiyatı, hava sıcaklığı ya da satış adedi tahmini gibi sorular tipik regresyon problemleridir.
Regresyon ile sınıflandırma arasındaki fark nedir?
Regresyonda çıktı sürekli bir sayıdır (ev fiyatı, sıcaklık); sınıflandırmada çıktı belirli etiketler arasından seçilen bir kategoridir (spam / spam değil). İkisi de denetimli öğrenme kapsamındadır.
Regresyon modelinin başarısı nasıl ölçülür?
Tahmin ile gerçek değer arasındaki uzaklığa bakılır. En yaygın ölçütler MAE, MSE, RMSE ve R²'dir; bu metrikler mutlaka modelin hiç görmediği test verisi üzerinde hesaplanır.