Görüntü İşleme
Bu derste yapay zekânın en görünür dallarından biri olan görüntü işleme alanını baştan sona işliyoruz: bilgisayarın bir fotoğrafı nasıl “gördüğünü”, temel işleme adımlarını, derin öğrenmenin alana katkısını ve günlük hayattaki uygulamalarını örneklerle anlatıyoruz. Konunun genel çerçevesini görmek istersen Yapay Zekâ dersleri sayfamızda bu ünitenin tüm konuları sırayla yer alıyor.
Görüntü İşleme Nedir?
Görüntü işleme, dijital görüntüler üzerinde bilgisayarla işlem yaparak bilgi elde etme, iyileştirme ve analiz etme alanıdır. Amaç, insan gözünün ve beyninin görsel alanda kolayca yaptığı işleri — bir nesneyi tanıma, bir yüzü ayırt etme, bir kusuru fark etme — makineye yaptırmaktır. Kamera ya da sensörden gelen ham görüntü bir dizi matematiksel işlemden geçirilir; çıktı ya insan için anlamlı hâle getirilmiş bir görüntü ya da karar vermek için kullanılan sayısal bilgidir.
Somut bir örnekle düşünelim: Bir fabrikada üretim bandındaki şişelerin kapaklarının takılıp takılmadığını kontrol etmek istiyorsun. İnsan denetçi her şişeye bakabilir ama yorulur ve hata yapar. Görüntü işleme sistemi ise kameradan gelen görüntüyü saniyeler içinde analiz eder, kapağı bulur ve eksikse hattı uyarır. Aynı mantık hastanedeki röntgen analizinden otoyoldaki plaka tanımaya kadar pek çok yerde çalışır.
Bilgisayar Bir Görüntüyü Nasıl “Görür”?
İnsan için bir fotoğraf tek bir bütündür; bilgisayar için ise yalnızca sayılardan oluşan bir tablodur, yani bir matristir. Bu tablonun her hücresine piksel denir ve görüntünün “anlamı” bu sayıların örüntüsünde saklıdır.
- Piksel: Gri tonlamalı bir görüntüde her piksel 0 ile 255 arasında tek bir sayıdır; 0 siyahı, 255 beyazı gösterir.
- RGB (renkli görüntü): Her piksel üç değer taşır: kırmızı, yeşil ve mavi kanalları. Örneğin 1000×1000 boyutunda renkli bir görüntü, üç milyon sayılık bir tablodur.
- Çözünürlük: Piksel sayısı arttıkça görüntü ayrıntılılaşır ama işlenecek veri de çoğalır; bu yüzden boyutlandırma sık yapılan bir adımdır.
Bilgisayarın görmesi, işte bu sayı tablosunda anlam aramaktır: Hangi bölgelerde değerler ani biçimde değişiyor, hangi örüntü tekrar ediyor? Görüntü işleme yöntemlerinin tamamı, bu iki soruya verilen farklı cevaplardır.
Temel Görüntü İşleme İşlemleri
Bir görüntü, yapay zekâ modeline verilmeden önce genellikle bir hazırlık zincirinden geçer. Aşağıdaki adımlar bu zincirin en yaygın halkalarıdır:
Ön işleme
Görüntüdeki bozukluklar düzeltilir: gürültü azaltılır, parlaklık ve kontrast dengelenir, görüntü standart bir boyuta ölçeklenir. Kötü veriyle çalışan en iyi model bile kötü sonuç üretir; bu yüzden ön işleme çoğu projenin en kritik adımıdır.
Filtreleme ve kenar algılama
Filtreler, her pikselin komşularıyla birlikte hesaplanmasıyla yeni bir görüntü üretir. Bulanıklaştırma filtresi gereksiz ayrıntıyı bastırır; kenar algılama yöntemleri (Sobel, Canny gibi) parlaklıktaki ani değişimleri bularak nesnelerin sınırlarını ortaya çıkarır.
Eşikleme ve bölütleme
Eşikleme, pikselleri belirli bir değerden küçük ya da büyük olmasına göre ikiye ayırır ve ön planı arka plandan koparır. Bölütleme daha ileri bir adımdır: görüntüyü anlamlı bölgelere böler — “bu pikseller tümör, bunlar sağlıklı doku” gibi.
Özellik çıkarma
Görüntüden ölçülebilir nitelikler çıkarılır: köşeler, doku örüntüleri, şekil sayıları. Bu özellikler, sonraki sınıflandırma ya da tanıma adımının girdisini oluşturur.
Klasik Yöntemler ile Derin Öğrenme Arasındaki Fark
2010’lu yıllara kadar görüntü işlemede kuralları insanlar yazardı: kullanılacak filtre, sayılacak özellikler ve eşlenecek şablonlar önceden belirlenirdi. Derin öğrenme ve özellikle evrişimli sinir ağları (CNN) bu düzeni değiştirdi: CNN’de filtreler elle seçilmez, model binlerce etiketli örneğe bakarak hangi filtrelerin işe yaradığını kendisi öğrenir.
- Klasik yöntem: Kurallar elle yazılır; az veriyle çalışır, kararlarının nedenini açıklaması kolaydır ama beklenmedik durumlarda çabuk zorlanır.
- Derin öğrenme: Kuralları veriden öğrenir; büyük veriyle çok daha yüksek doğruluk sağlar ama çok veri ve işlem gücü ister.
Dönüm noktası, 2012’de ImageNet görüntü tanıma yarışmasında bir CNN’in önceki tüm klasik yöntemleri açık ara geçmesi oldu. Bugün yüz tanıma, nesne algılama (YOLO gibi modellerle) ve tıbbi görüntü analizinde standart yaklaşım derin öğrenmedir. 2024-2025 döneminde alan bir adım daha ilerledi: büyük dil modelleri artık görüntüyü de “anlayıp” üzerine konuşabiliyor, difüzyon tabanlı modeller ise metinden görüntü üretebiliyor. Yani görüntü işleme artık yalnızca analiz değil, anlama ve üretme boyutlarını da kapsıyor.
Görüntü İşleme Nerede Kullanılır?
Görüntü işleme bugün o kadar sıradanlaştı ki çoğu zaman fark edilmiyor bile. Başlıca kullanım alanları şunlardır:
- Akıllı telefonlar: Yüz kilidiyle açılma, portre modunda arka planın bulanıklaştırılması, QR kod okuma.
- Tıp: Röntgen ve MR görüntülerinde şüpheli bölgelerin işaretlenmesi; konunun bütününe Sağlıkta yapay zekâ dersinde değiniyoruz.
- Otonom araçlar: Aracın şeridi, yayayı ve trafik işaretini kamera görüntüsünden algılaması; ayrıntılar için Otonom araçlar dersine bakabilirsin.
- Sanayi: Üretim bandında çizik, eksik parça veya baskı hatasının otomatik denetimi.
- Tarım: Drone görüntüleriyle bitki hastalıklarının ve sulama ihtiyacının haritalanması.
Görüntü işleme, sesle birlikte yapay zekânın iki ana “duyusundan” biridir; ses tarafının nasıl çalıştığını merak ediyorsan Ses tanıma dersimize göz at. Yüz tanımanın yaygınlaşması ciddi soruları da gündeme getirdi: yanlış eşleştirme riski ve kitlesel izleme potansiyeli Yapay zekâ etiği dersinin başlıkları arasındadır; ayrıca yüz verisi kişisel veri sayıldığı için Veri gizliliği ilkelerine tabidir.
Sık Yapılan Hatalar ve Yanılgılar
Görüntü işlemeye yeni başlayanların en sık düştüğü yanılgıları önem sırasına göre listeledik:
- “Görüntü işleme, fotoğraf düzenlemedir” sanmak: Fotoğraf düzenleyicideki işlem insanın yönlendirdiği bir iyileştirmedir; görüntü işleme ise makinenin görüntüyü kendiliğinden analiz edip karar üretmesidir.
- Bilgisayarın gerçekten “baktığını” varsaymak: Model kedi fotoğrafında kedi görmez, kediye ait piksel örüntüsü bulur. Işık, açı veya arka plan değişince yanılabilir.
- Veri kalitesini küçümsemek: En sık görülen hata, güzel bir model seçip az ve dengesiz veriyle eğitmektir. Çoğu projede başarıyı model değil, veri belirler.
- Tek bir doğruluk oranına güvenmek: Denge dağılmamış bir veri setinde “%95 doğru” ifadesi yanıltıcıdır; verilerin %95’i sağlamsa hiçbir şey öğrenmeyen bir sistem bile %95 doğruluk gösterir.
- Her iş için büyük model kullanmak: Basit bir eşikleme ya da kenar algılama ile çözülebilecek iş için dev bir derin öğrenme modeli kurmak gereksiz maliyet ve karmaşıklık yaratır.
Özetle görüntü işleme, ham pikselleri anlamaya dönüştüren bir zincirdir: ön işleme, filtreleme, özellik çıkarma ve gerektiğinde derin öğrenme. Bu zinciri sırayla ve örneklerle kavramak, hem sınav sorularında hem de gerçek projelerde seni en çok ileriye götürecek yaklaşımdır.
Sık Sorulan Sorular
Görüntü işleme nedir?
Görüntü işleme, dijital görüntülerin bilgisayarla işlenerek iyileştirilmesi veya içinden bilgi çıkarılması alanıdır. Bilgisayar görüntüyü sayılardan oluşan bir piksel matrisi olarak görür; bu matris üzerinde filtreleme, kenar algılama ve tanıma işlemleri yapar.
Görüntü işleme ile bilgisayarlı görü arasındaki fark nedir?
İki terim sıkça iç içe kullanılır. Görüntü işleme, görüntünün kendisi üzerinde yapılan işlemleri (gürültü temizleme, filtreleme, kenar algılama) kapsar; bilgisayarlı görü (computer vision) ise bu işlemleri kullanarak görselden anlama ve karar verme hedefine odaklanır. Görüntü işleme bir araç seti, bilgisayarlı görü bu araçları kullanan daha geniş bir amaç alanıdır.
Görüntü işleme öğrenmek için hangi dil ve araçlar kullanılır?
En yaygın tercih Python programlama dilidir: OpenCV kütüphanesi klasik görüntü işleme işlemleri için, TensorFlow ve PyTorch ise derin öğrenme tabanlı modeller için kullanılır. Temel matris ve istatistik bilgisi, konuyu gerçekten kavramak için büyük kolaylık sağlar.