KonuAnlatım.com

AI ile görsel üretme

Yapay Zekâ · Bölüm 58Yapay ZekâDers

Bu derste yapay zekâ ile görsel üretimi — birkaç satırlık yazıdan saniyeler içinde özgün bir resim oluşturmayı — baştan sona işliyoruz: çalışma mantığı, 2024–2025'te öne çıkan araçlar, etkili prompt yazımı ve sık yapılan hatalar. Genel çerçeve için Üretken yapay zekâ nedir?, kardeş alanlar için AI ile metin üretme ve AI ile video üretme derslerine bakabilirsin. Tüm serimiz Yapay Zekâ dersleri bölümünde bir arada.

AI ile Görsel Üretme Nedir?

AI ile görsel üretme, bir sahneyi yazıyla tarif ettiğinde modelin bu tarife uygun bir görüntüyü sıfırdan oluşturmasıdır; bu işleme metinden görsele üretim (text-to-image) denir. Girdi yazıya prompt denir; temelleri için Prompt nedir? dersine bakabilirsin. Yaygın bir yanılgı, modelin internette hazır resimler bulup birleştirdiğidir; oysa model tamamen yeni bir görüntü üretir.

Metinden görsele üretimin temel özellikleri:

  • Girdi bir yazıdır: İki kelime de olabilir, paragraflık sahne tarifi de.
  • Çıktı özgündür: Aynı prompt her seferinde farklı bir görüntü verir; üretim rastgele bir başlangıç noktasından yola çıkar.
  • Tam denetim yoktur: Model yazıyı yorumlar; tarife uymayan ayrıntılar sık görülür.

Metinden Görsel Nasıl Oluşur: Diffusion Modelleri

Günümüz görsel üretim araçlarının neredeyse tamamı diffusion (yayılım) modeli kullanır. Eğitimde model, milyonlarca görsele kademeli gürültü ekleyip temizlemeyi öğrenir. Üretimde süreç tersine işler: saf rastgele gürültüyle başlanır, model promptun yön verdiği temizleme adımlarıyla anlamlı bir görsele ulaşır.

  1. Prompt bir metin kodlayıcı ile sayısal vektörlere çevrilir; yazının anlamı sayısal bir tarife dönüşür.
  2. Rastgele bir gürültü haritası oluşturulur.
  3. Model onlarca adımda gürültüyü azaltır; her adımda prompta uygun ayrıntılar netleşir.
  4. Sıkıştırılmış alanda (latent space) oluşan görüntü son adımda piksellere çevrilir.

Sonucu etkileyen iki ayar önemlidir: adım sayısı arttıkça görüntü netleşir ama üretim yavaşlar; kılavuzlama gücü (guidance/CFG) arttıkça model prompta daha sıkı uyar, aşırı değerde ise renkler bozulur ve görüntü sunileşir.

Başlıca Araçlar ve 2024–2025 Durumu

Alan hızla değişir; aşağıdaki liste 2024–2025'teki fotoğraftır ve seçimini amacın belirlemelidir:

  • ChatGPT içindeki görsel üretim: Önce DALL·E 3, ardından 2025'te GPT-4o tabanlı üretim geldi; sohbet ederek yönlendirme güçlüdür, resim içindeki yazılar yeni nesille iyileşti.
  • Midjourney: Estetik ve sanatsal sonuçlarıyla öne çıkar; Discord ve web üzerinden kullanılır.
  • Stable Diffusion ve Flux: Açık ağırlıklı modeller; kendi bilgisayarında ücretsiz çalıştırabilir, kendi stiline ince ayar yapabilirsin. Ayrıntı için Açık kaynak yapay zekâ modelleri dersine bak.
  • Adobe Firefly: Eğitim verisi lisanslı kaynaklardan seçildiği için ticari kullanımda güvence verir; Photoshop'taki Generative Fill bunun örneğidir.
  • Google Gemini (Imagen) ve Ideogram: Gemini üretimi sohbetle birlikte sunar; Ideogram ise içinde uzun yazı olan görsellerde başarılıdır.

Seçerken ücretsiz deneme, ticari kullanım izni, veri gizliliği ve yazı başarısı gibi ölçütleri yan yana koy; yöntemli karar için Yapay zekâ modeli karşılaştırma dersindeki adımları uygula.

İyi Bir Görsel Promptu Nasıl Yazılır?

Görsel promptu chatbota soru sormaktan farklıdır: model cevap vermez, sahne üretir; betimleyici bir tarif bekler. Etkili prompt çoğunlukla şu bileşenleri taşır:

  • Konu: Görüntüde ne var? (“iğne oyası bir bisiklet”)
  • Eylem ve mekân: Ne yapıyor, nerede? (“yağmurlu bir caddede yürüyor”)
  • Stil: Suluboya, yağlı boya, 3B render, çizgi roman, analog fotoğraf…
  • Işık ve atmosfer: “altın saat ışığı”, “loş neon”, “sisli sabah”.
  • Kadraj: Yakın plan, geniş açı, tepeden çekim.
  • Olumsuz koşullar: Bazı araçlarda negative prompt alanına istemediklerini yazarsın: “blurry, low quality, extra fingers”.

Basit bir karşılaştırma: “kedi” yazmak rastgele bir kedi verir. Oysa “close-up of a fluffy orange cat by a rainy window, soft morning light, storybook illustration style” gibi bir tarif sonucu kökten değiştirir. Açık ağırlıklı modeller İngilizce tarifle daha iyi çalışır; ChatGPT ve Gemini Türkçeyi de anlar ama ayrıntı kaybı olabilir.

Strateji kısadır: kısa bir tarif al, sonuçtaki hataya göre tek bir öğeyi değiştir, yeniden üret; hangi değişkenin ne işe yaradığını en hızlı böyle öğrenirsin. Yazımı sistematikleştirmek için Prompt engineering dersindeki ilkeler burada da geçerlidir.

Kontrol ve Düzenleme: Inpainting, Outpainting ve img2img

Sıfırdan üretim hikâyenin yarısıdır; güncel araçların çoğu sonradan müdahaleye izin verir:

  • img2img: Var olan görüntüyü referans alıp promptla yeniden yorumlatırsın; güç ayarı düşükken orijinale, yüksekken prompta sadakat artar.
  • Inpainting: Bir bölgeyi maskeleyip yalnızca orayı yeniden üretirsin; Photoshop'taki Generative Fill bunun bilinen örneğidir.
  • Outpainting: Tuvali karenin dışına doğru genişletir; kesik kalmış kadrajı tamamlar.
  • En-boy oranı: 1:1, 16:9, 3:4 gibi kare oranlarını üretimin başında seçebilirsin.
  • Yükseltme (upscale): Düşük çözünürlüklü sonucu baskıya uygun boyuta getirir.
  • Seed sabitleme: Aynı seed ve prompt çok yakın sonuçlar verir; tekrarlanabilirliğin temelidir.

Sık Yapılan Hatalar ve Yanılgılar

Yeni başlayanların takıldığı noktalar çoğunlukla teknolojinin doğasını yanlış varsaymaktan doğar:

  1. “Model internetten resim birleştiriyor” sanmak: Model arşivden parça çekmez; eğitimde öğrendiği örüntülerden yeni görüntü üretir. Kopya çekseydi aynı prompt herkeste aynı sonucu verirdi.
  2. Promptu şişirmek: Onlarca sıfat dizmek sonucu iyileştirmez; model gereksiz ya da çelişen ayrıntıları yok sayar, hatta karışık sonuçlar üretir.
  3. Farklı sonuç almayı hata sanmak: Rastgelelik sistemin parçasıdır; aynı görüntüye dönmek istiyorsan seed'i sabitle.
  4. Anatomi ve yazıyı kontrol etmemek: Eller, dişler, ayna yansımaları ve resim içi yazılar klasik zayıf noktalardır; paylaşmadan önce yakınlaştırıp bak.
  5. Üretimi gerçek sanmak: Gerçekçi görüntüler yanlış haberde kullanılabilir; platformlar C2PA gibi içerik kimliği standartları geliştiriyor ama ilk savunma eleştirel bakıştır.
  6. “Ne üretirsem benimdir” varsaymak: Ticari haklar araca ve ülkeye göre değişir; bazı araçlar ünlü yüzü ve marka üretimini yasaklar. Ayrıca metindeki hallüsinasyon olgusunun görsel karşılığı vardır: model, var olmayan bir nesneyi inandırıcı biçimde çizebilir.

Özetle başarılı görsel üretimi üç ayaklıdır: teknolojiyi anlamak, promptu bilinçli kurmak ve çıktıyı eleştirel değerlendirmek. Üçünü oturttuğunda araç seçimin çok belirleyici olmaz; hepsi aynı mantıkla çalışır.

Sık Sorulan Sorular

AI ile görsel üretmek için hangi araç kullanılmalı?

Amaca göre değişir: sohbet ederek yönlendirme için ChatGPT içindeki görsel üretim, sanatsal kalite için Midjourney, ücretsiz yerel kontrol için Stable Diffusion ya da Flux, ticari güvence için Adobe Firefly, yazı içeren görseller için Ideogram iyi başlangıç noktalarıdır.

Metinden görsel üreten diffusion modelleri nasıl çalışır?

Rastgele gürültüyle başlarlar ve promptun yön verdiği adımlarla bu gürültüyü kademeli temizleyerek anlamlı bir görsele ulaşırlar. Model, eğitimde milyonlarca görsele gürültü ekleyip geri temizlemeyi öğrendiği için bu tersine işlemi hiç görmediği tarifler üzerinde de uygulayabilir.

AI ile üretilen bir görselin telif hakkı kime ait olur?

Tek bir yanıt yoktur: araçların kullanım koşulları ticari hakları farklı tanımlar; bazı ülkelerde yalnızca yapay zekâyla üretilmiş, insan emeği içermeyen eserler telif koruması almaz. Ticari işlerde aracının lisans şartlarını oku; ünlü yüzü, marka ve telifli karakter kullanmaktan kaçın.

Dersler

Tümü →