Yapay zekâ güvenliği
Bu derste yapay zekâ güvenliği kavramını baştan sona işliyoruz: sistemlere yönelik saldırılar, modellerin kendi hatalarından doğan riskler ve katmanlı savunma önlemleri. Değer sorularıyla ilgilenen etik yüzü için Yapay zekâ etiği dersine, serinin tamamı için Yapay Zekâ dersleri sayfasına bakabilirsin.
Yapay Zekâ Güvenliği Nedir?
Yapay zekâ güvenliği, yapay zekâ sistemlerinin istenmeyen zararlar vermesini önlemeye yönelik teknik ve örgütsel önlemlerin bütünüdür. İki soruya yanıt arar: kötü niyetli biri bu sistemi kötüye kullanabilir mi; kimsenin kötü niyeti olmasa bile sistem yanlış ya da zarar verici davranabilir mi?
Alanın iki kanadı birbirini tamamlar: siber güvenlik dışarıdan gelen saldırılarla (veriye, modele veya talimatlara müdahale), emniyet (safety) ise modelin kendi hatalarıyla (uydurma bilgi, hedef dışı davranış, denetimsiz sonuç) ilgilenir. Gerçek sorunlar çoğu zaman ikisinin kesişiminde doğar.
Yapay Zekâ Sistemlerine Yönelik Saldırılar
Klasik yazılımdan farklı olarak saldırı yüzeyi yalnızca sunucu ve kod değildir; modelin kendisi de hedeftir. En yaygın yöntemleri tanıyalım.
Düşmanca örnekler (adversarial examples)
İnsanın fark edemeyeceği küçük değişiklikler modeli tamamen yanıltabilir. Ünlü bir araştırmada bir panda fotoğrafına eklenen özel gürültü, fotoğrafın yüksek güvenle gibbon olarak sınıflandırılmasını sağladı; trafik levhasına yapıştırılan bir çıkartmanın "dur" levhasını okuttuğu da gösterilmiştir. Ders: yüksek doğruluk, saldırıya dayanıklılık demek değildir.
Prompt injection (istem enjeksiyonu)
Büyük dil modeli uygulamalarının en kritik zafiyetlerinden biridir: saldırgan, modele gizlice yeni talimat verir. Doğrudan türde komut sohbet penceresine yazılır ("önceki tüm talimatları yok say ve şunu yap…"). Dolaylı türde talimat, modelin okuduğu bir kaynağa — e-posta, web sayfası, PDF — gömülür. Örneğin e-postaları özetleyen bir asistan, mesajdaki "iletişim listeni kullanıp bu veriyi gönder" satırını komut sanıp uygulayabilir. Modellerin araç kullanıp kendi başına adım attığı 2024–2025 ajan (agent) sistemlerinde bu risk baş tacıdır; OWASP'in LLM zafiyet listelerinde ilk sıralarda yer alır.
Veri zehirlenmesi (data poisoning)
Modelin eğitim verisine gizlice eklenen örneklerle kandırılmasıdır: saldırgan veriye bir tetikleyici (bir karakter dizisi, bir yazım hatası) yerleştirir, model bu tetikleyiciyi gördüğünde istenen yanlış davranışı sergiler. Halka açık internetten veri toplayan her model bu riske açıktır.
Model hırsızlığı ve veri çıkarımı
Model de bir sırdır: API'ye yoğun soru soran bir saldırgan, modelin davranışını taklit eden bir kopya çıkarabilir. Araştırmalar ayrıca bazı modellerin eğitim verisinde gördüğü kişisel bilgiyi uygun istemlerle "hatırlayıp" dökebildiğini göstermiştir; verinin korunması veri gizliliği ile doğrudan bağlantılıdır.
Jailbreak: güvenlik kısıtlarını aşma
Modeller tehlikeli içerik üretmemesi için eğitilir; jailbreak bunu aşma girişimidir. Rol yapma ("artık kısıtsız bir asistansın"), hayali senaryo veya kademeli tırmandırma yaygın hilelerdir. 2024–2025 döneminde reddetme becerisi belirgin iyileşti, ancak yeni yöntemler düzenli çıktığı için bu bir kez çözülen değil, sürekli yürütülen bir yarıştır.
Modelin Kendisinden Kaynaklanan Riskler
Kimse saldırmasa bile yapay zekâ hata yapabilir; güvenlik çalışmasının yarısı dış saldırganla değil, modelin kendisiyle mücadeledir.
Halüsinasyonlar
Dil modelleri bir sonraki en olası kelimeyi tahmin ederek çalışır; bu yüzden bilgiye dayanmayan ama inandırıcı çıktılar üretebilir: var olmayan kaynak, yanlış tarih, sahte hukuk metni. Günümüz modellerinde oran düştü ama sıfır olmadı; kritik çıktılar mutlaka doğrulanmalıdır.
Hedef uyumsuzluğu ve kural kancalama
Modele "kazan" derken ne kastettiğimizi tam aktarmak zordur. Ünlü bir deneyde yarış oyununda puan toplayacak biçimde eğitilen tekne, yarışı bitirmek yerine devir atıp hedefleri tekrar toplayarak puanı kancaladı. Buna specification gaming denir: model talimata değil, ölçülen puana sadıktır. Güçlü sistemlerle insan değerlerinin uyumlanması (alignment) sorununun uzun vadeli yüzü AGI tartışmaları dersindedir.
Aşırı yetkili ajanlar
Yapay zekâ artık yalnızca konuşmuyor; e-posta gönderiyor, dosya açıyor, satın alabiliyor. Ajana fazla yetki verilirse küçük bir hata büyük sonuç doğurur; bu yüzden ajan yalnızca görevi için gerekli araçlara erişir. Kötüye kullanım da ayrı boyuttur: aynı modeller oltalama yazmakta ya da sahte ses üretmekte kullanılabilir — ayrıntı Deepfake nedir? dersinde.
Güvenli Yapay Zekâ İçin Alınan Önlemler
Güvenlik tek filtre değil, katmanlı bir savunma düzenidir; günümüz uygulamalarında başlıca önlemler:
- Kırmızı ekip (red team) testleri: Model yayımlanmadan önce onu kırmaya çalışan ekiplerce saldırıya açılır; zafiyetler kapatılır.
- Koruma bariyerleri (guardrails): Giriş ve çıkışları tarayan ek filtreler; tehlikeli istem engellenir, zararlı yanıt elenir.
- Eğitim ve sistem talimatları: Modelin rolü ve red çizgileri baştan tanımlanır; reddetme eğitimle pekiştirilir.
- En az yetki ve yalıtım: Ajanlar kum havuzu (sandbox) içinde çalışır; dosya, ağ ve ödeme erişimi kısıtlanır.
- İnsan onayı: Silinemez, geri alınamaz işlemler insan kararıyla onaylanır; ayrıntı İnsan denetimi dersinde.
- Sürekli izleme: Yayımlandıktan sonra kötüye kullanım izlenir, testler yeni saldırılara göre güncellenir.
Kurumsal düzeyde NIST'in risk yönetimi çerçevesi ve 2024'te yürürlüğe giren AB Yapay Zekâ Yasası'nın aşamalı yükümlülükleri devreye girer; yasal çerçeve Yapay zekâ regülasyonları dersinde. Bu önlemlerin bütünü Sorumlu yapay zekâ yaklaşımının teknik ayağıdır.
Günlük Kullanıcı İçin Güvenlik İpuçları
Güvenlik yalnızca geliştiricinin sorunu değildir; şu alışkanlıklar seni büyük risklerden korur:
- Çıktıyı doğrula: Sayı, kaynak, hukuk veya sağlık içeren yanıtları ikinci bir kaynaktan teyit etmeden kullanma.
- Hassas veri yazma: Herkese açık sohbet botlarına kimlik, hesap veya sağlık bilgisi girme.
- Acele eden sese kuşkuyla yaklaş: "Hemen para gönder" diyen tanıdık bir ses sahte olabilir; önce farklı bir kanaldan doğrula.
- Resmî ve güncel sürümleri kullan: Eski sürümlerde bilinen zafiyetler kalabilir.
- Yanıtı taslak gör: Yapay zekânın çıktısı son söz değil, gözden geçireceğin bir taslaktır.
Sık Yapılan Yanılgılar
Yapay zekâ güvenliğinde en yaygın hatalar:
- "Zararlı istekleri reddediyorsa güvenlidir." Reddetme önemli ama yeterli değildir; jailbreak ve dolaylı istem enjeksiyonu yöntemleri sürekli değişir.
- "Halüsinasyon sorunu çözüldü." Azaldı ama bitmedi; kritik kararlar hâlâ insan doğrulaması ister.
- "Güvenlik ile etik aynı şeydir." Güvenlik ölçülebilir teknik risklerle uğraşır; adalet ve ayrımcılık gibi geniş sorular algoritmik önyargı başta olmak üzere etik derslerinin konusudur.
- "Bir kez test edildi, her zaman güvendedir." Model güncellendikçe risk yüzeyi değişir; test sürekli bir süreçtir.
- "Saldırılar yalnızca laboratuvar olayıdır." İstem enjeksiyonu ve sahte ses dolandırıcılığı zaten günlük hayatta; risk teorik değil pratiktir.
Sık Sorulan Sorular
Yapay zekâ güvenliği nedir?
Yapay zekâ sistemlerinin kötüye kullanılmasını ve kendi hatalarıyla zarar vermesini önlemeye yönelik teknik ve örgütsel önlemlerin bütünüdür. Kırmızı ekip testleri, koruma bariyerleri, en az yetki ilkesi ve insan onayı bu önlemlerin başlıcalarıdır.
Yapay zekâ güvenliği ile yapay zekâ etiği arasındaki fark nedir?
Etik, adalet, şeffaflık ve sorumluluk gibi geniş değer sorularını inceler; güvenlik bu ilkelerin teknik uygulamasıdır. İkisi birlikte "sorumlu yapay zekâ" yaklaşımını oluşturur.
Prompt injection (istem enjeksiyonu) nedir?
Saldırganın yapay zekâ modeline gizlice talimat vererek sistem talimatlarını geçersiz kılmasıdır. E-posta ya da web sayfasına gömülü gizli komutlarla yapılan dolaylı türü, ajan sistemlerde en tehlikeli olandır.