Yapay zekâda veri
Yapay zekânın son yıllardaki sıçramasının ardındaki asıl yakıt algoritma değil, veridir. Bu derste verinin yapay zekâ içindeki yerine, türlerini, kaliteli verinin özelliklerini ve veriyle çalışırken yapılan yaygın hataları somut örneklerle ele alıyoruz. Serinin tamamını görmek istersen Yapay Zekâ dersleri sayfasına göz atabilirsin.
Yapay Zekâda Veri Nedir?
Veri, dünyadan topladığımız ham gözlem ve kayıtlardır: bir sayı, bir cümle, bir fotoğraf, bir ses kaydı, bir tıklama. Tek başına veri henüz anlam taşımaz; düzenlenip yorumlandığında bilgiye dönüşür. Yapay zekâ açısından bakınca veri, sistemin öğreneceği örnekler yığınıdır: model, bu örneklerdeki örüntüleri çıkararak daha önce görmediği durumlarda tahmin yapmayı öğrenir. Bu, kuralları programcının yazdığı klasik yazılımdan temel farktır.
Basit bir örnekle düşünelim: Bir e-posta servisi spam filtresi kurmak istiyor. Milyonlarca e-postayı "spam" ve "spam değil" diye işaretlenmiş biçimde sisteme verirse, yapay zekâ hangi kelimelerin, başlıkların ve gönderici örüntülerinin spam ile ilişkili olduğunu kendisi keşfeder. Klasik yazılımda bir programcının bu kuralları tek tek yazması gerekirdi; veriyle çalışan yaklaşımda kuralları örnekler öğretir. Bu yaklaşımın genel adı makine öğrenmesidir; temelleri için Makine öğrenmesi nedir? dersine bakabilirsin.
Yapay Zekâ Neden Veriye İhtiyaç Duyar?
Bir yapay zekâ modeli boş bir kafayla doğmaz; model nedir? dersinde de değindiğimiz gibi model denilen şey, verideki örüntülerin sayısal bir özetidir. Veri olmazsa öğrenilecek örüntü, dolayısıyla kurulacak model de olmaz. Bu yüzden yapay zekâ projelerinde en çok zaman ve bütçe, model tasarımından çok verinin toplanmasına ve düzenlenmesine gider.
Güncel örnekler bunu net gösterir. 2024-2025 döneminin en çok konuşulan sohbet botları ve büyük dil modelleri, internetten derlenen devasa metin yığınları üzerinde eğitiliyor; okudukları metin karışımı ne kadar geniş ve temizse yanıtları o kadar akıcı ve isabetli oluyor. Otonom araç ekipleri milyonlarca kilometrelik yol görüntüsü topluyor; farklı hava ve ışık koşullarından gelen bu örnekler olmadan aracın bir yayayı bir gölgeden ayırt etmesi mümkün olmazdı.
Verinin niteliği en az niceliği kadar belirleyicidir. Ünlü bir araştırma örneğinde, kurtları yüksek başarıyla tanıdığı sanılan bir görüntü tanıma modeli, çoğu kez kurt değil fotoğraflardaki karlı arka planı tanıyordu; çünkü kümedeki kurt fotoğrafları neredeyse hep karda çekilmişti. Yanlış örüntüyü model icat etmedi; onu veri öğretti.
Veri Türleri
Yapılandırılmış ve yapılandırılmamış veri
Yapılandırılmış veri, satır ve sütunlara oturmuş, hazır tablo hâlindeki veridir: bir öğrenci not çizelgesi, bir bankanın işlem kayıtları. Yapılandırılmamış veri ise önceden belirlenmiş bir düzeni olmayan veridir: e-posta metinleri, fotoğraflar, ses kayıtları, videolar. Başlık, gövde ve ekleri belirli bir düzende taşıdığı için e-posta mesajına bazen yarı yapılandırılmış veri de denir. Günümüzde üretilen verinin büyük bölümü yapılandırılmamıştır; bu yüzden 2024-2025 döneminin büyük dil modelleri ağırlıklı olarak metinle, görüntü ve video üreten modeller ise fotoğraf ve film arşivleriyle çalışır.
Etiketli ve etiketsiz veri
Her örneğin doğru yanıtı da yanında verilmişse buna etiketli veri denir; etiket kavramının tam karşılığı için Etiket (label) nedir? dersine bakabilirsin. Etiketli veriyle öğreten yöntemlere denetimli öğrenme, etiketsiz veriden kendi örüntülerini bulan yöntemlere denetimsiz öğrenme adı verilir. Etiketleme çoğu zaman insan emeği gerektirdiği için pahalıdır; büyük dil modelleri bu yüzden önce etiketsiz metinle ön eğitim yapar, sonra küçük ama kaliteli örneklerle ince ayar alır.
İyi Verinin Özellikleri
Bir veri kümesinin modele iyi öğretebilmesi için taşıması beklenen temel ölçütler şunlardır: yeterli nicelik, doğruluk ve tutarlılık, çeşitlilik, denge, temizlik, güncellik ve kişisel verilerde gizlilik ile etik. Bu ölçütleri tek tek örneklerle açıklayan ayrıntılı listeyi Veri seti nedir? dersinde bulabilirsin.
Burada "özellik" sözcüğünün teknik bir anlamı da var: verideki her ölçülebilir sütun (bir evin metrekare büyüklüğü, bir e-postadaki ünlem sayısı) modele giren bir özellik (feature)tür. Hangi özelliklerin seçileceği modelin başarısını doğrudan etkiler; ayrıntıyı Özellik (feature) nedir? dersinde işledik.
Verinin Yaşam Döngüsü
Veri, model eğitimine hazır hâlde gelmez; bir yaşam döngüsünden geçer.
Toplama
Veri sensörlerden, anketlerden, uygulama kayıtlarından, kamuya açık veri kümelerinden ve kurumların kendi arşivlerinden toplanır. Bu adımda hukuki ve etik sınırlar baştan belirlenmelidir: neyin, kimin izniyle, hangi amaçla toplandığı net olmalıdır.
Temizleme
Eksik değerler doldurulur ya da o satır çıkarılır; aşırı uçtaki aykırı değerler sorgulanır; yinelenen kayıtlar ayıklanır; biçimler tek tipe çevrilir. Uygulamada bir yapay zekâ projesinin zamanının büyük kısmı tam da bu adımda geçer. Arkasındaki ilke meşhurdur: çöp veri girersen, çöp sonuç alırsın (garbage in, garbage out). Bu araçları öğrenmek istersen Yazılım derslerimize bakabilirsin.
Bölme
Temizlenen veri genelde üç parçaya ayrılır: eğitim kümesi modele örüntüleri öğretir, doğrulama kümesi ayarları denemek için kullanılır, test kümesi ise sınav günüdür ve son ana kadar saklanır. Bu bölmenin mantığı ve eğitim sürecinin bütün adımları Model eğitimi nedir? dersinde ayrıntılı işlenir.
Sık Yapılan Hatalar ve Yanılgılar
- "Ne kadar çok veri, o kadar iyi model" yanılgısı: Kirli, dengesiz veya yanlış etiketlenmiş dev bir veri yığını, küçük ama temiz bir kümeden daha kötü sonuç verebilir. Nicelik yalnızca nitelikle birlikte anlam taşır.
- Veri sızıntısı (data leakage): Sınava girecek test verisinin yanlışlıkla eğitimde kullanılmasıdır. Model sınav sorularını önceden görmüş olur ve gerçekte var olmayan bir başarı sergiler; en sinsi ve en sık yapılan hatalardan biridir.
- Güvenilmez etiketler: Etiketleri aceleyle ve tutarsız ölçütlerle işaretlemek modeli yanlış öğretir; insan etiketçilerin kendi tutarsızlığı bile modele işler.
- Temsilsiz örneklem: Yalnızca gündüz çekilmiş trafik fotoğraflarıyla gece sürüşü öğrenilemez; tek bir yaş grubundan toplanan ses verisiyle herkesi anlayan bir sesli asistan yapılamaz. Bu hata, modelin kimler için iyi çalıştığını belirler.
- Veriyi bir kez hazırlayıp bitirmek: Veri hazırlığı ile model geliştirme iç içe yürür; modelin hataları çoğu zaman yeni bir veri ihtiyacını ortaya çıkarır ve döngü baştan işletilir.
Sık Sorulan Sorular
Yapay zekâda veri nedir?
Yapay zekâda veri, sistemin öğreneceği ham gözlem ve kayıtların tümüdür: sayılar, metinler, fotoğraflar, ses kayıtları, tıklamalar. Model, bu örneklerdeki örüntüleri çıkararak yeni durumlarda tahmin yapmayı öğrenir.
Yapay zekâ neden veriye ihtiyaç duyar?
Yapay zekâ, kuralları insanın yazdığı klasik yazılımdan farklı olarak örneklerden öğrenir. Veri olmazsa öğrenilecek örüntü, dolayısıyla kurulacak model de olmaz; verinin niteliği ve niceliği modelin başarısını doğrudan belirler.
Veri ile veri seti arasındaki fark nedir?
Veri, tek tek ham gözlem ve kayıtların genel adıdır. Veri seti ise bu kayıtların belirli bir amaca göre derlenip düzenlenmiş, genellikle tablo hâline getirilmiş koleksiyonudur. Yapay zekâ eğitiminde kullanılan şey veri setidir.