Veri seti nedir?
Bu derste yapay zekânın en temel yapı taşlarından biri olan veri seti kavramını sıfırdan ele alıyoruz: ne anlama gelir, nasıl yapılandırılır, türleri nelerdir ve kaliteli bir seti sıradan bir veri yığınından ayıran özellikler nelerdir. Konunun geniş çerçevesini görmek istersen Yapay Zekâ dersleri sayfasındaki diğer derslerimize de göz atabilirsin.
Veri Seti Nedir?
Veri seti, belirli bir amaca hizmet etmek üzere toplanmış ve düzenlenmiş veriler bütünüdür. Tek tük dağılmış veri parçaları değil; ortak bir yapıya sahip, çoğunlukla tablo gibi satır ve sütunlar hâlinde örgütlenmiş bir bütündür. Benzetme şöyle kurulabilir: yapay zekâ modeli sınava giren bir öğrenciyse, veri seti onun çalıştığı soru bankasıdır. Soru bankası olmayan öğrenci öğrenemez; hatalı sorulardan oluşan bir bankayla çalışan öğrenci de yanlış öğrenir. Model de ancak gördüğü veri seti kadar iyidir. Verinin yapay zekâ ekosistemindeki genel rolünü Yapay zekâda veri dersinde bulabilirsin.
Bir Veri Setinin Anatomisi: Satır, Özellik ve Etiket
En yaygın biçimi tablodur: her satır bir örnek (tek bir gözlem), her sütun bir özellik (o gözleme ilişkin bir bilgi parçası) tutar. Örneğin ev kirası tahmini için hazırlanan bir sette her satır tek bir evi; metrekare, oda sayısı, ısınma türü ve kira tutarı sütunları ise o eve ait bilgileri temsil eder. Özellik kavramının ayrıntılarını Özellik (feature) nedir? dersinde derinlemesine işliyoruz.
Denetimli öğrenmede tabloya bir sütun daha eklenir: etiket. Etiket, modelin öğrenmeye çalıştığı doğru cevaptır. “Bu e-posta spam mi?” sorusu için kurulan bir sette her e-postanın “spam / spam değil” olarak işaretlenmiş olması gerekir; çünkü model, örnekleri cevaplarıyla birlikte görür. Etiket hazırlamanın püf noktalarını Etiket (label) nedir? dersinde ele alıyoruz. Etiketli örneklerle çalışan bu yaklaşımın adı denetimli öğrenmedır; yapay zekânın bu öğrenme düzeninin bütün resmi için Makine öğrenmesi nedir? dersine göz atabilirsin.
Veri Seti Türleri
Tek bir doğru sınıflama yoktur; bakış açısına göre setler şöyle ayrılır:
- Yapıya göre: Yapılandırılmış setler düzenli satır-sütun düzenine sahiptir (satış kayıtları, not çizelgeleri). Yapılandırılmamış setler şablona oturmayan verilerden oluşur: fotoğraf arşivleri, ses kayıtları, serbest metinler, videolar. 2024-2025 döneminin büyük yapay zekâ modelleri ağırlıklı olarak bu ikinci türle çalışır.
- Veri türüne göre: metin (dil modellerinin eğitim setleri), görüntü (röntgen arşivleri, fotoğraflar), ses (konuşma kayıtları), video (otonom araç kayıtları) ve sayısal tablolar (finans ve sağlık verileri).
- Etiket durumuna göre: her örneğin doğru cevabı belliyse set etiketlidir; cevap yoksa etiketsizdir ve genellikle verideki örüntüleri keşfetmek için kullanılır.
- Kullanım amacına göre: Modelin öğrenirken göreceği eğitim bölümü ile hiç görmediği örneklerle sınandığı test bölümü; yaygın uygulamada model ayarları için araya bir doğrulama bölümü de girer. Bu bölme işleminin kurallarını Model eğitimi nasıl yapılır? dersinde anlatıyoruz.
İyi Bir Veri Setini İyi Yapan Özellikler
Aynı algoritma, farklı kalitede iki setle eğitilirse sonuçlar birbirinden çok farklı olur. Kaliteli bir veri setinde şu beklentiler karşılanır:
- Temsil edicilik: Set, gerçek dünyadaki çeşitliliği yansıtmalıdır. Yalnızca gündüz çekimi görüntülerle eğitilen bir yaya tespit modeli, gece kayıtlarında başarısız olur.
- Denge: Sınıflar kabaca eşit sayıda olmalıdır. 50 spam örneğine karşılık 10.000 normal e-posta içeren bir set, modeli “her e-posta normal” demeye yönlendirir.
- Temizlik: Hatalı, eksik ve mükerrer kayıtlar ayıklanmış olmalıdır. “Çöp giren, çöp çıkar” (garbage in, garbage out) ilkesi tam olarak burada devreye girer.
- Yeterli miktar: Görevin zorluğuna göre yeterli sayıda örnek gerekir; basit bir sınıflama az veriyle çözülebilirken dil anlama gibi görevler devasa setler gerektirir.
- Yasal ve etik uygunluk: Kişisel veriler ilgili mevzuata uygun toplanmalı, gerektiğinde anonimleştirilmelidir.
Güncel Yapay Zekâdan Veri Seti Örnekleri
Kavramı somutlaştırmak için bilinen birkaç örnek:
- MNIST: El yazısı rakam görüntülerinden oluşan, yaklaşık 70 bin etiketli örneğiyle klasikleşmiş set; yeni başlayanların ilk deneyi sayılır.
- ImageNet: Milyonlarca etiketli fotoğraf barındıran set; 2010’lu yıllarda görüntü tanımadaki büyük sıçramayı tetiklemiştir.
- Dil modellerinin eğitim setleri: ChatGPT benzeri araçların arkasındaki modeller, web metinleri, kitaplar ve kaynak kodlardan oluşturulan devasa setlerle eğitilir. 2024-2025 döneminde performansı artırmak için model tarafından üretilen sentetik veri kullanımı da belirgin biçimde yaygınlaştı.
- Otonom araç verileri: Araç kameralarından ve sensörlerinden toplanan kayıtlar; yaya, trafik ışığı ve levha gibi nesneler etiketlenerek model eğitiminde kullanılır.
Sık Yapılan Hatalar ve Yanılgılar
Yeni başlayanların en çok düştüğü noktalar şunlardır:
- “Veri seti, veritabanıdır” sanmak: Veritabanı verileri saklayan ve yöneten sistemdir; veri seti ise belirli bir amaç için bu kaynaklardan derlenmiş, analize hazır koleksiyondur. Aynı veritabanından amaçlara göre onlarca farklı set üretilebilir.
- “Ne kadar çok veri, o kadar iyi model” demek: Miktar tek başına çözüm değildir; hatalı ve dengesiz dev bir set, küçük ama temiz bir setten daha kötü sonuç verebilir.
- Eğitim ve test verisini karıştırmak: Modelin sınav sorularını önceden görmesine yol açan bu hata literatürde “veri sızıntısı” olarak adlandırılır ve gerçek başarının olduğundan yüksek görünmesine neden olur.
- Tekrarları fark etmemek: Aynı örneğin yüzlerce kopyası setin görünen büyüklüğünü şişirir ama modele yeni bir şey öğretmez; test örneklerinin eğitimde tekrar etmesi de sonuçları yanıltır.
- “Veri seti bir kez hazırlanır, biter” demek: Dünya değişir; dil kullanımı, tüketim alışkanlıkları, fotoğraf koşulları zamanla farklılaşır. Set güncellenmezse model zamanla eskir.
Veri seti, yapay zekâ öğrencisinin ders kitabıdır: ne kadar düzenli ve kapsamlıysa öğrenim o kadar sağlam olur. Bu zemin hazır olduğunda sıradaki adım, veriyi modele işletme sürecidir; bunu Model eğitimi nedir? dersinde ayrıntılarıyla inceliyoruz.
Sık Sorulan Sorular
Veri seti nedir?
Belirli bir amaca hizmet etmek üzere toplanmış, ortak bir yapıya sahip ve düzenlenmiş veriler bütünüdür. Yapay zekâda modeller öğrenmelerini bu setler üzerinden gerçekleştirir.
Veri seti ile veritabanı arasındaki fark nedir?
Veritabanı, verileri uzun vadeli saklayan ve yöneten sistemdir; veri seti ise genellikle bu kaynaktan belirli bir amaç için derlenmiş, analize ve model eğitimine hazır koleksiyondur.
Yapay zekâ için iyi bir veri seti nasıl olmalı?
Gerçek dünyayı temsil etmeli, sınıfları dengeli olmalı, hatalı ve mükerrer kayıtlardan arınmış olmalı, görev için yeterli sayıda örnek içermeli ve yasal kurallara uygun toplanmalıdır. Eğitim ve test bölümlerine doğru biçimde ayrılması da şarttır.