KonuAnlatım.com

Ses tanıma

Yapay Zekâ · Bölüm 87Yapay ZekâDers

Bu derste yapay zekânın en sık kullandığımız uygulamalarından biri olan ses tanımayı baştan sona işliyoruz: nasıl çalıştığı, hangi aşamalardan geçtiği, Türkçeye özgü zorluklar ve sık yapılan yanılgılar. Yapay zekânın diğer uygulama alanlarını da görmek istersen Yapay Zekâ dersleri sayfasına göz atabilirsin.

Ses Tanıma Nedir?

Ses tanıma, konuşulan sözcüklerin ses dalgası hâlindeki sinyalden çıkarılıp yazılı metne dönüştürülmesi işidir. Günlük dilde "konuşma tanıma" ya da "sesi yazıya çevirme" (speech-to-text) adlarıyla da anılır. Teknik olarak görev şudur: mikrofona gelen sesi örnekler hâlinde alır, içindeki konuşmayı çözer ve en olası yazımı üretir. Dikkat: ses tanıma yalnızca yazıya çevirme işidir; söylenenin anlamını kavramak ayrı bir adımdır.

Ses tanımayla sık karıştırılan iki işi ayıralım:

  • Konuşma tanıma: "Ne söyleniyor?" sorusuna cevap verir; sesi metne çevirir.
  • Konuşmacı tanıma: "Bunu kim söylüyor?" sorusuna cevap verir; sesin sahibini tanır. Telefon bankacılığındaki sesle kimlik doğrulama buna örnektir.
  • Ses sentezi (text-to-speech): Ters yönde çalışır; yazıyı seslendirir. Sesli asistanın sana konuşan kısmı budur.

Ses Tanıma Sistemi Nasıl Çalışır?

Arkasındaki fikir basittir: ses, havada yayılan basınç dalgasıdır; mikrofon bu dalgayı elektrik sinyaline, sinyal de sayılara çevirir. Yapay zekâ bu sayı dizisinden sözcükleri çözerek cümleyi kurar. Modern sistemler tipik olarak şu aşamalardan geçer:

  1. Sesin yakalanması ve ön işleme: Ses milisaniyelik kısa parçalara bölünür, gürültü azaltılır, ses seviyesi düzenlenir.
  2. Öznitelik çıkarımı: Her parçadan, insan kulağının algılayışına yakın biçimde frekans bilgisi özetlenir. Mel frekans katsayıları (MFCC) ve spektrogram bu işin klasik araçlarıdır.
  3. Akustik model: Derin sinir ağı, özniteliklere bakarak her parçanın hangi sese (foneme ya da harfe) karşılık geldiğini tahmin eder.
  4. Dil modeli: Aynı ses dizisi birden çok yazımla eşleşebilir; dil modeli, anlamca tutarlı sözcük dizisini seçer.
  5. Çözümleme ve biçimlendirme: En olası cümle seçilir; noktalama, büyük harf ve sayı yazımları eklenir.

Dil modeli neden şart?

Yalnız başına akustik model yetmez. İngilizcede bunun klasik örneği vardır: "recognize speech" (konuşmayı tanı) ile "wreck a nice beach" (güzel bir kumsalı mahvet) benzer duyulan iki ses dizisidir; hangisinin doğru olduğu ancak cümlenin anlamına bakılarak anlaşılır. Bu yüzden dil modeli, akustik modelle el ele çalışır; büyük dil modellerinin devreye girmesiyle bu işbirliği daha da güçlenmiştir.

Kural Tabanlı Sistemlerden Uçtan Uca Modellere

Ses tanımanın tarihçesi yapay zekânın genel çizgisini yansıtır. 1980-2000'li yıllarda sistemler elle yazılmış dilbilgisi kuralları ve gizli Markov modelleriyle çalışırdı; kelime dağarcıkları dar, gürültüye dayanıklılıkları düşüktü. 2010'larda derin öğrenmenin devreye girmesiyle akustik modeller sinir ağlarına geçti ve hata oranları hızla düştü. 2020'lerde ise uçtan uca (end-to-end) modeller standart hâle geldi: tek bir sinir ağı ham sesten doğrudan metne gider. OpenAI'ın 2022'de açık kaynak olarak yayımladığı Whisper modeli bu yaklaşımın yaygın örneklerindendir; Türkçe dâhil birçok dilde dikte ve altyazı üretiminde kullanılır. 2024-2025 döneminde ses tanıma, çok kipli (multimodal) büyük modellere gömülü durumda: sohbet modeliyle gerçek zamanlı sesli konuşmak, canlı altyazı ve toplantı özetleri artık sıradan uygulamalar arasına girdi.

Ses Tanıma Nerede Kullanılır?

  • Sesli asistanlar ve akıllı hoparlörler: Uyandırma sözcüğü algılandıktan sonra sesli komutun metne çevrilmesi bu aşamada yapılır.
  • Dikte ve transkripsiyon: Toplantı kayıtlarının yazıya dökülmesi, ders notları, röportaj arşivleri. Günümüz araçları konuşmacıları ayırıp "kim ne dedi"yi de işaretleyebilir; buna konuşmacı ayrıştırma (diarization) denir.
  • Altyazı ve erişilebilirlik: Videolarda otomatik altyazı, işitme güçlüğü yaşayanlar için canlı yazıya dökme, hareket kısıtlılığı olan kullanıcılar için cihazı sesle yönlendirme.
  • Telefon ve çağrı merkezleri: Menülerde sesle yönlendirme, çağrı kayıtlarının çözümlenip özetlenmesi.
  • Araç içi sistemler: Sürücünün elini direksiyondan ayırmadan navigasyonu ve telefonu yönetmesi. Sesli etkileşim güvenlik açısından da tercih edilir; bu bağlam Otonom araçlar dersinde işlenen araç teknolojileriyle kesişir.
  • Robotlar ve akıllı ev: Ev robotlarının sözlü komutları anlaması; konunun geneline Robotik dersinden bakabilirsin.

Ses tanıma, görüntü işlemeyle birlikte yapay zekânın "algılama" katmanını oluşturur: biri dünyayı duymaya, öbürü görmeye yarar. Görme tarafının nasıl çalıştığını merak edersen Görüntü işleme dersine göz atabilirsin. Dil öğrenenlere telaffuz geri bildirimi vermek gibi eğitsel kullanımlar için de Eğitimde yapay zekâ dersi iyi bir devam noktasıdır.

Türkçe İçin Ses Tanıma Neden Zor?

  • Eklemeli (bitişken) yapı: Türkçede tek sözcüğe çok sayıda ek gelerek uzun kelimeler oluşur; "evlerindeymişçesine" gibi bir kelime sözlük aramasıyla bulunamaz. Bu yüzden modern sistemler kelimeyi bütünüyle değil, alt sözcük parçaları hâlinde tahmin eder.
  • Az kaynaklı dil sorunu: Modeller saatlerce işaretlenmiş konuşmayla eğitilir; İngilizce için erişilebilir veri miktarı çok daha yüksektir. Açık büyük modeller bu açığı büyük ölçüde kapattı ama Türkçe, İngilizce kadar olgunlaşmamıştır.
  • Aksan ve telaffuz çeşitliliği: Aynı cümle bölgeye, yaşa ve konuşma hızına göre çok farklı seslenir.
  • Gürültü: Kalabalık, müzik ya da araç gürültüsü içinde konuşmak, en iyi modellerde bile hata oranını yükseltir.

Başarı ölçümünde kelime hata oranı (WER) kullanılır: sistemin ürettiği metinle doğru metin arasındaki eksik, fazla ya da yer değiştirmiş kelime yüzdesidir; düşükse sistem başarılı demektir. Ancak "sıfır hata" hiçbir ortamda standart değildir.

Sık Yapılan Hatalar ve Yanılgılar

  • "Ses tanıma, konuşmacı tanımadır." Değildir: biri ne söylendiğini, öbürü kimin söylediğini çözer. Aynı sistem ikisini birden yapmayabilir.
  • "Yapay zekâ sesi bizim duyduğumuz gibi duyar." Duymaz; sesi sayılara çevirip bu sayıların örüntülerini okur. "Duyma" bir benzetmedir.
  • "Artık kusursuz çalışıyor." Hata oranı düştü ama sıfır olmadı; gürültü, aksan ve teknik terimler yine yanlış tanımalara yol açar. Tutanak, rapor gibi kritik metinler mutlaka gözden geçirilmelidir.
  • "Sesli asistan cümleyi ses tanımayla anlıyor." Anlamayı yapan, ses tanımanın sonrasındaki doğal dil anlamlandırma katmanıdır. Zincir şöyledir: uyandırma sözcüğü → ses tanıma → anlamlandırma → eylem → seslendirme.
  • "Kayıtlarım hep cihazda kalıyor." Ürüne göre değişir; bazı sistemler cihaz üzerinde, bazıları sesi buluta gönderip orada çözer. Ses kişisel veridir; hangi verinin nereye gittiğini anlamak için Veri gizliliği dersi önemli bir temel sunar, gizlilik başlıklı risklerin geneline ise Yapay zekâ etiği dersinde değinilir.

Sıfırdan öğrenen biri için özet şu: sistem sesi sayıya çevirir, akustik model sesi harfe bağlar, dil modeli anlamlı cümleyi seçer; çıktı hiçbir zaman yüzde yüz garantili değildir, bu yüzden kritik işlerde insan denetimi şarttır.

Sık Sorulan Sorular

Ses tanıma nedir?

Konuşulan sözcüklerin ses sinyalinden çıkarılıp yazılı metne dönüştürülmesi işidir; sesli asistanların söyleneni yazıya çevirmek için yaptığı ilk aşamadır.

Ses tanıma ile konuşmacı tanıma arasındaki fark nedir?

Ses tanıma "ne söylendiğini" yazıya çevirir; konuşmacı tanıma ise "kimin söylediğini" tanır. Dikte ve otomatik altyazı ses tanımanın, sesle kimlik doğrulama ise konuşmacı tanımanın alanıdır.

Türkçe ses tanıma neden zordur?

Türkçenin eklemeli yapısı yüzünden tek sözcük çok sayıda ekle uzayabilir ve sözlük tabanlı sistemler bunu doğrudan tahmin edemez; ayrıca işaretlenmiş Türkçe konuşma verisi İngilizceye göre sınırlıdır. Modern uçtan uca modeller bu sorunları büyük ölçüde azaltmıştır.

Dersler

Tümü →