Yapay Zeka Yazılımları · by Yazılım Koçu2026
Speech AI

Ses Tanıma ve Speech-to-Text

Ses tanıma (STT), konuşmayı otomatik olarak metne çevirir; Whisper, Google ve Azure servisleri Türkçe dahil yüksek doğrulukla transkripsiyon, IVR ve sesli asistan sağlar.

16 dakika okuma

Otomatik konuşma tanıma (ASR) nedir?

Automatic Speech Recognition (ASR), konuşulan sözü otomatik olarak yazılı metne dönüştürür. Modern sistemler uçtan uca derin öğrenme modelleridir: ses dalgasını doğrudan alıp kelime dizisi üretirler. Temiz kayıtlarda %90-98 aralığında doğruluk mümkündür; gürültü, ağız ve teknik terim yoğunluğu bu oranı düşürür.

STT servisleri karşılaştırması (yaklaşık)

Aşağıdaki fiyat ve doğruluk değerleri yaklaşık, örnek referanslardır; sağlayıcılar fiyatlandırmayı güncelleyebilir ve gerçek doğruluk ses kalitesine göre değişir.

ServisDil desteğiTürkçe doğruluk (yaklaşık)Maliyet (yaklaşık)Öne çıkan
Whisper (OpenAI)99 dil~%95-98~$0,006/dkGürültü toleransı, açık kaynak sürümü
Google Cloud Speech125+ dil~%92-96~$0,024/dkGerçek zamanlı streaming
Azure Speech100+ dil~%93-97~$1/saatKonuşmacı ayırma (diarization)

Açık kaynak Whisper model boyutları

Whisper modelini bulut API yerine kendi sunucunuzda çalıştırmak isterseniz, model boyutu doğruluk-hız-VRAM dengesini belirler. Aşağıdaki değerler yaklaşık referanslardır.

ModelParametreYaklaşık VRAMGöreli hız
tiny~39M~1GB~10x
base~74M~1GB~7x
small~244M~2GB~4x
medium~769M~5GB~2x
large-v3~1,55B~10GB1x (en doğru)

Pratikte Türkçe transkripsiyon için medium ve large-v3 en yüksek isabeti verir; canlı/düşük gecikme gereken senaryolarda small iyi bir dengedir.

Maliyet hesabı

Bulut STT maliyeti süre bazlıdır. İllüstratif formül:

Toplam STT maliyeti = ses süresi (dakika) × birim fiyat

Örnek: Ayda 10.000 dakika ses, Whisper API ile yaklaşık 10.000 × $0,006 = ~$60/ayseviyesinde olur. Aynı hacim Google Cloud ile ~$240/ay civarına çıkar. Yüksek hacimde açık kaynak Whisper modelini kendi GPU sunucunuzda çalıştırmak birim maliyeti ciddi biçimde düşürebilir; bunun karşılığında donanım ve operasyon yükü doğar.

Metinden konuşma (TTS)

Sesli asistan ve IVR akışları STT ile TTS teknolojisini birlikte kullanır. TTS tarafında OpenAI TTS, Google, Azure ve ElevenLabs gibi sağlayıcılar doğal, çok dilli sesler üretir. Türkçe için doğallık ve prozodi (vurgu/tonlama) kalitesi sağlayıcıya göre farklılaşır; kritik uygulamalarda kısa bir pilot testle karşılaştırma önerilir.

Çağrı merkezi otomasyonu: örnek senaryo

Sesli bir IVR/otomasyon katmanı, sık tekrar eden talepleri (sipariş durumu, randevu, basit bilgi) insana devretmeden karşılayabilir. Örnek senaryo (hipotetik): Gelen çağrıların bir bölümü otomatik çözülür, kalanı canlı temsilciye yönlendirilir. Böyle bir kurgu, temsilci başına düşen rutin çağrı yükünü azaltarak bekleme sürelerini kısaltabilir ve 7/24 hizmet sağlayabilir. Gerçek çözüm oranı; senaryo kapsamına, entegrasyonlara ve dil kalitesine bağlıdır ve saha testiyle ölçülmelidir.

Basit bir geri dönüş (ROI) çerçevesi: ROI = (yıllık tasarruf − yıllık sistem maliyeti) ÷ yıllık sistem maliyeti. Buradaki tasarruf; otomatikleşen çağrı hacmi ve çağrı başına işçilik maliyetiyle hesaplanır. Rakamlar kuruma göre değiştiği için tek bir "kesin" oran vermek doğru olmaz.

2026 eğilimleri

  • Gerçek zamanlı, düşük gecikmeli ASR: Streaming modeller sesli asistanları daha akıcı hale getiriyor.
  • Konuşmacı ayırma + duygu: Transkripsiyona kim-konuştu ve ton bilgisinin eklenmesi yaygınlaşıyor.
  • On-premise/edge STT: KVKK 6698 gereği ses verisini kurum içinde tutmak isteyenler için açık kaynak modeller.
  • Ses klonlama etiği: TTS ses klonlamada rıza ve doğrulama giderek daha önemli hale geliyor.

Ne zaman hangisini seçmeli?

  • Hızlı kurulum, düşük hacim: Whisper API veya Google/Azure bulut servisleri.
  • Veri gizliliği / KVKK: Açık kaynak Whisper modelini kurum içi GPU üzerinde çalıştırma.
  • Gerçek zamanlı streaming: Google veya Azure canlı akış API katmanları.
  • Konuşmacı ayırma gerekiyorsa: Azure Speech veya diarization destekli hatlar.

Sesli AI, metin anlama ile birleştiğinde tam bir asistana dönüşür; ilgili konuları AI chatbot ve sentiment analizi yazılarımızda ele alıyoruz.

SIK SORULAN SORULAR

Merak edilenler

Speech-to-text (STT) nasıl çalışır?

Otomatik konuşma tanıma (ASR), ses dalgasını akustik özelliklere ayırır, bir dil ve akustik model yardımıyla en olası kelime dizisini çıkarır. Whisper gibi modern uçtan uca (end-to-end) modeller bu adımları tek bir derin öğrenme ağında birleştirir ve gürültüye toleransı yüksektir.

Whisper Türkçe için iyi mi?

Evet. OpenAI Whisper 99 dili destekler ve Türkçe dahil birçok dilde yüksek doğruluk verir; temiz ses kayıtlarında yaklaşık %95 üzeri isabet tipiktir. Ayrıca açık kaynak sürümleri (tiny'den large-v3'e) kendi sunucunuzda çalıştırılabilir.

Ses tanıma maliyeti nasıl hesaplanır?

Bulut API'lerinde maliyet genellikle süre bazlıdır: toplam maliyet = ses süresi (dakika) × birim fiyat. Örnek yaklaşık fiyatlar: Whisper API ~$0,006/dk, Google Cloud Speech ~$0,024/dk, Azure Speech ~$1/saat. Açık kaynak Whisper'ı kendi GPU'nuzda çalıştırırsanız marjinal maliyet donanım ve elektrikle sınırlıdır.

STT ile TTS arasındaki fark nedir?

STT (speech-to-text) konuşmayı metne çevirir; TTS (text-to-speech) metni doğal sese dönüştürür. Sesli asistan ve IVR sistemleri ikisini birlikte kullanır: kullanıcı konuşur (STT), sistem yanıtı üretir ve sesle okur (TTS).

SONRAKİ ADIM

Kurumunuza özel çözümü konuşalım.

İhtiyacınızı yazın; yapay zeka, veri analitiği ve siber güvenlik çözümlerini değerlendirip 1 iş günü içinde dönelim. Aradığınız yoksa talep üzerine geliştiririz.

Talep Oluştur