Ses Tanıma ve Speech-to-Text
Ses tanıma (STT), konuşmayı otomatik olarak metne çevirir; Whisper, Google ve Azure servisleri Türkçe dahil yüksek doğrulukla transkripsiyon, IVR ve sesli asistan sağlar.
Otomatik konuşma tanıma (ASR) nedir?
Automatic Speech Recognition (ASR), konuşulan sözü otomatik olarak yazılı metne dönüştürür. Modern sistemler uçtan uca derin öğrenme modelleridir: ses dalgasını doğrudan alıp kelime dizisi üretirler. Temiz kayıtlarda %90-98 aralığında doğruluk mümkündür; gürültü, ağız ve teknik terim yoğunluğu bu oranı düşürür.
STT servisleri karşılaştırması (yaklaşık)
Aşağıdaki fiyat ve doğruluk değerleri yaklaşık, örnek referanslardır; sağlayıcılar fiyatlandırmayı güncelleyebilir ve gerçek doğruluk ses kalitesine göre değişir.
| Servis | Dil desteği | Türkçe doğruluk (yaklaşık) | Maliyet (yaklaşık) | Öne çıkan |
|---|---|---|---|---|
| Whisper (OpenAI) | 99 dil | ~%95-98 | ~$0,006/dk | Gürültü toleransı, açık kaynak sürümü |
| Google Cloud Speech | 125+ dil | ~%92-96 | ~$0,024/dk | Gerçek zamanlı streaming |
| Azure Speech | 100+ dil | ~%93-97 | ~$1/saat | Konuşmacı ayırma (diarization) |
Açık kaynak Whisper model boyutları
Whisper modelini bulut API yerine kendi sunucunuzda çalıştırmak isterseniz, model boyutu doğruluk-hız-VRAM dengesini belirler. Aşağıdaki değerler yaklaşık referanslardır.
| Model | Parametre | Yaklaşık VRAM | Göreli hız |
|---|---|---|---|
| tiny | ~39M | ~1GB | ~10x |
| base | ~74M | ~1GB | ~7x |
| small | ~244M | ~2GB | ~4x |
| medium | ~769M | ~5GB | ~2x |
| large-v3 | ~1,55B | ~10GB | 1x (en doğru) |
Pratikte Türkçe transkripsiyon için medium ve large-v3 en yüksek isabeti verir; canlı/düşük gecikme gereken senaryolarda small iyi bir dengedir.
Maliyet hesabı
Bulut STT maliyeti süre bazlıdır. İllüstratif formül:
Toplam STT maliyeti = ses süresi (dakika) × birim fiyat
Örnek: Ayda 10.000 dakika ses, Whisper API ile yaklaşık 10.000 × $0,006 = ~$60/ayseviyesinde olur. Aynı hacim Google Cloud ile ~$240/ay civarına çıkar. Yüksek hacimde açık kaynak Whisper modelini kendi GPU sunucunuzda çalıştırmak birim maliyeti ciddi biçimde düşürebilir; bunun karşılığında donanım ve operasyon yükü doğar.
Metinden konuşma (TTS)
Sesli asistan ve IVR akışları STT ile TTS teknolojisini birlikte kullanır. TTS tarafında OpenAI TTS, Google, Azure ve ElevenLabs gibi sağlayıcılar doğal, çok dilli sesler üretir. Türkçe için doğallık ve prozodi (vurgu/tonlama) kalitesi sağlayıcıya göre farklılaşır; kritik uygulamalarda kısa bir pilot testle karşılaştırma önerilir.
Çağrı merkezi otomasyonu: örnek senaryo
Sesli bir IVR/otomasyon katmanı, sık tekrar eden talepleri (sipariş durumu, randevu, basit bilgi) insana devretmeden karşılayabilir. Örnek senaryo (hipotetik): Gelen çağrıların bir bölümü otomatik çözülür, kalanı canlı temsilciye yönlendirilir. Böyle bir kurgu, temsilci başına düşen rutin çağrı yükünü azaltarak bekleme sürelerini kısaltabilir ve 7/24 hizmet sağlayabilir. Gerçek çözüm oranı; senaryo kapsamına, entegrasyonlara ve dil kalitesine bağlıdır ve saha testiyle ölçülmelidir.
Basit bir geri dönüş (ROI) çerçevesi: ROI = (yıllık tasarruf − yıllık sistem maliyeti) ÷ yıllık sistem maliyeti. Buradaki tasarruf; otomatikleşen çağrı hacmi ve çağrı başına işçilik maliyetiyle hesaplanır. Rakamlar kuruma göre değiştiği için tek bir "kesin" oran vermek doğru olmaz.
2026 eğilimleri
- Gerçek zamanlı, düşük gecikmeli ASR: Streaming modeller sesli asistanları daha akıcı hale getiriyor.
- Konuşmacı ayırma + duygu: Transkripsiyona kim-konuştu ve ton bilgisinin eklenmesi yaygınlaşıyor.
- On-premise/edge STT: KVKK 6698 gereği ses verisini kurum içinde tutmak isteyenler için açık kaynak modeller.
- Ses klonlama etiği: TTS ses klonlamada rıza ve doğrulama giderek daha önemli hale geliyor.
Ne zaman hangisini seçmeli?
- Hızlı kurulum, düşük hacim: Whisper API veya Google/Azure bulut servisleri.
- Veri gizliliği / KVKK: Açık kaynak Whisper modelini kurum içi GPU üzerinde çalıştırma.
- Gerçek zamanlı streaming: Google veya Azure canlı akış API katmanları.
- Konuşmacı ayırma gerekiyorsa: Azure Speech veya diarization destekli hatlar.
Sesli AI, metin anlama ile birleştiğinde tam bir asistana dönüşür; ilgili konuları AI chatbot ve sentiment analizi yazılarımızda ele alıyoruz.
Merak edilenler
Speech-to-text (STT) nasıl çalışır?
Otomatik konuşma tanıma (ASR), ses dalgasını akustik özelliklere ayırır, bir dil ve akustik model yardımıyla en olası kelime dizisini çıkarır. Whisper gibi modern uçtan uca (end-to-end) modeller bu adımları tek bir derin öğrenme ağında birleştirir ve gürültüye toleransı yüksektir.
Whisper Türkçe için iyi mi?
Evet. OpenAI Whisper 99 dili destekler ve Türkçe dahil birçok dilde yüksek doğruluk verir; temiz ses kayıtlarında yaklaşık %95 üzeri isabet tipiktir. Ayrıca açık kaynak sürümleri (tiny'den large-v3'e) kendi sunucunuzda çalıştırılabilir.
Ses tanıma maliyeti nasıl hesaplanır?
Bulut API'lerinde maliyet genellikle süre bazlıdır: toplam maliyet = ses süresi (dakika) × birim fiyat. Örnek yaklaşık fiyatlar: Whisper API ~$0,006/dk, Google Cloud Speech ~$0,024/dk, Azure Speech ~$1/saat. Açık kaynak Whisper'ı kendi GPU'nuzda çalıştırırsanız marjinal maliyet donanım ve elektrikle sınırlıdır.
STT ile TTS arasındaki fark nedir?
STT (speech-to-text) konuşmayı metne çevirir; TTS (text-to-speech) metni doğal sese dönüştürür. Sesli asistan ve IVR sistemleri ikisini birlikte kullanır: kullanıcı konuşur (STT), sistem yanıtı üretir ve sesle okur (TTS).
Kurumunuza özel çözümü konuşalım.
İhtiyacınızı yazın; yapay zeka, veri analitiği ve siber güvenlik çözümlerini değerlendirip 1 iş günü içinde dönelim. Aradığınız yoksa talep üzerine geliştiririz.
Talep Oluştur