Yapay Zeka Yazılımları · by Yazılım Koçu2026
Computer Vision

Görüntü İşleme ve Computer Vision

Computer vision; nesne tespiti, sınıflandırma, yüz tanıma ve OCR görevlerini derin öğrenmeyle çözer; YOLO, ResNet ve OCR modelleri gerçek zamanlı görsel analiz sağlar.

18 dakika okuma

Computer vision (bilgisayarlı görü) nedir?

Computer vision, bilgisayarların görüntü ve videoları algılayıp anlamlandırmasını sağlayan yapay zeka alanıdır. Modern sistemler evrişimli sinir ağları (CNN) ve Vision Transformer (ViT) mimarilerine dayanır. Uygulamada dört temel görev öne çıkar: nesne tespiti, görüntü sınıflandırma, yüz tanıma ve optik karakter tanıma (OCR). Her görev farklı model ailesi, farklı doğruluk metriği ve farklı donanım profili gerektirir.

Dört temel görev ve tipik modeller

GörevNe yaparYaygın modellerÖrnek kullanım
Nesne tespitiNesneleri sınırlayıcı kutuyla (bbox) işaretlerYOLOv8, Faster R-CNN, RT-DETRGüvenlik kamerası, otonom araç, sayım
SınıflandırmaTüm görüntüye tek etiket atarResNet, EfficientNet, ViTKalite kontrol, tıbbi görüntü, moderasyon
Yüz tanımaYüz tespiti + kimlik eşleştirme (embedding)ArcFace, FaceNet, DeepFaceErişim kontrolü, yoklama
OCRGörüntüdeki metni dijital metne çevirirTesseract, EasyOCR, PaddleOCRFatura okuma, plaka, belge dijitalleştirme

YOLO ile gerçek zamanlı nesne tespiti

YOLO (You Only Look Once), görüntüyü tek bir ağ geçişinde işleyerek tüm nesneleri aynı anda saptar; bu yüzden gerçek zamanlı video akışlarında tercih edilir. Doğruluk mAP (mean Average Precision), hız ise FPS ile ölçülür. Model boyutu büyüdükçe doğruluk artar, hız düşer ve VRAM ihtiyacı yükselir. Aşağıdaki değerler Ultralytics YOLOv8 için yayımlanan yaklaşık COCO ölçümleridir.

YOLOv8 model boyutları (yaklaşık, COCO veri seti)

ModelParametremAP50-95 (yaklaşık)HızTipik donanım
YOLOv8n (nano)~3,2M~37En hızlıCPU / 4GB GPU
YOLOv8s (small)~11M~45Çok hızlıRTX 3060 12GB
YOLOv8m (medium)~26M~50OrtaRTX 3060 / 4070
YOLOv8l (large)~44M~53YavaşRTX 4090 24GB
YOLOv8x (xlarge)~68M~54En yavaşA100 80GB

Pratik kural: canlı kamera akışında düşük gecikme gerekiyorsa nano/small varyantları, arşiv/parti işlemede yüksek doğruluk gerekiyorsa large/xlarge varyantları seçilir. GPU üzerinde küçük modeller genellikle 45 FPS üzerine çıkarak video akışını gerçek zamanlı işleyebilir.

OCR ve plaka tanıma: örnek senaryo

Otopark plaka tanıma gibi uygulamalar iki aşamalıdır: önce bir nesne tespit modeli plaka bölgesini bulur, ardından bir OCR motoru (ör. EasyOCR, PaddleOCR) karakterleri okur. Türkçe plaka formatı (34 ABC 123) için sonuç bir doğrulama/regex katmanından geçirilir.

Örnek senaryo (hipotetik): Bir otopark girişinde, özel eğitilmiş bir tespit modeli plakayı ~%95 doğrulukla bulup OCR ile okuduğunda, tek görüntünün işlenmesi orta seviye bir GPU üzerinde saniyenin altında sürebilir. Bu değerler aydınlatma, açı ve kamera çözünürlüğüne göre önemli ölçüde değişir; gerçek doğruluk saha testiyle doğrulanmalıdır.

Donanım gereksinimleri

DonanımVRAMUygun iş
CPUDüşük hacimli inference, prototip, kanıt-of-konsept
RTX 306012GBKüçük/orta model eğitimi, gerçek zamanlı inference
RTX 409024GBOrta ölçek eğitim + yüksek FPS inference
A10080GBBüyük veri seti eğitimi, çok görevli modeller

Maliyet ve proje büyüklüğü (yaklaşık aralık)

Aşağıdaki rakamlar Türkiye pazarı için yaklaşık, örnek aralıklardır; kapsam, veri etiketleme yükü ve entegrasyon gereksinimine göre ciddi biçimde değişir. Gerçek teklif proje analiziyle çıkar.

Proje tipiKapsamTipik süreYaklaşık maliyet
Basit sınıflandırma2-5 sınıf, transfer learning2-3 hafta~40-80B TL
Nesne tespitiÖzel YOLO eğitimi, etiketleme1-2 ay~80-150B TL
Yüz tanımaTespit + embedding + eşleştirme1,5-2,5 ay~100-180B TL
Kurumsal visionÇok görevli, video analitiği, edge3-6 ay~200-500B TL

2026 eğilimleri

  • Vision Transformer yükselişi: ViT tabanlı modeller birçok kıyaslamada CNN mimarilerine yaklaştı ya da geçti.
  • Multimodal modeller: Görüntü + metni birlikte anlayan modeller (görsel soru-cevap, açıklama üretimi) yaygınlaşıyor.
  • Open-vocabulary tespit: Önceden tanımlı sınıf listesi olmadan, metinle tarif edilen nesneleri bulan yaklaşımlar.
  • Edge dağıtımı: Jetson gibi kartlarda gerçek zamanlı çalışan hafifletilmiş (quantized) modeller artıyor.

Ne zaman hangisini seçmeli?

  • Tek etiketli karar (iyi/kötü, hastalık var/yok) gerekiyorsa: ResNet/EfficientNet sınıflandırma.
  • Konum ve sayım gerekiyorsa: YOLO/RT-DETR nesne tespiti.
  • Kimlik doğrulama gerekiyorsa: ArcFace tabanlı yüz tanıma (KVKK 6698 biyometrik veri kurallarıyla).
  • Belgeden veri çıkarılacaksa: OCR + doğrulama katmanı; el yazısı için özel model.

Görüntü işleme, sesli ve metinsel AI ile birlikte kullanıldığında etkisi artar; ilgili yaklaşımları ses tanıma ve sentiment analizi yazılarımızda ele alıyoruz.

SIK SORULAN SORULAR

Merak edilenler

Computer vision nedir ve hangi görevleri kapsar?

Computer vision (bilgisayarlı görü), bilgisayarların görüntü ve videoları algılayıp anlamlandırmasını sağlayan yapay zeka alanıdır. Dört temel görevi vardır: nesne tespiti (object detection), görüntü sınıflandırma (classification), yüz tanıma (face recognition) ve optik karakter tanıma (OCR). Modern sistemler CNN ve Vision Transformer mimarilerine dayanır.

YOLO modelinin farkı nedir?

YOLO (You Only Look Once), görüntüyü tek bir sinir ağı geçişinde işleyerek tüm nesneleri aynı anda saptar; bu yüzden gerçek zamanlı (real-time) çalışır. GPU üzerinde küçük varyantları 45 FPS üzerine çıkabilir. YOLOv8 nano yaklaşık 3,2M parametreyken, x varyantı yaklaşık 68M parametreye ve COCO üzerinde ~54 mAP doğruluğa ulaşır.

Görüntü işleme projesi için hangi donanım gerekir?

Çıkarım (inference) için küçük modeller CPU veya 4-8GB VRAM ile çalışabilir. Özel model eğitimi için tipik olarak RTX 3060 12GB ile RTX 4090 24GB arası kartlar; büyük veri setleri ve çok görevli modeller için A100 80GB gibi veri merkezi GPU'ları tercih edilir.

Yüz tanımada KVKK açısından nelere dikkat edilmeli?

Yüz verisi, KVKK 6698 kapsamında özel nitelikli (biyometrik) kişisel veridir. İşlenmesi açık rıza veya kanunda öngörülen istisnalar gerektirir; veri minimizasyonu, saklama süresi sınırı, şifreleme ve aydınlatma yükümlülüğü uygulanmalıdır. Sistem tasarımı bu ilkelerle kurgulanmalıdır.

SONRAKİ ADIM

Kurumunuza özel çözümü konuşalım.

İhtiyacınızı yazın; yapay zeka, veri analitiği ve siber güvenlik çözümlerini değerlendirip 1 iş günü içinde dönelim. Aradığınız yoksa talep üzerine geliştiririz.

Talep Oluştur