Görüntü İşleme ve Computer Vision
Computer vision; nesne tespiti, sınıflandırma, yüz tanıma ve OCR görevlerini derin öğrenmeyle çözer; YOLO, ResNet ve OCR modelleri gerçek zamanlı görsel analiz sağlar.
Computer vision (bilgisayarlı görü) nedir?
Computer vision, bilgisayarların görüntü ve videoları algılayıp anlamlandırmasını sağlayan yapay zeka alanıdır. Modern sistemler evrişimli sinir ağları (CNN) ve Vision Transformer (ViT) mimarilerine dayanır. Uygulamada dört temel görev öne çıkar: nesne tespiti, görüntü sınıflandırma, yüz tanıma ve optik karakter tanıma (OCR). Her görev farklı model ailesi, farklı doğruluk metriği ve farklı donanım profili gerektirir.
Dört temel görev ve tipik modeller
| Görev | Ne yapar | Yaygın modeller | Örnek kullanım |
|---|---|---|---|
| Nesne tespiti | Nesneleri sınırlayıcı kutuyla (bbox) işaretler | YOLOv8, Faster R-CNN, RT-DETR | Güvenlik kamerası, otonom araç, sayım |
| Sınıflandırma | Tüm görüntüye tek etiket atar | ResNet, EfficientNet, ViT | Kalite kontrol, tıbbi görüntü, moderasyon |
| Yüz tanıma | Yüz tespiti + kimlik eşleştirme (embedding) | ArcFace, FaceNet, DeepFace | Erişim kontrolü, yoklama |
| OCR | Görüntüdeki metni dijital metne çevirir | Tesseract, EasyOCR, PaddleOCR | Fatura okuma, plaka, belge dijitalleştirme |
YOLO ile gerçek zamanlı nesne tespiti
YOLO (You Only Look Once), görüntüyü tek bir ağ geçişinde işleyerek tüm nesneleri aynı anda saptar; bu yüzden gerçek zamanlı video akışlarında tercih edilir. Doğruluk mAP (mean Average Precision), hız ise FPS ile ölçülür. Model boyutu büyüdükçe doğruluk artar, hız düşer ve VRAM ihtiyacı yükselir. Aşağıdaki değerler Ultralytics YOLOv8 için yayımlanan yaklaşık COCO ölçümleridir.
YOLOv8 model boyutları (yaklaşık, COCO veri seti)
| Model | Parametre | mAP50-95 (yaklaşık) | Hız | Tipik donanım |
|---|---|---|---|---|
| YOLOv8n (nano) | ~3,2M | ~37 | En hızlı | CPU / 4GB GPU |
| YOLOv8s (small) | ~11M | ~45 | Çok hızlı | RTX 3060 12GB |
| YOLOv8m (medium) | ~26M | ~50 | Orta | RTX 3060 / 4070 |
| YOLOv8l (large) | ~44M | ~53 | Yavaş | RTX 4090 24GB |
| YOLOv8x (xlarge) | ~68M | ~54 | En yavaş | A100 80GB |
Pratik kural: canlı kamera akışında düşük gecikme gerekiyorsa nano/small varyantları, arşiv/parti işlemede yüksek doğruluk gerekiyorsa large/xlarge varyantları seçilir. GPU üzerinde küçük modeller genellikle 45 FPS üzerine çıkarak video akışını gerçek zamanlı işleyebilir.
OCR ve plaka tanıma: örnek senaryo
Otopark plaka tanıma gibi uygulamalar iki aşamalıdır: önce bir nesne tespit modeli plaka bölgesini bulur, ardından bir OCR motoru (ör. EasyOCR, PaddleOCR) karakterleri okur. Türkçe plaka formatı (34 ABC 123) için sonuç bir doğrulama/regex katmanından geçirilir.
Örnek senaryo (hipotetik): Bir otopark girişinde, özel eğitilmiş bir tespit modeli plakayı ~%95 doğrulukla bulup OCR ile okuduğunda, tek görüntünün işlenmesi orta seviye bir GPU üzerinde saniyenin altında sürebilir. Bu değerler aydınlatma, açı ve kamera çözünürlüğüne göre önemli ölçüde değişir; gerçek doğruluk saha testiyle doğrulanmalıdır.
Donanım gereksinimleri
| Donanım | VRAM | Uygun iş |
|---|---|---|
| CPU | — | Düşük hacimli inference, prototip, kanıt-of-konsept |
| RTX 3060 | 12GB | Küçük/orta model eğitimi, gerçek zamanlı inference |
| RTX 4090 | 24GB | Orta ölçek eğitim + yüksek FPS inference |
| A100 | 80GB | Büyük veri seti eğitimi, çok görevli modeller |
Maliyet ve proje büyüklüğü (yaklaşık aralık)
Aşağıdaki rakamlar Türkiye pazarı için yaklaşık, örnek aralıklardır; kapsam, veri etiketleme yükü ve entegrasyon gereksinimine göre ciddi biçimde değişir. Gerçek teklif proje analiziyle çıkar.
| Proje tipi | Kapsam | Tipik süre | Yaklaşık maliyet |
|---|---|---|---|
| Basit sınıflandırma | 2-5 sınıf, transfer learning | 2-3 hafta | ~40-80B TL |
| Nesne tespiti | Özel YOLO eğitimi, etiketleme | 1-2 ay | ~80-150B TL |
| Yüz tanıma | Tespit + embedding + eşleştirme | 1,5-2,5 ay | ~100-180B TL |
| Kurumsal vision | Çok görevli, video analitiği, edge | 3-6 ay | ~200-500B TL |
2026 eğilimleri
- Vision Transformer yükselişi: ViT tabanlı modeller birçok kıyaslamada CNN mimarilerine yaklaştı ya da geçti.
- Multimodal modeller: Görüntü + metni birlikte anlayan modeller (görsel soru-cevap, açıklama üretimi) yaygınlaşıyor.
- Open-vocabulary tespit: Önceden tanımlı sınıf listesi olmadan, metinle tarif edilen nesneleri bulan yaklaşımlar.
- Edge dağıtımı: Jetson gibi kartlarda gerçek zamanlı çalışan hafifletilmiş (quantized) modeller artıyor.
Ne zaman hangisini seçmeli?
- Tek etiketli karar (iyi/kötü, hastalık var/yok) gerekiyorsa: ResNet/EfficientNet sınıflandırma.
- Konum ve sayım gerekiyorsa: YOLO/RT-DETR nesne tespiti.
- Kimlik doğrulama gerekiyorsa: ArcFace tabanlı yüz tanıma (KVKK 6698 biyometrik veri kurallarıyla).
- Belgeden veri çıkarılacaksa: OCR + doğrulama katmanı; el yazısı için özel model.
Görüntü işleme, sesli ve metinsel AI ile birlikte kullanıldığında etkisi artar; ilgili yaklaşımları ses tanıma ve sentiment analizi yazılarımızda ele alıyoruz.
Merak edilenler
Computer vision nedir ve hangi görevleri kapsar?
Computer vision (bilgisayarlı görü), bilgisayarların görüntü ve videoları algılayıp anlamlandırmasını sağlayan yapay zeka alanıdır. Dört temel görevi vardır: nesne tespiti (object detection), görüntü sınıflandırma (classification), yüz tanıma (face recognition) ve optik karakter tanıma (OCR). Modern sistemler CNN ve Vision Transformer mimarilerine dayanır.
YOLO modelinin farkı nedir?
YOLO (You Only Look Once), görüntüyü tek bir sinir ağı geçişinde işleyerek tüm nesneleri aynı anda saptar; bu yüzden gerçek zamanlı (real-time) çalışır. GPU üzerinde küçük varyantları 45 FPS üzerine çıkabilir. YOLOv8 nano yaklaşık 3,2M parametreyken, x varyantı yaklaşık 68M parametreye ve COCO üzerinde ~54 mAP doğruluğa ulaşır.
Görüntü işleme projesi için hangi donanım gerekir?
Çıkarım (inference) için küçük modeller CPU veya 4-8GB VRAM ile çalışabilir. Özel model eğitimi için tipik olarak RTX 3060 12GB ile RTX 4090 24GB arası kartlar; büyük veri setleri ve çok görevli modeller için A100 80GB gibi veri merkezi GPU'ları tercih edilir.
Yüz tanımada KVKK açısından nelere dikkat edilmeli?
Yüz verisi, KVKK 6698 kapsamında özel nitelikli (biyometrik) kişisel veridir. İşlenmesi açık rıza veya kanunda öngörülen istisnalar gerektirir; veri minimizasyonu, saklama süresi sınırı, şifreleme ve aydınlatma yükümlülüğü uygulanmalıdır. Sistem tasarımı bu ilkelerle kurgulanmalıdır.
Kurumunuza özel çözümü konuşalım.
İhtiyacınızı yazın; yapay zeka, veri analitiği ve siber güvenlik çözümlerini değerlendirip 1 iş günü içinde dönelim. Aradığınız yoksa talep üzerine geliştiririz.
Talep Oluştur