Yapay Zeka Yazılımları · by Yazılım Koçu2026
LLM

Türkçe LLM Karşılaştırma 2026: Llama, Mistral, Qwen, Granite

2026'da Türkçe kurumsal projeler için en güçlü açık kaynak seçenekler Llama 3.x, Qwen 2.5, Mistral ve IBM Granite'tir; genel işler 7B–13B, derin muhakeme 70B+ modellerle çözülür.

13 dakika okuma

Açık kaynak LLM çağı neden önemli?

2026'da açık kaynak (ağırlıkları indirilebilen) büyük dil modelleri olgunlaştı ve birçok Türkçe kurumsal senaryoda kapalı API'lere gerçek bir alternatif haline geldi. KOBİ ve kurumsal ölçekte başlıca faydalar şunlardır:

  • Veri egemenliği: Model on-premise çalışır, veri yurt dışına çıkmaz — KVKK 6698 ile doğal uyum.
  • Öngörülebilir maliyet: Token başına değil, donanım amortismanı üzerinden bütçelenir.
  • Sınırsız kullanım: Yoğun hacimlerde kapalı API'ye göre çok daha ucuza gelebilir.
  • Tam özelleştirme: Fine-tuning ile sektörel ve kuruma özgü dil kazandırılabilir.
  • Bağımsızlık: Sağlayıcı fiyat/politika değişimi veya API deprecation projeyi etkilemez.

Açık kaynak model karşılaştırması

Aşağıdaki tablo 2026 itibarıyla öne çıkan açık kaynak model ailelerini karşılaştırır. Türkçe sütunu, çok dilli değerlendirmeler ve saha deneyimine dayanan öznel bir değerlendirmedir; kesin sıralama göreve ve fine-tuning kalitesine göre değişir.

Model ailesiGeliştiriciBoyut aralığıLisansBağlam penceresiTürkçe (öznel)
Llama 3.xMeta1B–405BLlama Community128K tokenGüçlü
Qwen 2.5Alibaba0.5B–72BApache 2.0128K tokenGüçlü
MistralMistral AI7B–123BApache 2.0 (7B) / MRL (Large)32K–128Kİyi
IBM Granite 3IBM2B–34BApache 2.0128K tokenİyi (kurumsal)
Phi-4Microsoft~14BMIT16K tokenOrta
DeepSeek V3DeepSeekMoE 671B (~37B aktif)Açık ağırlık128K tokenİyi

Hangi boyut, hangi donanım?

Model boyutu doğrudan VRAM ihtiyacını belirler. Kaba formül: VRAM ≈ parametre sayısı × bayt/parametre. FP16'da bayt/parametre = 2 (7B ≈ 14GB), 4-bit quantization'da ≈ 0,5 (7B ≈ 3,5-4GB + ek yük). Bağlam ve KV-cache büyüdükçe gerçek ihtiyaç artar.

Sınıf4-bit VRAM (yaklaşık)Tipik donanımKullanım senaryosu
1B–3B (çok küçük)~2-3GBRTX 4060 / edgeBasit chatbot, cihaz üstü; Türkçe sınırlı
7B–13B (küçük-orta)~6-10GBRTX 4090 24GB / L40S 48GBGenel chatbot, RAG, müşteri hizmet
30B–72B (büyük)~20-45GB2-4× A100/H100 80GBKompleks RAG, muhakeme, multi-agent
100B+ / MoE (frontier)90GB+8× H100/H200 clusterAraştırma, en yüksek kalite

Türkçe fine-tuning etkisi

Açık kaynak modeller Türkçeyi kutudan çıktığı haliyle idare edebilir, ancak kurumsal kalite için Türkçe verilerle fine-tuning genelde şarttır. Aşağıdaki değerler, Türkçe NLP görevlerinde tipik olarak gözlenen örnek/illüstratif iyileşme aralıklarıdır; kesin sayılar veri kalitesine ve göreve göre değişir.

GörevKutudan (yaklaşık)Fine-tuned (yaklaşık)İyileşme
Türkçe metin özeti~%72~%88+%16
Sentiment analizi~%75~%91+%16
Sarkazm/ironi tespiti~%42~%71+%29
Yerel kültür/bağlam~%55~%84+%29

Sonuç: Dilsel nüans (ironi, deyim, yerel bağlam) gerektiren görevlerde fine-tuning kazancı en yüksektir.

Fine-tuning yöntemleri

  • Full fine-tuning: Tüm parametreler güncellenir. En güçlü ama en pahalı; optimizer state'leri nedeniyle model boyutunun birkaç katı VRAM ister.
  • LoRA: Ağırlıklar dondurulur, yalnızca düşük ranklı adapter katmanları eğitilir. Full FT'ye yakın sonuç, çok daha düşük maliyet.
  • QLoRA: 4-bit quantization + LoRA. 7B-13B modeller tek bir 24GB tüketici GPU üzerinde bile fine-tune edilebilir.
  • Prompt/prefix tuning: Yalnızca soft prompt eğitilir. En ucuz ama en sınırlı yöntem.

Hibrit mimari (2026'da en yaygın desen)

Çoğu olgun kurum, talebi zorluğuna göre yönlendiren bir router kurar: basit istekleri küçük ve ucuz bir on-premise modele, orta karmaşıklığı orta boy modele, yalnızca en zor istekleri ise bulut frontier API'ye gönderir. Tipik akış:

  1. Kullanıcı talebi bir router ile sınıflandırılır (basit / orta / karmaşık).
  2. Basit → on-premise küçük model (ör. Llama 8B): hızlı ve ucuz.
  3. Orta → on-premise orta model (ör. 70B): dengeli.
  4. Karmaşık → bulut frontier API: pahalı ama en yüksek kalite.

Bu yaklaşımda taleplerin büyük kısmı on-premise (ucuz + KVKK uyumlu) işlenirken, yalnızca küçük bir yüzde buluta çıkar; böylece hem maliyet hem gizlilik optimize edilir.

2026 eğilimleri ve öneri

  • MoE (Mixture-of-Experts) yükseliyor: DeepSeek V3 gibi modeller büyük toplam parametre, düşük aktif parametre ile verimlilik sağlıyor.
  • Küçük modeller güçleniyor: 7B–14B modeller birçok kurumsal görevde artık yeterli.
  • Quantization standartlaşıyor: GGUF, AWQ ve 4-bit formatlar üretimde norm haline geldi.
  • Bağlam pencereleri genişliyor: 128K token yaygın, uzun doküman işleme kolaylaşıyor.

Pratik seçim: Genel Türkçe chatbot ve RAG için Llama 3.x veya Qwen 2.5'in 8B–13B sürümüyle başlayın; derin muhakeme veya karmaşık ajan görevleri için 70B+ modele geçin; katı kurumsal lisans/uyum gerekiyorsa IBM Granite değerlendirin. Modeli her durumda Türkçe verilerle fine-tune edin. Bu modelleri kendi sunucunuzda çalıştırmanın maliyetini on-premise LLM kurulum maliyeti yazısında, bilgi tabanı bağlama kararını ise RAG vs fine-tuning rehberinde bulabilirsiniz.

SIK SORULAN SORULAR

Merak edilenler

Türkçe için en iyi açık kaynak LLM hangisi?

Tek bir kazanan yoktur; kullanım senaryosuna göre değişir. 2026'da genel Türkçe görevlerde Llama 3.x ve Qwen 2.5 geniş ekosistem ve güçlü çok dilli performansla öne çıkar; Mistral verimliliğiyle, IBM Granite ise kurumsal lisans ve uyum odağıyla tercih edilir. Kritik olan modeli Türkçe verilerle fine-tune etmektir.

7B parametreli bir modeli çalıştırmak için ne kadar VRAM gerekir?

Kaba kural: FP16 hassasiyette VRAM ≈ parametre sayısı × 2 bayt, yani 7B model ≈ 14GB. 4-bit quantization ile bu ~4-6GB seviyesine iner ve 24GB bir RTX 4090 üzerinde rahatça çalışır. 70B model için FP16 ~140GB (çoklu GPU), 4-bit ile ~40-48GB gerekir.

LoRA ile QLoRA arasındaki fark nedir?

LoRA, modelin ağırlıklarını dondurup yalnızca küçük adapter katmanlarını eğitir; full fine-tuning maliyetinin küçük bir kısmıyla ona yakın sonuç verir. QLoRA ise modeli 4-bit quantize ederek LoRA uygular; böylece 7B-13B bir model tek bir tüketici GPU (24GB) üzerinde bile fine-tune edilebilir.

Açık kaynak LLM neden KVKK uyumu için avantajlıdır?

Açık kaynak model kendi sunucunuzda (on-premise) çalıştığı için müşteri, sağlık ve finansal veriler yurt dışındaki bir API sağlayıcısına gönderilmez; veri kurum sınırları içinde kalır. Bu, KVKK 6698 kapsamındaki veri işleme ve yurt dışına aktarım yükümlülüklerini yönetmeyi kolaylaştırır.

SONRAKİ ADIM

Kurumunuza özel çözümü konuşalım.

İhtiyacınızı yazın; yapay zeka, veri analitiği ve siber güvenlik çözümlerini değerlendirip 1 iş günü içinde dönelim. Aradığınız yoksa talep üzerine geliştiririz.

Talep Oluştur