On-Premise LLM Kurulum Maliyeti 2026: Donanım + Yazılım + Operasyon
On-premise LLM'nin üç maliyet kalemi vardır: donanım (GPU/VRAM), yazılım (çoğu açık kaynak, ücretsiz) ve yıllık operasyon; yaklaşık 50-100M token/ay eşiğinin üzerinde buluta göre ekonomik hale gelir.
Neden on-premise LLM?
On-premise LLM, dil modelini bir bulut API'si yerine kurumun kendi sunucularında çalıştırmak demektir. Türkiye'de birçok kurum için bu bir tercih değil, gerekliliktir. Başlıca gerekçeler:
- KVKK ve veri egemenliği: Müşteri, sağlık ve finansal veriler yurt içinde işlenir; yurt dışına aktarım riski ortadan kalkar (KVKK 6698).
- Yoğun kullanımda maliyet: Yüksek token hacimlerinde on-premise, bulut API'den ucuza gelebilir.
- Bağımsızlık: Sağlayıcı fiyat/politika değişimi veya API deprecation projeyi etkilemez.
- Özelleştirme: Sınırsız fine-tune ve özel konfigürasyon imkânı.
- Yasal zorunluluk: Savunma ve kritik altyapı gibi bazı sektörlerde on-premise şarttır.
1. Donanım maliyetleri
En büyük kalem GPU'dur. Aşağıdaki fiyatlar Türkiye pazarı için yaklaşık, örnek 2026 aralıklarıdır; kur, tedarik ve konfigürasyona göre önemli ölçüde değişir.
| GPU | VRAM | Yaklaşık tek fiyat | Sığdırılan model |
|---|---|---|---|
| RTX 4090 | 24GB | ₺160K–200K | 8B (pilot / consumer) |
| L40S | 48GB | ₺850K–1,1M | 13B–30B (KOBİ sweet spot) |
| H100 | 80GB | ₺2,8M–3,5M | 70B |
| H200 | 141GB | ₺4M–5M | 100B+ |
Sunucu altyapı ek maliyeti: CPU + RAM + hızlı disk (NVMe) + ağ ekipmanı, yaklaşık ₺680K–1,5M ilave getirir.
2. Yazılım maliyetleri
- Açık kaynak LLM: Llama 3.x, Qwen 2.5, Mistral, IBM Granite, Phi-4, DeepSeek V3 — lisans ₺0.
- Çıkarım motoru (ücretsiz): vLLM, TensorRT-LLM, TGI, llama.cpp, Ollama.
- Vektör veritabanı: ChromaDB (₺0), Qdrant, Weaviate, Milvus — açık kaynak sürümleri ücretsiz, yönetilen sürümler ücretli.
- Toplam yazılım kurulumu: Yaklaşık ₺300K–1,5M (entegrasyon + özel geliştirme + izleme).
3. Yıllık operasyon maliyetleri
Donanım alındıktan sonra süregelen kalemler (yaklaşık, örnek aralıklar):
- Elektrik: L40S sunucu (1,5-2 kW) ~₺150K–220K/yıl; H100 sunucu (3-4 kW) ~₺300K–450K/yıl; 8× H100 cluster ~₺600K–900K/yıl.
- Soğutma: KOBİ ~₺50K–100K/yıl; veri merkezi ~₺200K–1M+/yıl.
- Colocation / veri merkezi: Yaklaşık ₺14K–70K/U/yıl.
- MLOps mühendisi: Kıdemli ~₺2M–3M/yıl brüt.
- On-call SRE: ~₺300K–720K/yıl.
- Yedek + güvenlik: Donanım maliyetinin ~%10-15'i.
3 yıllık TCO senaryoları
Aşağıdaki toplam sahip olma maliyeti (TCO) rakamları illüstratif örnek senaryolardır ve konfigürasyona göre değişir:
| Senaryo | Yıl 1 (donanım + kurulum) | Yıl 2-3 operasyon | 3 yıl TCO (yaklaşık) |
|---|---|---|---|
| KOBİ (4× L40S) | ~₺6,75M | ~₺2,5M–2,8M/yıl | ~₺12,1M |
| Mid-market (4× H100) | ~₺20,8M | ~₺5,3M–5,9M/yıl | ~₺32M |
| Kurumsal (8× H100 cluster) | ~₺52,3M | ~₺11,5M–12,8M/yıl | ~₺76,5M |
On-premise vs bulut: kırılma noktası
Karar, kullanım hacmine bağlıdır. Kaba formül: Bulut yıllık ≈ aylık token × 12 × birim token fiyatı; on-premise yıllık ≈ (donanım / amortisman yılı) + operasyon. Bulut maliyeti hacimle doğrusal artarken, on-premise maliyeti büyük ölçüde sabittir; bu yüzden yüksek hacimde on-premise öne geçer.
| Aylık token | Bulut API (yıllık, yaklaşık) | On-prem KOBİ (yıllık, yaklaşık) |
|---|---|---|
| 10M token | ₺150K–600K | ₺2,7M+ |
| 50M token | ₺750K–3M | ₺2,7M (kırılma bölgesi) |
| 100M token | ₺1,5M–6M | ₺2,7M |
| 500M token | ₺7,5M–30M | ₺2,7M (pratikte sınırsız) |
Kırılma noktası: Yaklaşık 50-100M token/ay aralığında on-premise ekonomik olarak öne geçer; bunun altında ve değişken hacimde bulut daha esnektir.
Türkiye 2026 realitesi ve öneri
- Tedarik süresi: L40S ~4-8 hafta, H100 ~8-16 hafta, H200 ~12-20 hafta.
- Tedarikçi: NVIDIA yetkili distribütörler ve sistem entegratörleri (DELL, HPE, Supermicro).
- Vergi/gümrük: Toplam donanım maliyetinin yaklaşık %25-35'ini KDV ve gümrük oluşturabilir.
Pratik öneri: Düşük ve değişken hacimde buluta; yüksek, sabit ve KVKK-hassas hacimde on-premise'e yönelin. Çoğu kurum için en verimli başlangıç, bir RTX 4090/L40S pilotuyla başlayıp hacim doğrulandıkça ölçeklemektir. Hangi modeli çalıştıracağınızı Türkçe LLM karşılaştırması ile, bilgi tabanı stratejinizi ise RAG vs fine-tuning rehberiyle netleştirebilirsiniz.
Merak edilenler
On-premise LLM ne zaman buluttan ucuz olur?
Kırılma noktası kullanım hacmine bağlıdır. Yaklaşık 50-100M token/ay eşiğinin üzerinde, sabit ve yoğun kullanımda on-premise donanımın amortize maliyeti bulut API faturasının altına iner. Bu eşiğin altında, düşük ve değişken hacimde bulut genelde daha ekonomiktir.
70B parametreli bir model için hangi GPU gerekir?
70B model FP16 hassasiyette ~140GB VRAM ister, bu da 2× H100 80GB veya eşdeğeri çoklu GPU demektir. 4-bit quantization ile ihtiyaç ~40-48GB seviyesine iner ve tek bir H100 80GB ya da 2× L40S 48GB üzerinde çalıştırılabilir. Bağlam uzunluğu arttıkça KV-cache için ek VRAM gerekir.
Açık kaynak LLM lisans maliyeti var mı?
Llama 3.x, Qwen 2.5, Mistral 7B, IBM Granite, Phi ve DeepSeek gibi açık kaynak modeller lisans ücreti olmadan indirilip çalıştırılabilir (bazılarında kullanım koşulları vardır). vLLM, TGI, llama.cpp ve Ollama gibi çıkarım motorları da ücretsizdir; maliyet donanım, entegrasyon ve operasyondadır.
On-premise LLM neden KVKK için tercih edilir?
Model kurumun kendi sunucusunda çalıştığı için müşteri, sağlık ve finansal veriler yurt dışındaki bir API sağlayıcısına gönderilmeden işlenir; veri kurum sınırları içinde kalır. Bu, KVKK 6698 kapsamındaki veri işleme ve yurt dışına aktarım gerekliliklerini yönetmeyi kolaylaştırır.
Kurumunuza özel çözümü konuşalım.
İhtiyacınızı yazın; yapay zeka, veri analitiği ve siber güvenlik çözümlerini değerlendirip 1 iş günü içinde dönelim. Aradığınız yoksa talep üzerine geliştiririz.
Talep Oluştur