İçeriğe geç

Açık Ağırlıklı (Open-Weights) Modeller vs. Kapalı API Devleri: Şirketler İçin Maliyet, Gizlilik ve Bağımsızlık Rehberi

Kapalı API kasası ile yerel GPU sunucusu arasında soyut denge

Özet

Açık kaynak yapay zeka vs kapalı modeller tartışması artık ideoloji değil; CTO masasında maliyet, gizlilik ve bağımsızlık bilançosudur. Kapalı API (OpenAI, Anthropic vb. ) dakikalar içinde entegre olur.

Bu rehber 11 Ekim 2026 kesitiyle yönetici özeti üslubunda ilerler: break-even mantığı, KVKK/GDPR riski, vendor lock-in ve karar matrisi. Garantili “şu fiyatta her zaman kazanın” iddiası yoktur; rakamlar varsayımlı senaryodur. Çin açık ağırlık ekosistemi için DeepSeek / Qwen 2026; yerel kurulum için Ollama + Qwen; gölge AI için Shadow AI yazılarına bakın.

Tescilli duvarların ardından açık ekosistem

Kapalı API tekeli algısı nasıl kırıldı?

İlk dalga “en iyi model yalnızca bir API arkasında” hissi yarattı. Llama, Qwen, Mistral ve DeepSeek R1/V3 hattı, indirilebilir ağırlıklarla bu algıyı sarstı. Zirve benchmark’ta kapalı modeller sık sık marjinal önde kalabilir; kurumsal karar ise yalnızca LMSYS sıralaması değildir.

Open-weights ≠ open-source

Open-weights: Eğitilmiş parametre dosyasına erişim (ve genelde çıkarım hakkı). Open-source (OSI anlamında): Eğitim kodu, veri ve lisansın tam özgürlüğü. Ağırlık açık olsa bile eğitim verisi kapalı, lisans ticari kısıtlı veya “açık” etiketi pazarlama olabilir. Karar verirken lisans metnini (Llama, Apache, özel ticari) hukuk/uyumlulukla okuyun.

Gerçek maliyet: token faturası vs GPU TCO

Break-even mantığı

Düşük ve düzensiz trafikte API çoğu zaman daha ucuzdur: sabit GPU maliyeti yoktur. Trafik sürdürülebilir ve yüksek olduğunda API faturası token ile büyür; self-host’ta birim maliyet kapasite doldukça düşebilir — eğer GPU gerçekten doluysa. Boşta yanan H100, API’den pahalıdır.

Görünmeyen maliyetler (self-host)

  • GPU kiralama veya amortisman (H100 / A100 / L40S sınıfı)
  • vLLM, TensorRT-LLM, kuantizasyon (FP8/AWQ), sürekli batching
  • SRE/MLOps iş gücü, gözlem, autoscaling, canary
  • Depolama, egress, yedekleme, güvenlik yaması
  • Elektrik / soğutma (on-prem)
  • Model değerlendirme ve red-team

Veri merkezi CPU-GPU orkestrasyonu ayrı bir hikâyedir; NVIDIA Vera CPU ajan ve eğitim altyapısı bağlamında okunabilir. Tüm self-host’un Vera gerektirdiği iddiası yanlıştır; çoğu inference GPU + sunucu CPU yeterlidir.

Temsili maliyet senaryosu (11 Ekim 2026 varsayımları)

Varsayımlar (açıkça temsili):

  • Kapalı model referansı: GPT-4o list fiyatı bandı ~$2,50 / 1M input, ~$10 / 1M output (OpenAI pricing; doğrulayın).
  • Karışım: %70 input / %30 output → yaklaşık $4,75 / 1M token blended.
  • Self-host: tek L40S sınıfı bulut GPU ~$1,5–2 / saat on-demand bandı (bölge/sağlayıcıya göre değişir) → 24/7 ≈ $1.100–1.500 / ay yalnızca GPU; veya daha ucuz neocloud / reserved.
  • Throughput ve kalite modeli (8B vs 70B) senaryoyu kökten değiştirir — aşağıdaki tablo karar çerçevesidir, teklif değildir.
Aylık trafik (toplam token)Temsili API (blended ~$4,75/M)Temsili self-host notu
10 milyon~$48GPU 24/7 genelde aşırı; API veya küçük paylaşımlı instance mantıklı
100 milyon~$475Sınır bölgesi: kullanım profili + mühendis maliyeti belirler
500 milyon~$2.375Sürekli yüksek load’da optimize vLLM + doğru GPU boyutu rekabetçi olabilir

Okuma kuralı: Output oranı yükseldikçe API pahalanır. Cache hit (prompt caching) API’yi ucuzlatır. Self-host’ta %20 GPU kullanımı break-even’i öteler. Fiyatlar haftalık değişir — satın alma öncesi resmi fiyat sayfasını ve kendi load testinizi kullanın.

Çalışılmış örnek (temsili, muhasebe değil)

Destek asistanı: günde 8.000 istek, ortalama 800 input + 250 output token → ayda ~24M input + 7,5M output. GPT-4o list bandıyla kabaca: input 24×$2,50 + output 7,5×$10 ≈ $60 + $75 = $135/ay. Bu seviyede self-host 24/7 GPU genelde hâlâ pahalıdır.

Aynı ürün viral olur: günde 200.000 istek → ~600M input + 187M output token/ay. Aynı tarife kabaca: 600×2,50 + 187×10 ≈ $1.500 + $1.870 = $3.370/ay yalnızca model token’ı (embedding, araç çağrıları, yeniden denemeler hariç). Bu noktada 1–2 iyi dolu inference GPU + vLLM + reserved fiyat, TCO karşılaştırmasına girer — mühendis maaşı ve SLA’yı unutmayın.

Veri gizliliği, KVKK / GDPR ve güvenlik

Sağlık, finans, hukuk ve e-ticaret müşteri metinlerini harici API’ye göndermek; işleme amacı, aktarım ülkesi, alt işleyenler ve saklama süresi açısından hukuki değerlendirme ister. Zero Data Retention sözleşmesi riski sıfırlamaz; denetim, yanlış yapılandırma ve Shadow AI (çalışanın kişisel hesapla yapıştırdığı veri) ayrı kapıdır.

On-premise veya şirket VPC’sinde izole open-weights, veri sınırını sizin kontrolünüze alır — yanlış IAM, açık endpoint veya log sızıntısı hâlâ sizin sorumluluğunuzdadır. HTTPS ve güvenli tüneller temeldir; sitede ayrı “HTTP vs HTTPS” makalesi doğrulanmadığı için uydurma link verilmez.

Pratik gizlilik kontrol listesi

  1. Hangi alanlar PII / özel nitelikli veri taşıyor?
  2. Prompt ve completion log’ları nerede, ne kadar süre saklanıyor?
  3. Sağlayıcı alt işleyen listesi ve bölge (AB / ABD / diğer) net mi?
  4. Çalışanların kişisel ChatGPT/Claude kullanımı engellenmiş veya politikaya bağlanmış mı? (Shadow AI)
  5. Yerel model endpoint’i yalnızca private network + mTLS/auth ile mi açık?
  6. Eval setinde gerçek müşteri verisi var mı, yoksa sentetik mi?

Bu liste hukuki görüş yerine geçmez; teknik ekibin “veri nereye gidiyor?” sorusunu boş bırakmamasını sağlar.

Vendor lock-in ve gölge güncellemeler

Kapalı API’de model sürümü, sistem prompt davranışı veya fiyat sessizce değişebilir; regression testleri kırılır. Open-weights’te belirli bir checkpoint’i dondurup (freeze) yıllarca aynı hash ile çalıştırabilirsiniz — lisans izin verdiği sürece. Bedeli: güvenlik yamaları ve yeni yetenekleri sizin merjeniz.

Hibrit sık görülür: dışarıda genel sohbet için API; PII içeren iş yükünde yerel model. Agentic AI mimarilerinde araç çağrıları hangi modelin hangi ağda çalıştığını netleştirin.

Lisans ve uyumluluk tuzağı

“Hugging Face’de var = istediğimiz gibi kullanırız” yanlıştır. Bazı ağırlıklar araştırma lisansı, kullanıcı eşiği veya coğrafi kısıt taşır. Ticari ürününüzde model çıktısını yeniden satmak, marka kısıtları veya attribution koşulları ayrıca okunmalıdır. Kapalı API’de ise ToS, rate limit ve hesap kapanma riski vardır — iki tarafta da hukuk/uyumluluk checklist’i şarttır.

Fiyat ve davranış “gölge güncellemesi”

Kapalı tarafta aynı model adının arkasında snapshot değişebilir; eval suite olmadan fark haftalarca geç fark edilir. Open-weights’te siz versiyonu pin’lersiniz; güvenlik açıklarını da siz takip edersiniz. İkisinin de ops yükü vardır — sadece farklı yerde.

Sansür, guardrail ve fine-tuning

Kapalı modellerin güvenlik filtreleri bazı teknik/tıbbi sorguları kısıtlayabilir — bu bazen istenen özelliktir. Open-weights’te LoRA / QLoRA ile şirket dokümantasyonu ve kod tabanına ince ayar yapılabilir; operasyonel yük (veri kalitesi, eval, drift) artar. “Sansürsüz = her zaman daha iyi” değildir; uyumluluk ve zararlı çıktı riski şirkete kalır.

Fine-tune öncesi sıra çoğu ekip için şudur: (1) prompt + araç tasarımı, (2) RAG / retrieval kalitesi, (3) küçük LoRA, (4) ancak o zaman büyük SFT. Erken fine-tune, kötü veriyi modele “öğretir” ve bakım maliyetini kalıcılaştırır.

Karar matrisi

KriterKapalı API (OpenAI, Anthropic…)Open-weights (Llama, Qwen, Mistral…)
Giriş eşiğiDakikalar; sıfır GPU yönetimiContainer, GPU, serving stack
İlk yatırımDüşük (pay-as-you-go)GPU + mühendislik
Ölçek maliyetiTrafikle büyürKapasite dolunca birim maliyet düşebilir
MahremiyetSağlayıcı politikası + sözleşmeVeri sınırınızda (doğru kurulursa)
Zirve yetenekSıkça marjinal öndeYakın; domain fine-tune ile rekabet
KontrolSağlayıcı güncellemesiCheckpoint freeze mümkün
Gözlem / SLOSağlayıcı SLASizin SRE’niz

Hangi senaryoda hangisi?

  • MVP / düşük trafik / hız: Kapalı API.
  • Yüksek sürdürülebilir token + sıkı veri sınırı: Open-weights (VPC/on-prem).
  • Karışık: Router — hassas trafik yerel, genel trafik API.
  • Regüle sektör: Önce hukuki/uyumluluk, sonra maliyet.

Mimari notlar (kısa)

Tipik self-host yolu: model ağırlığı → vLLM/TGI OpenAI-uyumlu endpoint → API gateway + auth → uygulama. Küçük ekipler için Ollama geliştirme hızı verir; üretimde genelde daha sert serving (sürekli batching, metrik, kuyruk) gerekir — yerel Qwen rehberi geliştirici ortamı içindir, kurumsal SLA garantisi değildir.

GPU paralelliği matris çarpımlarını hızlandırır; doğru VRAM ve kuantizasyon seçimi maliyeti belirler. “Her zaman 8×H100” varsaymayın; 7B/8B ile L40S/A10 sınıfı birçok iç araç için yeterlidir.

Referans mimari (kurumsal iskelet)

[Uygulama] → [Policy router]
                 ├─ hassas → [VPC vLLM / open-weights]
                 └─ genel  → [Kapalı API]
         → [Observability: latency, cost/token, toxicity]
         → [Eval regression gate]

Router kuralları örnekleri: müşteri mesajı → yerel; genel bilgi sorusu → API; kod üretimi → lisanslı open-weights veya onaylı API. Her kuralın sahibi (güvenlik / platform) yazılı olmalıdır.

Model boyutu ve iş yükü eşlemesi (kaba)

İş yüküSık tercihNot
İç arama / RAG özet7B–14B open-weights veya ucuz APIGecikme ve maliyet öncelikli
Kod asistanıDomain’e göre 14B–70B veya APILisans + eval şart
Karmaşık ajan / araç zinciriGüçlü kapalı veya büyük open-weightsAgentic güvenlik katmanı
Regüle veri çıkarımıYalnızca VPC open-weightsAPI’ye ham PII yok

90 günlük karar planı (CTO)

  1. Gün 1–15: İş yüklerini sınıflandırın (PII / genel / kod). Aylık token tahmini + peak QPS.
  2. Gün 16–45: Kapalı API ile prod-benzeri eval; aynı eval setini 1–2 open-weights adayında (ör. Qwen/Llama boyutu) koşun.
  3. Gün 46–75: Hassas sınıf için VPC POC (vLLM, auth, log redaction). Maliyet panosu: token vs GPU-saat.
  4. Gün 76–90: Router politikası + freeze kararı + sahiplik (platform vs uygulama ekibi).

Bu plan sıralama veya tasarruf garantisi vermez; karar kalitesini artırır.

Sıkça sorulan sorular

Açık kaynak yapay zeka ile kapalı modeller arasındaki fark nedir?

Kapalı modeller API arkasında çalışır; ağırlığa erişemezsiniz. Open-weights modellerde parametre dosyasını indirip kendi altyapınızda çalıştırabilirsiniz. OSI “açık kaynak” ile open-weights aynı şey olmayabilir.

Open-weights ne demek?

Eğitilmiş model ağırlıklarının (genelde lisans koşullarıyla) dağıtılmasıdır. Eğitim kodu veya veri seti her zaman açık değildir.

Self-host her zaman daha ucuz mu?

Hayır. Düşük trafikte API çoğu zaman daha ucuzdur. Yüksek ve sürekli yük + iyi kullanım oranında self-host birim maliyeti düşebilir.

Hangi token seviyesinde break-even olur?

Modele, input/output oranına, GPU fiyatına ve kullanım oranına bağlıdır. Bu yazıdaki tablolar temsili çerçevedir; kendi load testiniz şarttır.

KVKK için API kullanmak yasak mı?

Genel yasak değildir; veri kategorisi, amaç, aktarım ve sözleşmeler değerlendirilir. Hassas veride yerel veya sıkı sözleşmeli işleme tercih edilir — hukuki danışmanlık yerine geçmez.

Vendor lock-in nasıl azalır?

OpenAI-uyumlu soyutlama katmanı, eval suite, hibrit router ve kritik iş yükünde dondurulabilir open-weights.

Llama vs GPT nasıl seçilir?

Görev benchmark’ı, gecikme, maliyet, lisans ve veri sınırı birlikte. Tek liderboard yeterli değildir.

Fine-tune şart mı?

Hayır. Önce RAG + iyi prompt; domain dilinde kalite yetmezse LoRA değerlendirin.

vLLM nedir?

Yüksek throughput’lu LLM serving kütüphanesi; sürekli batching ve bellek yönetimi ile üretim çıkarımını hedefler.

Hibrit mimari mantıklı mı?

Çoğu kurum için evet: hassas veri yerel, genel yetenek API.

Anthropic / OpenAI arasında open-weights kararı değişir mi?

Fiyat ve yetenek farkı sağlayıcıya göre değişir; karar çerçevesi aynıdır: token TCO, veri sınırı, lock-in. Daha ucuz kapalı model break-even’i self-host aleyhine kaydırır; pahalı reasoning modeli tersine.

Ne zaman yeniden değerlendirilir?

Üç ayda bir: (1) token hacmi %50+ değiştiyse, (2) yeni lisans/fiyat duyurusu, (3) eval’de kalite gerilemesi, (4) regülasyon veya müşteri sözleşmesi değişimi.

Sonuç

Açık ağırlıklı modeller kapalı API’yi “öldürmedi”; karar uzayını genişletti. Düşük trafikte hız ve basitlik API’nin yanında; ölçek, mahremiyet ve kontrol open-weights’in. Doğru cevap çoğu zaman ya/hep değil, iş yüküne göre routerdır. Rakamları kendi fiyat listeniz ve GPU kullanım oranınızla yeniden hesaplayın — 11 Ekim 2026 fiyatları yarın değişebilir.

Kaynakça

  1. OpenAI — API pricing (gpt-4o ve güncel modeller)
  2. Meta / Qwen / Mistral — model kartları ve lisans metinleri
  3. vLLM / TensorRT-LLM — serving belgelendirmesi
  4. AWS / bulut GPU fiyat listeleri (P5, g6e vb.; bölgeye göre)
  5. KVKK / GDPR — veri işleme ve aktarım çerçeveleri (resmî metinler)

Araştırma tarihi: 11 Ekim 2026. Maliyet senaryoları temsildir; üretim kararı öncesi resmi fiyat ve kendi ölçümünüzü kullanın.