LLM Maliyet Optimizasyonu: Token, Cache ve Model Seçimi
Sezer Koçer
1 dk okuma

Özet
FinOps panelleri, prompt sıkıştırma, batch API ve küçük model yönlendirme. Ölçülebilir tasarruf.
FinOps başlangıcı
Token, latency ve model ID loglanmadan optimizasyon yok. Dashboard: günlük spend, peak saat, departman. Anomaly alert.
Model routing
Basit intent classifier ucuz modele yönlendirir. Kritik cevap pahalı model. Fallback zinciri tanımlı.
Prompt sıkıştırma
Gereksiz örnek ve tekrar kaldır. System prompt versiyonla. JSON çıktı şeması kısa tut.
Cache
Semantic cache benzer soruda embedding karşılaştırma. Exact cache system prompt + user hash. TTL politika.
Batch API
Raporlama ve etiketleme gece batch. %50 indirim sınıfları değerlendir. SLA gevşek işler için.
Quantization
Self-host’ta Q4/Q8. Cloud’da provider quantization tier. Kalite regresyon test seti.
Context yönetimi
Rolling summary, retrieval instead of dump. Max token cap hard limit.
Sözleşme
Committed use discount bulut anlaşmasında. Reserved capacity OpenAI/Azure.
Sonuç
LLM maliyeti ürün tasarımı meselesi. Ölç, route et, cache’le; kör premium model kullanma.