Yapay Zekâ

LLM Maliyet Optimizasyonu: Token, Cache ve Model Seçimi

Sezer Koçer

1 dk okuma

LLM maliyet optimizasyonu

Özet

FinOps panelleri, prompt sıkıştırma, batch API ve küçük model yönlendirme. Ölçülebilir tasarruf.

FinOps başlangıcı

Token, latency ve model ID loglanmadan optimizasyon yok. Dashboard: günlük spend, peak saat, departman. Anomaly alert.

Model routing

Basit intent classifier ucuz modele yönlendirir. Kritik cevap pahalı model. Fallback zinciri tanımlı.

Prompt sıkıştırma

Gereksiz örnek ve tekrar kaldır. System prompt versiyonla. JSON çıktı şeması kısa tut.

Cache

Semantic cache benzer soruda embedding karşılaştırma. Exact cache system prompt + user hash. TTL politika.

Batch API

Raporlama ve etiketleme gece batch. %50 indirim sınıfları değerlendir. SLA gevşek işler için.

Quantization

Self-host’ta Q4/Q8. Cloud’da provider quantization tier. Kalite regresyon test seti.

Context yönetimi

Rolling summary, retrieval instead of dump. Max token cap hard limit.

Sözleşme

Committed use discount bulut anlaşmasında. Reserved capacity OpenAI/Azure.

Sonuç

LLM maliyeti ürün tasarımı meselesi. Ölç, route et, cache’le; kör premium model kullanma.