Yapay Zekâ

Claude Opus 5.5’nin Performansını Ölçen Livenerf Benchmark’i Çalışmaya Başladı

2 dk okuma

Benchmark for tracking model capability after release. - ninjahawk/livenerf

Özet

Anthropic’un yeni Claude Opus 5.5 modeli, lansmanından sonra performansının düşüp düşmediğini izlemek için geliştirilen Livenerf benchmark’ı ile test ediliyor. Benchmark, modelin güncel performansını istatistiksel olarak ölçerek “nerf” olaylarını tespit etmeyi hedefliyor.

Claude Opus 5.5, 22 Eylül 2026’da piyasaya sürüldü. Modelin lansmanından sonra zaman içinde performansının düşüp düşmediği konusunda spekülasyonlar yaygın. Livenerf adlı açık kaynak benchmark, bu soruya net cevap arıyor. Livenerf, modelin günlük performansını sabit bir panel üzerinden ölçerek, “nerf” (performans düşüşü) olup olmadığını istatistiksel olarak belirliyor.

Benchmark, UK AI Security Institute’ın Inspect çerçevesi üzerine kurulu. Modelin yanıtlarını sabitlemek için prompt’lar, CLI sürümü ve değerlendirme kriterleri sabit tutuluyor. Böylece yalnızca modelin kendisindeki değişiklikler ölçülebiliyor. Her gün 90 örnek üzerinden 2.336 soruluk panel test ediliyor; panel, “bazı zamanlar doğru, bazen yanlış” sorularla oluşturulmuş.

Livenerf’in çalışma prensibi, ilk 10 günün “day‑0” bazeline göre 10‑günlük pencerelerdeki performansı karşılaştırmak. İlk sonuçlar 20. gün itibarıyla elde ediliyor. Benchmark, doğruluk puanı ve çıktı token sayısı gibi iki ana metrik kullanıyor. Token sayısındaki düşüş, modelin “düşük çaba” (low effort) moduna geçip geçmediğini erken tespit edebilir.

Şu ana kadar 6 gün veri toplandı; tüm günler 90 örnekle çalıştırıldı ve herhangi bir eksik gün olmadı. Opus 5.5, paneldeki soruların %93’ünü ilk denemede doğru yanıtladı. 78 soru “bazı zamanlar doğru” olarak sınıflandırıldı; bu soruların geçerli yanıt oranı %54,7’den %62,0’e yükseldi.

Livenerf, model değişikliklerini tespit etmek için önceden kaydedilmiş bir protokole (v2) bağlı. Protokol, panelin kilitlenmesi, CLI sürümünün sabit tutulması ve doğruluk ile token sayısının istatistiksel analizini içeriyor. Böylece modelin performansındaki küçük değişiklikler bile raporlanabiliyor.

Bu benchmark, model geliştiricileri ve kullanıcıları için şeffaflık sağlayarak, “nerf” olaylarını erken tespit etmeyi amaçlıyor. Livenerf’in sonuçları, modelin lansman haftasından sonraki 30 gün içinde güncellenerek kamuoyuna sunulacak.

Önemli noktalar

  • Claude Opus 5.5 lansmanından sonra performans düşüşü izleniyor.
  • Livenerf benchmark, model performansını istatistiksel olarak ölçüyor.
  • Panel 2.336 sorudan oluşuyor, 90 örnekle test ediliyor.
  • Doğruluk ve token sayısı iki ana metrik olarak kullanılıyor.
  • Benchmark, model değişikliklerini erken tespit etmeyi hedefliyor.