Yazılım

Terminal-Bench 4.0: Eylül 2026'da Codex ve Claude Code Performans, Maliyet ve Kodlama Yeteneği Karşılaştırması

Sezer Koçer

12 dk okuma

Karanlık masada bir monitör, solda mavi kod ağacı ve sağda amber düğüm ağı

Özet

Terminal-Bench 4.0'da Codex ve Claude Code başa baş. Skor marjı, tam koşu maliyeti ve API fiyatı aynı şey değil. Opus 5.5 ayrı bir ölçüm.

Kod tamamlama eklentisi ile terminalde dosya açan, test koşan ve diff üreten ajan aynı iş değildir. Eylül 2026'da bu ikinci türün ölçülerinden biri Terminal-Bench 4.0. Bu yazı OpenAI Codex ile Anthropic Claude Code'u o tablonun yayınladığı satırlara ve iki firmanın kendi fiyat listesine göre okur. Görev başı uydurma dolar, tabloda olmayan model satırı ve "şu dilde kesin kazanır" hükmü yok.

Ajanın ne olduğu, araç döngüsü ve onay kapısı otonom yapay zekâ yazısında duruyor. Burada soru daha dar: terminal işinde skor, maliyet ve seçim nasıl ayrılır?

Ajan sohbet kutusundan nerede ayrılır?

Geliştiriciye şu iş verilsin: API hatasını bul, ilgili dosyaları aç, düzelt, testi çalıştır, diff'i incelemeye sun.

Sohbet kutusu, yapıştırılan parçaya hipotez üretir. Paket ağacını, ortam değişkenini ve derleme çıktısını görmez. Geliştirici kopyalar, dener, hatayı geri yapıştırır.

Terminal ajanı başka bir döngü işletir:

  1. Depo durumuna bakar.
  2. Hata izindeki dosyayı arar.
  3. İlgili dosyayı açar.
  4. Testi kendi çalıştırır.
  5. Hatayı yerinde düzeltir.
  6. Test kırmızıysa kendi çıktısını okuyup yeniden dener.
  7. git diff üretir ve onaya bırakır.

Bu döngü, metin üretmekten ayrı bir yetenektir. Araç çağrısı, kabuk ve çok adımlı yürütme ister. Terminal-Bench bunu ölçer. Tek bir fonksiyon tamamlama seti ölçmez.

Terminal-Bench 4.0 ne ölçer?

Ajan, izole bir Linux kabuğunda, gerçek mühendis işine benzeyen görevi uçtan uca bitirmeye çalışır. Doğrulama betiği geçerse görev çözülmüş sayılır. Kısmi puan yoktur.

4.0 bir bakım sürümüdür. Harbor ve Laude Institute'un barındırdığı sette 3.0'daki 74 görev 66'ya iner. Sekiz görev çıkar, yirmi görev düzeltilir, yeni görev eklenmez. Kaynak zaman aşımı, bellek ve doymuş görev gürültüsünü kesmek içindir. Ajan zaman aşımı düz sekiz saattir. Sınır görevler yazılım, hata ayıklama, sistem ve ortam, dosya araçları, makine öğrenmesi mühendisliği ve güvenlik incelemesine yayılır. Ayrıntı, Eylül 2026'da okuduğum Terminal-Bench 4.0 notunda ve Snorkel'in aynı sürüm özetindedir.

Görev yönergesi
    |
    v
Ajan (Codex veya Claude Code)  <-- model
    | bash, oku, düzenle
    v
İzole konteyner
    | stdout, stderr, çıkış kodu
    v
Doğrulama betiği --> çözüldü veya çözülmedi

Model ile ajanı ayırmak şart. GPT-6 Astra ve Claude Fable 5.1 muhakeme motorudur. Codex ve Claude Code, kabuğu, dosya aracını ve bağlamı yöneten katmandır. Aynı modeli başka bir ajanla koşturmak başka bir satırdır. Tablodaki "effort" da benchmark'ın kendi ayarı değildir. Codex veya Claude Code koşumunun muhakeme düzeyi.

Skor nasıl okunur?

Çözüm oranı, doğrulamayı geçen görevlerin payıdır. Tek koşu şans taşır. Kamu tablosu varyansı bir marjla yazar. Snorkel özeti, maliyet ve token toplamının 66 görevin tamamı için olduğunu, görev başına normalize edilmediğini açıkça söyler. Beş deneme ifadesi Anthropic'in 22 Eylül dipnotunda kamu tablosu için geçer. Ben bu yazıda toplamları görev başına dolara bölmüyorum. Bölmek, deneme sayısını ve önbelleği yanlış varsayarsa sahte bir birim fiyat üretir.

İki satırın marjı örtüşüyorsa, onda üç puanlık fark mühendislik üstünlüğü değildir. O zaman soru gecikme, token, fiyat ve ekibin kendi deposundaki diff kalitesidir.

Kamu tablosu, Eylül 2026

Aşağıdaki satırlar, 27 Eylül 2026'da Snorkel'in Terminal-Bench 4.0 özetinden okuduğum kamu liderlik tablosunun başıdır. Token ve maliyet, tam koşunun toplamıdır.

| Sıra | Model | Effort | Ajan | Çözüm oranı | Tarih | Token | Maliyet | | --- | --- | --- | --- | --- | --- | --- | --- | | 1 | GPT-6 Astra | max | Codex | %58,2 ±2,8 | 3 Eylül 2026 | 1,5 milyar | 3.300 USD | | 2 | Fable 5.1 | max | Claude Code | %57,9 ±3,8 | 1 Eylül 2026 | 2,7 milyar | 6.200 USD | | 3 | Opus 5 | xhigh | Claude Code | %53,9 ±3,2 | 24 Temmuz 2026 | 6,9 milyar | 6.100 USD | | 4 | Fable 5 | max | Claude Code | %44,5 ±3,8 | 9 Haziran 2026 | 3,8 milyar | 7.300 USD | | 7 | GPT-5.6 Sol | max | Codex | %37,3 ±3,8 | 26 Haziran 2026 | 4,4 milyar | 2.500 USD |

Astra'nın aralığı kabaca %55,4 ile %61,0. Fable 5.1'in aralığı kabaca %54,1 ile %61,7. Örtüşürler. 0,3 puan, bu marjın içindedir. Aynı tabloda Astra, daha yüksek skoru daha az token ve daha düşük tam koşu maliyetiyle alır. "Astra daha çok token yakar" cümlesi bu satırla çelişir.

OpenAI'ın kendi Astra duyuru tablosu başka bir sayı yazar: Astra %57,9, Fable 5.1 %55,8, Opus 5 %52,6, Sol %37,3. Anthropic, Astra'nın bu %57,9 satırını high effort olarak anar. Kamu tablosundaki max satır %58,2'dir. İki sayı aynı koşu değildir. Karşılaştırırken hangi tablonun, hangi effort'un okunduğu yazılmazsa kazanan ilan etmek kolaylaşır.

Codex ve GPT-6 Astra

GPT-6 Astra, OpenAI'ın Eylül 2026 modelidir. API kimliği gpt-6-astra. Codex, bu modeli terminalde, IDE'de veya bulut konteynerinde çalıştıran ajandır. Duyuru, uzun oturumda bağlam penceresi dolunca her şeyi tek özete sıkıştırmak yerine not tutmayı ve eski pencereleri aranabilir bırakmayı Codex için anlatır. Bu, sıkıştırma sırasında kaybolan "şu deneme neden düştü" ayrıntısına yönelik bir ürün iddiasıdır. Terminal-Bench satırı bunu tek başına kanıtlamaz.

Astra'nın tabloda öne çıkan yanı, max effort'ta Fable 5.1 ile aynı bantta durup tam koşuyu daha az tokenla bitirmesidir. Sistem yapılandırmasında veya Dockerfile'da "hafif üstün" demek için bu benchmark dil veya görev ailesi kırılımı yayınlamıyor. Onu kendi deposunda ölçmek gerekir.

Yıkıcı komutlarda insan onayı bir ürün özelliği olarak anlatılır. Onay kapısının üretimde gerçekten durduğu, ekibin kendi politika dosyasıyla denenir. Duyuru metni, sizin .env dosyanızın modele gitmediğini garanti etmez.

Claude Code ve Fable 5.1

Fable 5.1, 1 Eylül 2026'da çıkan Anthropic modelidir. Kimlik claude-fable-5-1. Bağlam penceresi 1 milyon token, en fazla çıkış 128 bin tokendir. Fiyat, milyon token başına 10 dolar giriş ve 50 dolar çıkıştır. Önbellek okuma 0,25 dolardır. Anthropic, çoğu iş yükü için Opus çizgisinden başlamayı, Fable 5.1'i zor muhakeme ve uzun ajan işi için tutmayı yazar.

Claude Code, bu modeli terminalde dosya açan, düzenleyen ve kabuk çalıştıran ajandır. Büyük pencerede bile tüm depoyu bağlama doldurmak bağlamı kirletir. İlgili dosyayı arayıp çekmek, 1 milyon token olsa da geçerli bir sınırdır. "200 bin token yetiyor" bu modelin yayınlanan penceresi değil.

Çok dosyalı diff'in daha temiz olduğu iddiası, Terminal-Bench'in tek skorundan çıkmaz. Kendi PR'ınızda değişen satır sayısına bakılır. İzin sorusu (y / n) varsayılan bir güvenlik duruşudur. Oturumluk geniş izin açmak o duruşu kapatır.

Opus 5.5 aynı tablo değil

22 Eylül 2026'da Anthropic, Claude Opus 5.5'i duyurur. Kendi tablosunda Terminal-Bench 4.0 için Opus 5.5, xhigh effort ile %66,4 (±2,6) görünür. Aynı satırda Fable 5.1 %55,8, Astra %57,9'dur. Astra sayısı OpenAI'ın bildirdiği high skor olarak dipnottadır. Kamu tablosundaki beş denemelik Claude Code satırında Opus 5 için %51,8 yazdığını, kendi kurulumlarının bunu %52,3 ile yeniden ürettiğini de söylerler.

Yani %66,4, yukarıdaki kamu max tablosunun bir satırı değildir. Opus 5.5 o özet listede yoktu. Üstelik Opus 5.5, Fable 5.1'den token başına daha ucuzdur: giriş 4 dolar, çıkış 20 dolar, önbellek okuma 0,20 dolar. "Daha pahalı amiral gemisi, resmi olmayan %61 bandı" bu iki kaynakla uyuşmaz. Anthropic ayrıca skor farkının kendi kullanımlarında tablodaki kadar açılmadığını yazar. Vendor tablosu ile kamu tablosu yan yana konmadan Opus 5.5 ilan etmek, Astra ile Fable'ı ilan etmekten daha kolay yanılır.

Günlük maliyet, benchmark faturası değildir

3.300 dolar ve 6.200 dolar, ajanın sıfır bilgiyle 66 görevi koştuğu değerlendirmenin toplamıdır. Pazartesi sabahı tek bir null hatasını düzeltmenin faturası değildir.

Liste fiyatı, Eylül 2026 duyurularından:

| | Giriş / milyon | Çıkış / milyon | Önbellek okuma | | --- | --- | --- | --- | | GPT-6 Astra, standart API | 10 USD | 50 USD | Ayrı tarife, bu yazıda sayı yok | | Claude Fable 5.1 | 10 USD | 50 USD | 0,25 USD | | Claude Opus 5.5 | 4 USD | 20 USD | 0,20 USD |

Astra'nın hızlı kipi, OpenAI'ın yazdığına göre standart hızın yaklaşık iki katı ve standart fiyatın iki katıdır. Fable'da önbellek okuma, taze girişin küçük bir payıdır. Depo değişmedikçe aynı dosyayı yeniden göndermek faturayı şişirir. Yüzde yetmiş gibi tek bir tasarruf oranı bu fiyat listesinden çıkmaz. Kendi önbellek isabetinize bakın.

Üç profil için karar da fiyat tablosundan mekanik çıkmaz.

Birey, günde birkaç küçük işte sabit abonelik kotasını daha kolay sınırlar. Doğrudan API, takılı kalan bir araç döngüsünde kotayı değil bakiyeyi yer.

Beş kişilik ekip, abonelik ile yoğun PR'larda API'yi karıştırabilir. Herkesi max effort'a kilitlemek, skorun örtüştüğü yerde faturayı ayırır.

Kurum, sıfır saklama, denetim kaydı ve ajanın şirket içi git'e hangi ağdan gideceğini ayrıca yazar. Görev başı 0,20 dolar gibi hazır bir ROI sayısı uydurmayın. Kendi faturanızdaki giriş, çıkış ve önbellek satırını mühendis saatiyle kıyaslayın.

Kendi deponuzda tekrarlanabilir deneme

Skorun yerine geçecek tek şey, sizin hatanızdır. Örnek kasıtlı olarak tanıdıktır: Next.js vitrin, ASP.NET Core, PostgreSQL. ERP'de biten ürün sitede satılır. InventorySyncWorker ara ara NullReferenceException veya zaman aşımı yazar.

Protokol sonuç iddia etmez. İki ajanı aynı bilette yan yana koşturup şablonu doldurursunuz.

  1. Bilet metnini ve logu verin.
  2. Ajan InventorySyncWorker ve depo sınıfını kendi bulsun.
  3. Payload'da eksik alanı kendi görsün.
  4. Düzeltme, null denetimi ve gerekirse vitrin teyidi olsun.
  5. Eksik alan için birim test yazsın.
  6. dotnet test kendi eliyle koşsun.
  7. Kırmızı testi testin iddiasını gevşeterek değil, kodu düzelterek kapatsın.
  8. Diff yalnız ilgili satırları değiştirsin.
  9. PR metnini insan okusun.
  10. Push, insanda kalsın.

| Ölçüt | Ne sayılır | | --- | --- | | Bitti mi | Hata yeniden üretilmiyor | | Test | dotnet test kırmızı bırakmadan geçti | | Gürültü | Alakasız dosya, anlamsız import, format yağmuru | | Süre | İlk komuttan onaylanabilir diff'e | | Token ve dolar | Giriş, çıkış, düşünme, önbellek ayrı | | Müdahale | Kaç kez kilitlendi veya yanlış yola saptı |

Bu şablon boş bırakılır. Bu yazı iki ajana .NET veya TypeScript galibi yazmaz. Terminal-Bench o kırılımı bu tabloda vermiyor.

Başka benchmark neden başka kazanan yazar?

Terminal-Bench kabuk, ortam ve doğrulama betiğidir. SWE-bench Verified daha çok gerçek issue ve yama uygular. SWE-bench Pro, sızmayı zorlaştırmak için kapalı ve çok dilli depo kullanır. Derin muhakeme setleri uzun planı ölçer. Biri git apply ile yama ister. Diğeri paket kurmayı, portu ve derleyiciyi konuşturmayı ister. Aynı modelin iki tabloda yeri değişir.

Eğitim setine sızmış görev ve doğrulamayı atlatan çözüm, zamanla skoru şişirir. Terminal-Bench görev verisine kanarya dizesi koyar ve eğitim korpusuna girmemesini ister. Tek tabloya kör bakmak, bu riski silmez.

Güvenlik

Terminale ve git yazmaya ajan vermek, depoya yetkili birini almak gibidir. Tipik kazalar şunlardır.

  • Derleme hatasını chmod 777 veya yanlış dizinde rm -rf ile "çözmek".
  • .env, bulut anahtarı veya bağlantı dizesini bağlama, oradan API sağlayıcısına taşımak.
  • Okunan bir yorumun veya README'nin, ajanın sistem yönergesini ezip komut çalıştırması. Dolaylı istem enjeksiyonu budur.
  • Olmayan bir paket adı önermek. Saldırgan o adı paket yöneticisine zararlı olarak koyabilir.
  • Kodu düzeltmek yerine testi gevşetmek veya yoruma almak.

Savunma dört kapıdır. Ajan, geliştiricinin günlük işletim sisteminde değil, konteyner veya ayrı bir geliştirme ortamında durur. Oturumda sudo yoktur. ~/.ssh ve bulut kimlik dizini kapalıdır. Testin geçmesi üretime çıkış değildir. İnsan onayı ve mevcut güvenlik taraması durur. Ağ çıkışı, gereken paket kaynaklarıyla sınırlanır.

Hangi işte neye bakılır?

Tek kazanan ilan etmek, örtüşen marjı yok saymaktır. İşe göre soru değişir.

  • Çok dosyalı TypeScript veya Next.js değişikliğinde diff gürültüsü ve önbellek isabeti.
  • Çok projeli bir .NET solution'da dotnet build çıktısını okuyup ilgili projeyi düzeltmesi.
  • Veri kaybı riski olan SQL geçişinde onay kapısının gerçekten durması.
  • Eski kodu taşırken açıklamanın okunabilir kalması.
  • Kabuk, Actions ve Docker katmanında gereksiz komut yağmuru.

Bunlar hipotezdir. Yukarıdaki şablon dolmadan "Codex .NET'te, Claude Code ön yüzde kazanır" cümlesi bu benchmark'tan çıkmaz.

Yüzde 58 neyi bitirmez?

%58,2 çözüm oranı, kabaca her on görevden dördünün bu sette çözülmediği anlamına gelir. "Yazılımcı kalmayacak" bu sayıdan çıkmaz. Çıkan şey başkadır. Değer, döngü yazma hızından çok sınır, veri akışı ve onay tasarımına kayar. Tek ajan her işi bitirmez. Plan, yazım, güvenlik taraması ve test ayrı döngülere bölünebilir. Uzun iş, sabah PR olarak gelebilir. O PR'ı okumayan ekip, ajanı değil kendi denetimini kapatmıştır.

Sıkça Sorulan Sorular

  1. Terminal-Bench 4.0 nedir?

    Ajanın izole bir terminalde yazılım, hata ayıklama ve sistem işini doğrulama betiği geçene kadar bitirip bitiremediğini ölçen settir. 4.0, 66 görevlik bakım sürümüdür.

  2. Puan nasıl hesaplanır?

    Çözüm oranı, insan müdahalesi olmadan doğrulamayı geçen görevlerin payıdır. Kamu tablosu bunu bir varyans marjıyla yazar. Token ve dolar, o özette görev başına değil tam koşu toplamıdır.

  3. Codex ile Claude Code farkı nedir?

    Codex, GPT-6 Astra gibi bir modeli çalıştıran OpenAI ajanıdır. Claude Code, Fable 5.1 veya Opus 5.5 gibi bir Claude modelini terminal döngüsüne bağlayan Anthropic ajanıdır. İkisi de modelin kendisi değildir.

  4. GPT-6 Astra nedir?

    OpenAI'ın Eylül 2026 modelidir. API'de standart fiyat, milyon token başına 10 dolar giriş ve 50 dolar çıkıştır. Terminal-Bench'teki kamu max satırı %58,2 ±2,8'dir.

  5. Claude Fable 5.1 nedir?

    1 Eylül 2026 modelidir. Zor muhakeme ve uzun ajan işi için konumlanır. Liste fiyatı 10 ve 50 dolardır. Kamu max satırı %57,9 ±3,8'dir.

  6. Opus 5.5, Fable 5.1 ile aynı ölçüm mü?

    Hayır. 22 Eylül duyurusunda Anthropic kendi kurulumunda %66,4 yazar. Bu, kamu max tablosundaki Fable satırıyla aynı koşu değildir. Token fiyatı daha düşüktür: 4 ve 20 dolar.

  7. Ajan tek başına güvenilir midir?

    Hayır. Testi geçirmek için testi bozabilir veya geniş komut çalıştırabilir. Konteyner, dar yetki ve insan incelemesi durur.

  8. .NET projesinde çalışır mı?

    İkisi de dotnet build ve dotnet test çağırabilir. Hangi ajanın sizin solution'da daha az gürültü çıkardığı, boş şablonla ölçülür. Bu yazı galip ilan etmez.

  9. Ücretli mi?

    Evet. API'de giriş, çıkış ve önbellek ayrıdır. Abonelik kotası ayrı bir bütçe modelidir. Benchmark'ın 3.300 doları, sizin bir hatanızın fiyatı değildir.

  10. Yüksek skor gerçek projede kesin başarı mıdır?

    Hayır. Setin görevi sınırlı ve doğrulaması nettir. Şirket içi eski sistem ve belirsiz ürün kuralı bu setten geniştir.

    Skor, iki ajanın bu 66 görevde aynı bantta olduğunu söyler. Fatura, tam koşuda Astra'nın daha az token yaktığını söyler. Günlük iş, ikisini de söylemez. Onu ancak kendi deponuzdaki diff, test ve API satırı söyler.