Yapay Zekâ

Amazon SageMaker AI ile Çok Adımlı Pekiştirmeli Öğrenme Kullanılarak Arama Ajanı İnceltiliyor

2 dk okuma

Amazon SageMaker AI ile Çok Adımlı Pekiştirmeli Öğrenme Kullanılarak Arama Ajanı İnceltiliyor

Özet

Amazon SageMaker AI, büyük dil modellerini çok adımlı pekiştirmeli öğrenme (MTRL) yöntemiyle ince ayar yaparak, daha hızlı ve maliyet etkin arama ajanları oluşturmayı mümkün kılıyor.

Amazon SageMaker AI, büyük dil modellerini (LLM) çok adımlı pekiştirmeli öğrenme (MTRL) yöntemiyle ince ayar yapma olanağı sunuyor. Geleneksel ince ayar yaklaşımları ya uzman gösterimlerine dayalı denetimli öğrenme (SFT) ya da tek adımlı pekiştirmeli öğrenme (RLVR) kullanıyor; ancak bu yöntemler çok adımlı arama senaryolarında karar bağımlılıklarını yakalamakta yetersiz kalıyor. MTRL, bir ajanın tüm diyalog sürecini bir bütün olarak değerlendirerek, yalnızca sonucun kalitesine göre ödül veriyor. Bu sayede ajan, birden fazla sorgu ve sonuç döngüsünü optimize edebiliyor.

Yazıda, Qwen3.6‑27B modelinin SageMaker AI MTRL ile nasıl ince ayarlandığı anlatılıyor. Ajan, iki temel arama aracını (BM25 leksikal arama ve vektör tabanlı semantik arama) kullanarak soruları yanıtlıyor. Eğitim sürecinde, nDCG@10 metriği doğrudan ödül fonksiyonu olarak kullanılıyor; bu metrik, ilk 10 sonuçtaki ilgili belgelerin sıralamasını ölçerek arama kalitesini yansıtıyor. Ajanın maksimum tur sayısını aşması ya da tek bir turda token sınırını geçmesi durumunda -1 ödül vererek istenmeyen davranışların önüne geçiliyor.

SageMaker AI MTRL’in sunduğu teknik avantajlar arasında düşük kodlu ajan‑ortam arayüzü, sunucusuz çalıştırma (per‑token fiyatlandırma), asenkron rollout ve gradient güncellemeleri, PPO, CISPO ve IS gibi politika gradyanı algoritmalarının yer alması bulunuyor. Eğitim verileri, HuggingFace ve GitHub gibi kaynaklardan derlenen çoklu hop, çok dilli ve kurumsal RAG veri setlerini içeriyor; her veri seti %5 oranında doğrulama amaçlı ayrılıyor. Eğitim sırasında MLflow entegrasyonu sayesinde her tur ve adım izlenebiliyor, ayrıca değerlendirme işleriyle pass@k ve ödül metrikleri önceden test edilebiliyor.

Sonuç olarak, ince ayar yapılan küçük model, büyük modellerin sağladığı doğruluk seviyesini korurken yanıt süresi ve işlem maliyetinde belirgin bir düşüş sağladı. Bu yaklaşım, kurumsal arama sistemlerinde yüksek performanslı, maliyet etkin ve özelleştirilebilir ajanlar geliştirmek isteyen kuruluşlar için güçlü bir seçenek sunuyor.

Önemli noktalar

  • MTRL, bir arama ajanının tüm diyalog sürecini ödüllendirerek çok adımlı kararlarını optimize eder.
  • Küçük bir model, özel araç ve ortam bilgisiyle eğitildiğinde, büyük modellerin sunduğu doğruluk ve hızı maliyet açısından daha avantajlı bir şekilde sunar.
  • SageMaker AI, PPO, CISPO ve IS gibi politika gradyanı algoritmalarını, asenkron veri toplama ve yeniden başlatılabilir eğitim özellikleriyle destekler.