AgentTime: Ajanların Çalışma Süresini Tahmin ve Kontrol Yeteneği
AgentTime, yapay zeka ajanlarının çalışma sürelerini tahmin etme ve kontrol etme yeteneklerini test eden yeni bir benchmark'tır. 222 görevden oluşan bu çalışma, ajanların istenen süre boyunca aktif kalma kapasitesini ölçer. Farklı modeller arasında süre sapmalarında belirgin farklılıklar gözlemlenmiştir.
Ne değişti?
Fable 5.1 istenen çalışma sürelerinden ortalama 2.9 kat saparken, GPT-6 Astra yalnızca 1.2 kat sapma göstermiştir.
Zamansal bilgilerin çıkarılması, Sol ve Astra modellerindeki sapma oranlarını iki katından fazla artırmıştır.
Neden önemli?
Ajanların görevi tamamlama yeteneği, kendi zamanlarını kontrol edebildikleri anlamına gelmez. Uzun vadeli otonom çalışmalarda güvenilirlik için süre tahmini ve kontrolü kritik bir eksiklik olarak öne çıkmaktadır.
Geliştirici için ne anlama geliyor?
Uzun süreli otonom ajan projelerinde çalışma süresi tahmini ve kontrolü için yeni bir değerlendirme eşiği ortaya koyar. Geliştiriciler, ajanların istenen süre boyunca aktif kalıp kalmadığını izlemek için ek telemetri ve denetim mekanizmaları tasarlamalıdır. Bu bulgular, ajanların görev tamamlama yeteneğinin zaman yönetimi yeteneğini oturm
Henüz neyi bilmiyoruz?
- Benchmark yalnızca 18 kaynaktan gelen 222 görevi kapsar ve sonuçlar farklı ajan mimarilerine genellenemeyebilir.
- Çalışma, ajanların istenen süreyi doldurduktan sonra gerçekten çalışmaya devam edip etmediğini tam olarak doğrulayamamaktadır.
Asıl kaynağa dön.
01 / BİRİNCİL KAYNAKComputer Science > Artificial Intelligencearxiv.org 02 / RESMÎ DUYURU KAYNAĞIarXiv / cs.AI + cs.CLResmî kaynak sayfasını açBu analiz, bağlantılı birincil kaynak üzerinden yapay zeka desteğiyle hazırlanmıştır. Kaynakta yer alan bulgular, geliştirici etkisi ve sınırlamalar birlikte sunulur. Editoryal görsel blue'og'a özgü soyut bir yorumdur. Ayrıntılar ve en güncel bilgiler için asıl kaynağı inceleyin.