RLVR'de Keşif ve Optimizasyonun Ayrılması: ExpDis Çerçevesi
RLVR'de yenilik teşvikleri model kalitesini düşürebilir. ExpDis, keşif ve optimizasyonu ayırarak bu sorunu çözer. Keşif politikaları, yenilik bonusu ile eğitilir ve doğru yörüngeler öğrenci politikasına damıtılır. Bu yaklaşım, agresif keşif ölçeklemesini model bozulması olmadan sağlar.
Ne değişti?
ExpDis, keşif politikalarını öğrenci politikasına damıtma yoluyla RLVR'de keşfi optimizasyondan ayırır.
Yöntem, yedi matematiksel akıl yürütme benchmark'ında DAPO'yu aynı bütçede geride bırakır.
Neden önemli?
RLVR'nin ana vaadi olan yeni akıl yürütme stratejilerinin keşfi, geleneksel yöntemlerde model kalitesini düşürür. ExpDis, bu çelişkiyi çözerek daha güvenli ve etkili bir eğitim süreci sunar. Bu, LLM'lerin otonom keşif yeteneklerini artırabilir.
Geliştirici için ne anlama geliyor?
RLVR eğitimi yapan ekipler, keşif ve optimizasyonu ayırarak model kalitesini koruyabilir. ExpDis, aynı duvar saati bütçesinde DAPO'ya göre daha iyi sonuçlar sunar ve pass@$k$ ölçeklenmesini iyileştirir. Bu, daha çeşitli doğru çözümler üreten modeller için pratik bir yol haritasıdır.
Henüz neyi bilmiyoruz?
- Sonuçlar yalnızca matematiksel akıl yürütme ve iki model ailesiyle sınırlıdır.
- Yeni fikirlerin önceden eğitim verisinde bulunmaması pratikte sınırlı başarı göstermiştir.
Asıl kaynağa dön.
01 / BİRİNCİL KAYNAKComputer Science > Machine Learningarxiv.org 02 / RESMÎ DUYURU KAYNAĞIarXiv / cs.AI + cs.CLResmî kaynak sayfasını açBu analiz, bağlantılı birincil kaynak üzerinden yapay zeka desteğiyle hazırlanmıştır. Kaynakta yer alan bulgular, geliştirici etkisi ve sınırlamalar birlikte sunulur. Editoryal görsel blue'og'a özgü soyut bir yorumdur. Ayrıntılar ve en güncel bilgiler için asıl kaynağı inceleyin.