EngramEdit: LLM'lerde Koşullu Bellek ile Bağımsız Bilgi Güncellemesi
EngramEdit, DeepSeek Engram tabanlı koşullu bellek mimarilerini kullanarak LLM'lerdeki faktüel bilgi güncellemelerini genel hesaplama süreçlerinden ayırır. Yöntem, paylaşılan n-gram gömme vektörlerini hedef temsillere göre güncellerken sık kullanılan gömme vektörlerine daha ağır ceza uygulayarak ilgili olmayan bilgilerin bozulmasını engeller. Bu yaklaşım, gü
Ne değişti?
Yöntem, zincirleme düşünme (CoT) ile en güçlü baz çizgisine göre neredeyse üç kat daha yüksek doğruluk elde eder.
Faktüel güncellemeler biriktikçe ilgili olmayan bilgi ve genel yetenekler büyük ölçüde korunur.
Neden önemli?
Farklı ifadeler aynı bilgiyi farklı n-gram gömme vektörlerini aktive edebilir; paylaşılan gömme vektörlerinin güncellenmesi diğer bilgilerin tahminlerini istemsizce değiştirebilir. EngramEdit, bu çapraz etkiyi cezalandırma terimiyle kontrol ederek bilgi depolamasını hesaplama omr
Geliştirici için ne anlama geliyor?
Geliştiriciler, Transformer omurgasını dondurarak yalnızca koşullu bellek katmanını güncelleyebilir. Bu, çoklu ifade tutarlılığı ve çok adımlı akıl yürütme gerektiren dinamik bilgi senaryolarında yeniden eğitim maliyetini azaltabilir. Ancak yöntemin büyük ölçekli üretim modellerindeki genel yetenek kaybı sınırları henüz tam olarak belirs.
Henüz neyi bilmiyoruz?
- Yöntemin çok büyük ölçekli üretim modellerindeki uzun vadeli genel yetenek etkileri kaynakta detaylandırılmamıştır.
- Koşullu bellek mimarisine sahip olmayan standart Transformer modellerine doğrudan uygulanabilirliği belirtilmemiştir.
Asıl kaynağa dön.
01 / BİRİNCİL KAYNAKComputer Science > Computation and Languagearxiv.org 02 / RESMÎ DUYURU KAYNAĞIarXiv / cs.AI + cs.CLResmî kaynak sayfasını açBu analiz, bağlantılı birincil kaynak üzerinden yapay zeka desteğiyle hazırlanmıştır. Kaynakta yer alan bulgular, geliştirici etkisi ve sınırlamalar birlikte sunulur. Editoryal görsel blue'og'a özgü soyut bir yorumdur. Ayrıntılar ve en güncel bilgiler için asıl kaynağı inceleyin.