NVIDIA HSTU Üretken Öneri Sistemleri İçin Dynamo-Triton Çıkarım Akışını Duyurdu
NVIDIA, HSTU tabanlı üretken öneri sistemleri için Dynamo-Triton, PyTorch AOTI ve FlexKV entegrasyonunu duyurdu. Bu akış, uzun kullanıcı geçmişlerinde KV önbellekleme ile tekrar hesaplama maliyetini azaltır. 8 katmanlı modelde 5.93x gecikme iyileşmesi raporlanmıştır.
Ne değişti?
Dynamo-Triton, PyTorch AOTI ve FlexKV ile uçtan uca HSTU çıkarım akışı sunarak üretim gecikmesini azaltır.
8 katmanlı HSTU modelinde GPU KV önbellek isabetiyle gecikme, önbelleksiz AOTI yapılandırmasına göre 5.93x daha düşüktür.
Neden önemli?
Üretken öneri sistemleri, kişiselleştirmeyi kullanıcı davranışı üzerindeki dizi modellemesi olarak yeniden formüle eder. Uzun geçmişler ve büyük gömme tabloları, düşük gecikmeli çıkarım için ciddi bir mühendislik zorluğu oluşturur.
Geliştirici için ne anlama geliyor?
PyTorch AOTI ile derlenmiş HSTU modelleri, Dynamo-Triton üzerinden yeniden yazım gerektirmeden üretim ortamına taşınabilir. FlexKV tabanlı KV önbellekleme, uzun kullanıcı geçmişlerinde tekrar hesaplama maliyetini azaltarak gecikme bütçelerini iyileştirir.
Henüz neyi bilmiyoruz?
- Benchmarks tek bir NVIDIA RTX PRO 6000 Blackwell Workstation Edition GPU üzerinde ve KuaiRand-1K veri setiyle sınırlıdır.
- 100% GPU KV-cache hit rate varsayımı, gerçek dünya dağıtık senaryolarındaki önbellek isabet oranlarından farklılık gösterebilir.
Asıl kaynağa dön.
01 / BİRİNCİL KAYNAKDeploying an HSTU Generative Recommender with NVIDIA Dynamo-Tritondeveloper.nvidia.com 02 / RESMÎ DUYURU KAYNAĞINVIDIA Developer AIResmî kaynak sayfasını açBu analiz, bağlantılı birincil kaynak üzerinden yapay zeka desteğiyle hazırlanmıştır. Kaynakta yer alan bulgular, geliştirici etkisi ve sınırlamalar birlikte sunulur. Editoryal görsel Blue'og'a özgü soyut bir yorumdur. Ayrıntılar ve en güncel bilgiler için asıl kaynağı inceleyin.