TP-913 21.09.2026 YAPAY ZEKA 1 dk okuma

RBS-Attention Yöntemi, Uzun Bağlamlı Büyük Dil Modellerinde İlk Yanıt Süresini 6 Kat Hızlandırıyor

RBS-Attention Yöntemi, Uzun Bağlamlı Büyük Dil Modellerinde İlk Yanıt Süresini 6 Kat Hızlandırıyor

Araştırmacılar, uzun bağlamlı büyük dil modellerinin çıkarımında yüksek hesaplama yükü oluşturan ön doldurma (prefill) maliyetini azaltmak amacıyla "RBS-Attention" adını verdikleri yeni bir seyrek dikkat mimarisi geliştirdi. Eğitim gerektirmeyen bu yöntem, seyrek blok seçimlerinde tek bir ilgili belirtecin ilgisiz veriler arasında kaybolmasına yol açan "ortalama seyreltme" (mean dilution) sorununu ortadan kaldırmayı hedefliyor.

Mimaride ortalama ilişkiyi yakalayan merkez üssü dalının yanı sıra anahtar blok yarıçapını izleyerek riskli blokları tespit eden bir kurtarma dalı yer alıyor. H100 grafik işlemcilerinde 128 bin bağlam boyutundaki Qwen3-30B-A3B-Instruct-2507-FP8 modeliyle yapılan testlerde; tekil ön doldurma dikkatinde 20,65 kat, vLLM üzerinde 11,92 kat ve ilk belirtece ulaşma süresinde 5,97 kat hızlanma kaydedildi.

Yoğun Qwen3-32B modelindeki değerlendirmelerde, tam dikkat mimarisinin yüzde 89,52'lik RULER doğruluk oranına karşılık yüzde 88,65 başarı elde edildi. Yöntemin blok boyutu, eşik değerleri ve bellek kullanımı gibi parametreleri LongBench-v2, InfiniteBench ve Video-MME gibi standart karşılaştırma testleriyle incelendi.

KAYNAK: arxiv.org

← ÖNCEKİ SİNYAL
Chandra Verilerini Tarayan Gökbilimciler, Süpernova Gizemlerini Çözebilecek 84 Aşırı Parlak X-ışını Kaynağı Keşfetti

DİĞER SİNYALLER