SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking
Paper SAS: A Simple Attention Sparsification That Learns Context Ranking Directly Without DistillationTL;DR — In post-training attention …
20 min
KV Cache
Long Context
Efficient Inference
Attention Optimization
Large Language Models
Transformer
![[Paper Review] Hardware-Efficient Attention for Fast Decoding](https://moonlight-paper-snapshot.s3.ap-northeast-2.amazonaws.com/arxiv/hardware-efficient-attention-for-fast-decoding-1.png)