VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention
Paper VC-Attention: Value Smoothing and Softmax Casting for the Last Two Bottlenecks in Low-Bit AttentionOne-line summary (TL;DR): A …
18 min
Quantization
FlashAttention
Efficient Inference
Computer Vision
Image Generation
GPU Acceleration