SQS: Bayesian DNN Compression through Sparse Quantized Sub-distributions
논문 링크 SQS: 가지치기와 양자화를 하나의 베이지안 학습으로 — 스파이크-앤-슬랩과 GMM의 만남TL;DR — 프루닝(pruning)과 저비트 양자화(quantization)를 따로 하면 남는 잉여가 생긴다. SQS는 스파이크-앤-슬랩 사전분포와 …
12분
Machine Learning
Large Language Models
Transformer
Efficient Inference
Model Compression
Quantization