Same Request, Different Answer: Quantization Amplifies Cache-Induced Divergence in LLM Serving
논문 링크 같은 요청, 다른 답: 프리픽스 캐시가 서빙을 비재현적으로 만들고, 양자화가 이를 증폭시킨다 TL;DR — 프리픽스 캐시는 “투명한 최적화"로 여겨지지만 투명하지 않다. 캐시를 끄면 동일 워크로드의 반복 실행이 10개 설 …
17분
Prefix Caching
Software Engineering
![[논문리뷰] Marconi: Prefix Caching for the Era of Hybrid LLMs](https://pbs.twimg.com/media/GdyLXO9W4AADox0.jpg)