논문 링크

SlimKV: 토큰과 피처를 함께 압축하고, 복원 없는 잠재 공간 어텐션으로 KV 캐시를 32배까지 줄이다

TL;DR

SlimKV는 긴 문맥(long-context) LLM 추론의 병목인 KV 캐시를 토큰 축(token-wise)과 피처 축(feature-wise)에서 동시에 압축하는 질문-독립적(question-agnostic) 프레임워크다. 핵심은 비컨(beacon) 메모리 토큰의 Key에만 RoPE를 제거해, 복원(reconstruction) 단계 없이 잠재 공간에서 바로 어텐션을 수행한다는 점이다. LongBench에서 16×/32× 압축 시 최고 성능을 기록했고(근거: §5.2), 128K 토큰 길이에서 무압축 대비 최대 7.34배 어텐션 가속·3.38배 end-to-end 디코딩 가속을 달성했다(근거: §5.4).

핵심 아이디어

이 논문의 중심 주장은 다음과 같이 한 문장으로 요약할 수 있다.

저자들은 비컨 상태를 처음부터 저랭크(low-rank) 형태로 학습시키고, 비컨 Key에서만 RoPE를 제거함으로써, 토큰·피처 단일 축 압축의 한계와 Key 재구성(reconstruction) 지연 병목을 동시에 극복하는 16~32배 KV 캐시 압축을 달성할 수 있다고 가정한다.

세 갈래의 기여가 이 주장을 떠받친다(근거: §1).

  1. 토큰·피처 결합 압축 프레임워크 — 고정된 피처 예산 안에서 저랭크 비컨 KV 표현을 학습하고, 레이어별 이질성에 맞춰 적응적 랭크(rank)를 할당한다.
  2. 위치 비대칭성(positional asymmetry) 발견 — Key 쪽 RoPE(K-RoPE) 제거가 일반 토큰과 비컨 토큰에 미치는 손상이 다르며, 비컨이 훨씬 둔감하다는 사실을 실증했다.
  3. 복원 없는 잠재 공간 어텐션(LSA) — 이 비대칭성을 이용해 비컨 Key에서만 RoPE를 제거함으로써 디코딩 시 전체 차원으로의 복원을 생략한다.

핵심 숫자 한눈에 보기

항목값
백본 모델Llama-3.1-8B-Instruct / Qwen2.5-14B-Instruct / Qwen3-30B-A3B-Instruct(MoE)
압축 방식토큰 × 피처 결합 (예: t4f4 = 4× 토큰 · 4× 피처 = 16×)
LongBench 무압축 평균49.50 (Llama-8B) / 51.52 (Qwen-14B) / 50.30 (Qwen3-MoE)
16× 압축 평균 (SlimKV-f4)46.36 (Llama-8B) / 46.23 (Qwen-14B)
저압축(4×/8×) 성능 유지무압축 대비 96% 이상
최대 어텐션 가속 (128K, 16×)7.34배
최대 E2E 가속 (128K, 16×)3.38배
학습 가능 파라미터621M (Llama-8B) / 1.41B (Qwen-14B) / 434M (Qwen3-MoE, 전체의 1.45%)

배경: 그들이 해결한 문제

LLM은 문서 이해, 멀티턴 대화, 복잡한 추론에 긴 문맥이 필수적이지만, 추론 중 KV 캐시가 문맥 길이에 비례해 폭증하면서 메모리 압박과 메모리 접근 지연을 일으킨다(근거: §1). KV 캐시 크기는 대략

$$ \text{KV-Cache(GB)} \approx \frac{2 \cdot L \cdot H \cdot d_{\text{head}} \cdot \text{seq} \cdot \text{batch} \cdot \text{bytes/elt}}{10^9} $$

로 표현된다. 여기서 $L$ 은 레이어 수, $H$ 는 KV 헤드 수, $d_{\text{head}}$ 는 헤드당 차원, seq 는 시퀀스 길이, batch 는 배치 크기다. 문맥이 길어질수록 이 항이 메모리·대역폭의 주범이 된다.

기존 압축 전략은 크게 두 축으로 나뉘는데, 각각 한계가 뚜렷하다(근거: §2).

  • 토큰 축(token-wise): 캐시 상태의 개수를 줄인다. 그런데 명시적 삭제(eviction)는 공격적 압축에서 정보 손실이 크고(KVZip), 대부분의 eviction 방식은 삭제 전에 전체 KV를 먼저 만들어야 해 prefill 연산 절감이 제한적이다(SnapKV, H2O). 소프트 압축(Activation Beacon)은 정보 손실은 완화하지만 비컨 상태의 중복성을 더 탐구하지 않았다.
  • 피처 축(feature-wise): 토큰당 KV 차원을 줄인다(MQA, GQA, MLA, Eigen Attention, PALU, MHA2MLA). 그러나 압축된 Key는 RoPE 적용 전에 전체 차원으로 복원해야 하는 경우가 많아 디코딩 지연 병목이 남는다.

저자들이 던지는 중심 질문은 이것이다(근거: §1).

“토큰·피처 결합 압축이 단일 축의 한계를 넘으면서도, 복원 병목까지 피할 수 있는가?”

새로운 접근법: SlimKV

SlimKV는 Activation Beacon류의 점진적 토큰 압축 파이프라인 위에 피처 축 압축을 결합한 프레임워크다(근거: §3.1). 동작 흐름은 다음과 같다.

  1. 입력을 고정 간격으로 청크(chunk)로 나누고, 각 청크 사이에 비컨 토큰을 삽입한다.
  2. 각 청크가 이전 비컨 메모리들에 어텐션하여 비컨 상태가 문맥 정보를 흡수하도록 한다.
  3. 청크별 prefill이 끝나면 원본(raw) 토큰의 KV는 버리고 압축된 비컨 메모리만 캐시한다.

여기서 SlimKV의 차별점은 두 가지다.

(1) 저랭크 비컨 학습 (Low-Rank Beacon Training) — 사후 SVD 분해(post-hoc) 대신, 비컨 KV 투영을 처음부터 목표 저랭크 형태로 학습한다(근거: §3.2). 백본은 동결하고 비컨 분기만 업데이트한다. 비컨 은닉 상태 $h_b^{(l)}$ (레이어 $l$)는

$$ C_K^{(l)} = h_b^{(l)} W_{K,\downarrow}^{(l)},\qquad C_V^{(l)} = h_b^{(l)} W_{V,\downarrow}^{(l)} $$

로 원본 KV 차원 $D$ 보다 작은 잠재 상태 $C_K^{(l)}, C_V^{(l)}$ 로 투영되고, 전체 차원 형태는 $K_b^{(l)} = C_K^{(l)} U_K^{(l)\top}$, $V_b^{(l)} = C_V^{(l)} U_V^{(l)\top}$ 로 복원된다. 추론 시에는 잠재 상태 $C_K, C_V$ 만 캐시에 저장한다.

(2) 레이어 적응 랭크 할당 (Layer-Adaptive Rank Allocation) — 트랜스포머 투영 행렬의 저랭크 구조는 레이어마다 다르다. 학습 전에는 비컨 투영을 알 수 없으므로, 저자들은 사전학습된 원본 KV 투영 가중치를 프록시로 쓴다(근거: §3.3). 둘의 레이어별 랭크 패턴은 Spearman 상관 약 0.99 이상, 레이어별 랭크 오차는 2 이내로 거의 일치한다(근거: Appx.A, Tab.SVD).

구체적으로, 원본 KV 투영의 특잇값 $\sigma_{l,1} \ge \cdots \ge \sigma_{l,D}$ 에 대해 누적 스펙트럼 에너지

$$ E_l(r) = \frac{\sum_{j=1}^{r} \sigma_{l,j}^{2}}{\sum_{j=1}^{D} \sigma_{l,j}^{2}} $$

를 정의하고, 에너지 임계 $\rho$ 로 초기 랭크 $r_l^{0} = \min\{ r \mid E_l(r) \ge \rho \}$ 를 잡는다. 여기에 “바닥(floor)” $r_{\min} = \lceil \lambda \bar r \rceil$ 을 두어 랭크가 지나치게 작은 레이어가 학습 병목이 되는 것을 막고, 전체 예산 $B = LD/k$ 를 만족하는 최대 $\rho$ 를 택한다. 이 논문에서는 $\lambda = 0.5$ 를 사용한다(근거: §5.1).

작동 원리: 구체적인 예시로 살펴보기

압축부터 가속까지, 작은 예시로 전체 흐름을 따라가 보자. 이해를 돕기 위해 다음 세팅을 가정한다(근거: §4.4, Appx.C).

  • KV 헤드 $H_{kv}=8$, 쿼리 헤드 $H_q=32$, GQA 그룹 $g = H_q/H_{kv} = 4$
  • 헤드당 차원 $d=128$, 전체 KV 차원 $D = H_{kv} \cdot d = 1024$
  • 피처 압축비 $k=4$ → 잠재 KV 차원 $D/k = 256$

1단계 — 토큰 압축. 16K 토큰의 문서를 4토큰마다 비컨 1개로 요약하면 비컨은 4K개가 된다(4× 토큰 압축).

2단계 — 피처 압축. 각 비컨의 K/V를 $D=1024$ 차원에서 $256$ 차원 잠재 공간으로 투영한다(4× 피처 압축). 둘을 곱하면 16배 압축이고, 캐시에는 $C_K, C_V \in \mathbb{R}^{4000 \times 256}$ 만 남는다.

3단계 — 복원 없는 어텐션. 이제 디코딩 단계에서 새 토큰 하나에 대한 어텐션을 계산한다고 하자. 비컨 Key에 RoPE가 남아 있으면 RoPE가 위치 의존적이어서 잠재 공간으로 미리 흡수할 수 없고, 먼저 $K_b = C_K U_K^\top$ 로 전체 차원 복원 후 RoPE를 적용해야 한다.

$$ Q' \operatorname{RoPE}(K_b)^\top = Q' \operatorname{RoPE}(C_K U_K^\top)^\top $$

반면 SlimKV는 비컨 Key의 RoPE를 제거했으므로, 행렬 결합 법칙을 이용해 잠재 공간에서 직접 스코어를 계산한다(근거: §4.3).

$$ Q' K_b^\top = Q'(C_K U_K^\top)^\top = (Q' U_K) C_K^\top $$

Value 경로도 동일하게 $A V_b = A (C_V U_V^\top) = (A C_V) U_V^\top$ 로 처리한다. 즉, “복원 → 어텐션"의 2단계가 “쿼리 투영 → 잠재 어텐션"의 1단계로 바뀐다.

비용이 얼마나 달라질까? 한 디코딩 스텝의 지배적 FLOPs를 비교하면(근거: §4.4, Appx.C)

$$ F_{\text{recon}} \approx N_b \frac{2D^2}{k} + (1+2g) N_b D $$$$ F_{\text{SlimKV}} \approx \frac{2gD^2}{k} + \frac{2H_q}{k} N_b D $$

여기서 $N_b$ 는 캐시된 비컨 토큰 수다. 복원 방식은 $N_b$ 에 비례하는 $\mathcal{O}(N_b D^2/k)$ 의 전체 차원 복원 비용이 붙지만, SlimKV는 그 항이 현재 스텝의 쿼리·출력 투영에만 걸리는 $\mathcal{O}(gD^2/k)$ 로 바뀌어 $N_b$ 와 무관하다. 위 세팅을 대입하면

$$ F_{\text{recon}} \approx \tfrac{1}{2}N_b D^2 + 9 N_b D \approx 521 N_b D,\qquad F_{\text{SlimKV}} \approx 2D^2 + 16 N_b D \approx 16 N_b D $$

로, 긴 문맥($N_b \gg 128$)에서 이론적 산술 연산은 약 32.6배 줄어든다. 물론 이는 산술 비용만 본 것이고 커널 오버헤드·메모리 대역폭은 제외된 값이라, 실제 측정 속도 향상은 아래처럼 더 보수적이다(근거: Appx.C).

성능 검증: 주요 결과

LongBench — 압축이 클수록 더 유리하다

16×/32× 고압축 환경에서 SlimKV는 두 백본 모두에서 최고 평균 점수를 기록했다(근거: §5.2, Tab.1). 대표적으로 SlimKV-f4(t4f4, 4× 토큰·4× 피처)는 16× 압축에서 Llama-3.1-8B 46.36, Qwen2.5-14B 46.23 으로, SnapKV·Activation Beacon·PALU·KVZip을 모두 앞선다. 32× 압축(t8f4)에서도 각각 44.75 / 45.09 로 최고치다.

피처 압축비 2×/4×/8×를 비교하면 4×가 대부분의 고압축 세팅에서 최고 평균을 내는 황금 지점이었다. 피처 압축이 너무 약하면 토큰 압축이 과도해지고, 너무 강하면 잠재 용량이 부족해지는 트레이드오프 때문이다(근거: §5.2).

무압축과의 격차를 Activation Beacon과 비교하면 SlimKV-f4가 격차를 18.5%~28.2% 줄인다(근거: Tab.2). 저압축(4×/8×)에서는 2× 피처 압축(SlimKV-f2)을 써서 무압축 점수의 96% 이상을 유지하며, Qwen2.5-14B 8×에서 49.94(무압축 51.52)로 KVZip·PALU를 크게 앞선다(근거: Tab.3).

질문-독립 vs 질문-인지: 멀티턴에서 드러나는 강점

SnapKV 같은 질문-인지(question-aware) 방식은 질문을 미리 알아야 유리하다. SlimKV는 질문-독립적이어서 하나의 압축 컨텍스트를 여러 질문에 재사용하는 시나리오에서 빛을 발한다(근거: §5.2). QMSum 멀티리퀘스트 실험에서 무압축 ROUGE-L F1 25.17 대비, 16× 압축 시 SnapKV는 10.39 로 급락하지만 SlimKV-f4는 24.47 로 무압축의 97.2% 를 유지했다.

Needle-in-a-Haystack — K-RoPE를 지웠는데도 위치 견고성이 유지된다

비컨 Key에서 RoPE를 제거하면 위치 정보 손실이 우려된다. NIAH 결과는 이 우려를 잠재운다(근거: §5.2, Fig.7). SlimKV-f4는 니들 깊이(depth)에 걸쳐 안정적인 검색 성능을 보였고, 심지어 Qwen2.5-14B의 컨텍스트 윈도(32K) 너머에 정답이 있어도 성능을 유지했다. 이는 긴 문맥을 소수의 비컨 토큰으로 압축해 캐시를 사용 가능 범위 안에 두고, K-RoPE가 없어도 RoPE-aware prefill에서 흡수한 위치 단서가 유효하게 남기 때문이다.

효율성 — 복원을 없앤 것의 실질적 이득

Llama-3.1-8B 단일 A100 80GB, BF16, 배치 1 기준의 단일 스텝 어텐션 및 end-to-end 지연을 측정했다(근거: §5.4, Tab.5). 복원 기반 변형(Recon, 비컨 K-RoPE 유지·전체 차원 재구성)과 비교해 SlimKV의 속도 향상은 문맥이 길어질수록 벌어진다.

압축지표32K64K96K128K
16×어텐션 가속1.94×3.81×5.08×7.34×
16×E2E 가속1.22×2.04×2.63×3.38×
32×어텐션 가속1.62×2.54×4.36×6.09×
32×E2E 가속1.23×1.75×2.82×3.49×

또한 무압축 모델이 OOM 없이 돌 수 있는 최대 길이 11.5K에서, SlimKV는 TTFT를 1.03~1.37배 개선하고 피크 메모리를 2.71~2.82배 줄였다(근거: §5.4). 흥미롭게도 Recon과 SlimKV의 피크 메모리는 거의 같다. 복원 제거는 저장 크기가 아니라 계산 흐름을 바꾸기 때문이다(근거: Appx.F).

확장성 — 30B MoE로도 잘 옮겨간다

Qwen3-30B-A3B-Instruct(MoE)에서 SlimKV-f4는 16×에서 46.08, 32×에서 45.60(무압축 50.30)으로 경쟁력 있는 성능을 유지했다(근거: §5.3, Tab.4). 이때 학습 가능 파라미터는 434M으로 전체 모델의 1.45% 에 불과해, 파라미터 효율적 확장 가능성을 보여준다.

어블레이션 — ‘복원 없음’이 공짜가 아니라는 사실

32× 압축 어블레이션(근거: §5.5, Tab.6)이 특히 의미심장하다. 비컨 K-RoPE를 그냥 제거하면 성능이 43.67 → 41.28로 떨어진다. RoPE 제거만으로는 부족하고, 저랭크 형태로 직접 학습하고(41.95 → 44.38), 레이어 적응 랭크 할당까지 더해야(44.75) Activation Beacon을 넘는다는 것이다.

우리의 관점: 강점, 한계, 그리고 이 연구가 중요한 이유

강점. 이 연구의 가장 값진 기여는 문제를 “정확도 vs 효율성"의 단일 축이 아니라 압축의 두 축 × 복원 병목이라는 구조로 다시 그려냈다는 점이다. 특히 (1) 비컨 K-RoPE 비대칭성이라는 실증적 발견과 (2) 이를 복원 제거로 연결해낸 논리적 전개는 깔끔하다. 어텐션 히트맵 유사도 지표에서도 비컨 K-RoPE 제거는 원본 패턴과의 Pearson 상관 0.9707 로, 원본 토큰 제거의 0.7570 보다 훨씬 가깝다(근거: §4.2, Tab.5). 비용 분석이 이론(32.6×)과 실측(최대 7.34×)을 솔직하게 분리한 점도 신뢰를 준다.

한계. 저자 스스로도 두 가지를 인정한다(근거: §Limitations). 첫째, 검증이 RoPE 기반 LLM에 국한된다. 둘째, 텍스트 전용이며 멀티모달/교차 모달 KV 캐시로의 확장은 미검증이다. 독자의 관점에서 덧붙이면, (a) 학습이 필요하다는 점은 PALU·KVZip 같은 training-free 방식에 비해 채택 장벽이고(단, 학습 파라미터는 소수), (b) 비컨 Key의 RoPE를 지운 만큼 순서 민감 과제(특히 코드·포맷 의존 과제)에서 백본별 편차가 크게 나타났다(근거: Appx.G). (c) NIAH 판정이 GPT-5.4-mini 자동 채점에 의존한다는 점도 실측 견고성의 상한을 정한다.

이 연구가 중요한 이유. 긴 문맥 서빙에서 KV 캐시는 이미 메모리·대역폭의 주 병목이고, 지금까지 압축 기법들은 “정확도를 얼마나 지키는가"와 “실제로 빨라지는가"를 동시에 잡는 데 실패해 왔다. SlimKV는 두 질문에 한꺼번에 답하는 설계 원칙 — 비컨은 위치를 RoPE로 표현할 필요가 없다 — 을 제시했고, 이것이 향후 저랭크 KV 설계의 기본 참조점이 될 가능성이 높다.

다음 단계는?: 앞으로의 길

저자들이 직접 제시한 방향은 두 가지다(근거: §Limitations). 하나는 RoPE 이외의 위치 인코딩(예: ALiBi, YaRN, 학습형 위치)으로의 일반화 검증이다. 논문은 ALiBi가 $S = Q K_b^\top + B = (Q U_K) C_K^\top + B$ 로 대수적으로 호환됨을 이론적으로 보여주었으므로(근거: Appx.J), 실증 검증이 자연스러운 다음 스텝이다. 다른 하나는 시각·교차 모달 KV 캐시로의 확장이다.

여기에 더해 합리적으로 기대되는 후속 작업을 정리하면 다음과 같다.

  • 순서 민감 과제 보완: 비컨 Key의 위치 정보 손실을 상쇄하는 미세한 위치 단서 주입(예: ALiBi 형태의 경량 편향)이 코드·포맷 과제의 백본별 편차를 줄일 수 있다.
  • MLA와의 정량 비교: 부록에서 개념적 비교는 있지만(근거: Appx.I), 동일 백본·동일 압축비에서 MLA 스타일 저랭크 설계와의 정면 비교가 여전히 부족하다.
  • 시스템 수준 최적화: 잠재 공간 어텐션을 위한 커널 구현이 실측 속도(7.34×)와 이론 속도(32.6×)의 격차를 좁힐 수 있는 핵심 레버다.
  • 훈련 비용 절감: 현재 백본별로 수 시간~수십 시간의 학습이 필요한데, 더 적은 코퍼스로 수렴시키는 초기화·정규화 연구가 배포 장벽을 낮출 것이다.

SlimKV는 “압축은 곧 손실"이라는 통념을 “어디를 압축하느냐가 손실을 결정한다"로 바꿔놓은, 실용성과 통찰을 함께 갖춘 연구다.

논문 원문의 표

arXiv e-print 의 LaTeX 원본에서 기계적으로 옮긴 표입니다. 숫자는 논문의 값이며 모델을 거치지 않았습니다.

표 1. Layer-wise rank consistency between Beacon and raw K/V projections.

ModelProj.CRBeaconRawSpearmanMAE / Max
LlamaK264.0064.001.0000.00 / 0
K432.0032.000.9960.06 / 1
K816.0016.000.9960.06 / 1
V264.0064.000.9900.50 / 1
V432.0032.000.9540.50 / 2
V816.0016.000.9280.38 / 2
QwenK264.0064.000.9970.08 / 1
K432.0032.000.9990.04 / 1
K816.0016.000.9970.04 / 1
V264.0064.000.9970.08 / 1
V432.0032.001.0000.00 / 0
V816.0016.000.9900.04 / 1

표 2. Detailed decoding latency on Llama-3.1-8B-Instruct over 128 generated tokens. Attn. and E2E denote cumulative attention and end-to-end decoding latency. All values are in seconds.

Comp.Method32K Attn.32K E2E64K Attn.64K E2E96K Attn.96K E2E128K Attn.128K E2E
1$\times$Full KV11.8413.2823.9725.4034.9336.3246.6448.08
16$\times$Recon6.7411.758.5215.469.6317.028.7316.79
SlimKV6.1110.936.2912.476.8713.796.3514.24
32$\times$Recon7.8011.5610.1815.239.1113.959.4815.69
SlimKV7.3110.819.4314.518.0112.907.6513.78

표 3. TTFT and peak allocated memory on Llama-3.1-8B-Instruct. TTFT is reported in seconds and memory in GB.

Comp.Method32K64K96K128K
TTFT (s)
16$\times$Recon16.5946.3889.15153.74
SlimKV16.1644.8087.12152.57
32$\times$Recon11.2828.3450.1382.73
SlimKV10.9227.7748.6279.96
Peak Memory (GB)
16$\times$Recon25.7329.7733.8037.84
SlimKV25.7229.7633.8037.84
32$\times$Recon23.4225.2627.0928.92
SlimKV23.4125.2527.0828.91

표 4. Similarity to the w/ K-RoPE setting.

VariantAttn. $\uparrow$Block $\uparrow$Lag JS $\downarrow$Col. JS $\downarrow$
Beacon removed0.97070.99820.00020.0030
Raw removed0.75700.89220.00620.0349

표 5. LongBench scores under high KV-cache compression. SlimKV t$n$f$m$: $n\times$ token-wise, $m\times$ feature-wise. The bold and underlined numbers denote the first and second rankings, respectively.

Comp.MethodLlama-3.1-8B S-DocLlama-3.1-8B M-DocLlama-3.1-8B Summ.Llama-3.1-8B FewLlama-3.1-8B CodeLlama-3.1-8B Avg.Qwen2.5-14B S-DocQwen2.5-14B M-DocQwen2.5-14B Summ.Qwen2.5-14B FewQwen2.5-14B CodeQwen2.5-14B Avg.
1$\times$Full KV44.3446.6528.7169.4558.3749.5042.7243.7328.0572.0461.0551.52
16$\times$KVZip33.8629.1123.9722.9734.8928.967.835.483.2735.1214.2013.18
PALU13.189.8012.7537.8621.0418.9217.7714.1821.4059.4025.7527.70
SnapKV38.5543.3023.6165.9256.6245.6036.7451.2020.2268.5052.3745.81
Activation Beacon34.7236.2825.3465.0165.1445.3035.7638.3125.2463.6657.7744.15
SlimKV-f2 (t8f2)37.6437.4026.2565.1164.5546.1939.4442.1625.9167.2057.7246.48
SlimKV-f4 (t4f4)38.6534.3326.5765.1467.1146.3638.1543.7625.5069.1654.6146.23
SlimKV-f8 (t2f8)33.4636.2426.0265.6863.8245.0538.2538.8325.6168.0650.8944.33
32$\times$KVZip9.503.3512.690.9620.489.401.090.781.321.5320.915.12
PALU1.580.565.471.3215.024.794.202.8210.9014.6613.679.25
SnapKV35.8042.8221.6162.7053.2943.2432.4549.6118.0962.7148.5442.28
Activation Beacon29.9435.2424.5364.2664.3543.6732.8035.6425.1663.2057.0142.76
SlimKV-f2 (t16f2)33.4935.3424.8661.1959.6842.9137.1538.5925.4964.9757.0944.66
SlimKV-f4 (t8f4)34.1635.7525.4363.3565.0744.7537.5540.2925.5068.7653.3645.09
SlimKV-f8 (t4f8)32.5335.4125.1464.3662.2243.9335.8337.9925.2768.2756.1044.69

표 6. LongBench gap reduction over Activation Beacon. $\Delta$ denotes the drop from Full KV.

BackboneComp.$\Delta_{\textbf{AB}}$$\Delta_{\textbf{SlimKV-f4}}$$\Delta$ Red.Gap Red.
Llama-3.1-8B16$\times$4.203.141.0625.2%
32$\times$5.834.751.0818.5%
Qwen2.5-14B16$\times$7.375.292.0828.2%
32$\times$8.766.432.3326.6%

표 7. LongBench averages at low compression. The averages of the uncompressed models are in Table .

BackboneComp.KVZipPALUABSlimKV-f2
Llama-3.1-8B4$\times$36.3946.6648.2148.10
8$\times$37.2546.4246.9347.77
Qwen2.5-14B4$\times$47.7245.9548.8649.92
8$\times$46.7445.1545.5049.94

표 8. LongBench category scores on Qwen3-30B-A3B-Instruct-2507.

MethodComp.S-DocM-DocSumm.Few-shotCodeAvg.
Full KV1$\times$42.8751.0225.6071.2660.7550.30
SlimKV-f416$\times$36.8740.4326.0068.2458.8746.08
SlimKV-f432$\times$34.1438.1624.7767.8563.0945.60

라이선스

작성자: Jaehun Ryu

링크: https://jaehun.me/posts/paper-2610-02953v1/

라이선스: CC BY 4.0

이 저작물은 크리에이티브 커먼즈 저작자표시 4.0 국제 라이선스에 따라 이용할 수 있습니다. 출처를 밝히면 상업적 목적을 포함해 자유롭게 이용 가능합니다.

댓글