논문 링크

비디오 LLM은 왜 아직도 비싼가? — 추론 효율화 메커니즘 4단계 총정리

TL;DR — 이 논문은 2022년 말부터 2026년 8월까지 발표된 VideoLLM 추론 효율화 연구 125편을 엔코더–커넥터–LLM 파이프라인의 4단계로 분류하고, “같은 호스트 모델 · 같은 입력 프로토콜"에서만 통제 비교를 수행해, 시각 토큰의 약 25% 만 남겨도 정확도가 거의 유지된다는 일관된 결론을 도출한 서베이이다. (근거: Abstract, §I)

핵심 아이디어

비디오 이해는 작업별 아키텍처에서 대규모 사전학습 기반 모델로 전환되며 VideoLLM(비디오 인코더 + 커넥터 + LLM)이 주류가 되었지만, 그 비용은 프레임 수와 컨텍스트 길이에 따라 폭발적으로 증가한다. (근거: §I)

이 서베이의 중심 주장은 단순하다. 효율화는 파이프라인 어느 단계에서 비용을 제거하느냐로 분류해야 하고, 서로 다른 호스트 · 입력 조건에서 보고된 숫자는 직접 비교할 수 없다는 것이다. 저자들은 이를 위해 두 가지 축을 세운다:

  1. 4단계 택소노미 — 입력 구성 → 엔코더 계산 → 표현/커넥터 → LLM 실행·상태. (근거: Fig. 4)
  2. 통제 비교 프로토콜 — “동일 호스트 + 동일 프레임 수 + 동일 평가 하니스"에서만 숫자를 나란히 놓고, 그 외에는 ‘지표적(indicative) 증거’로만 취급. (근거: §IV-A)

또한 “효율적(efficient)“을 정확도를 유지하면서 파라미터 수, 입력당 FLOPs, 지연(latency), 메모리를 줄이는 것이라는 시스템 수준 정의로 명시한다. (근거: §I)

배경: 그들이 해결한 문제

VideoLLM은 표준적인 엔코더–커넥터–LLM 구조를 공유한다. (근거: Fig. 2) 문제는 세 곳에서 온다:

  • 비전 엔코더가 클립당 수백 프레임을 고해상도로 처리하고 (근거: §I)
  • 그 결과 수만 개의 시각 토큰이 LLM 컨텍스트에 쏟아져 들어가 (근거: §III-B)
  • 컨텍스트 길이 $L$ 이 커질수록 prefill 비용은 제곱으로, KV 캐시 메모리는 선형으로 증가한다. (근거: §III-B)

이런 효율화 기법은 대개 단일 작업(캡셔닝, QA, 시간적 접지 등)에 묶여 있고, 서로 다른 지표로 평가되어 “비용이 정확히 어디로 가는지, 어떤 기법이 주어진 제약에서 가장 효과적인지” 판단하기 어려웠다. (근거: §I) 기존 서베이는 능력·아키텍처 중심이거나, 토큰 압축 한 가족만 다루거나, 프레임 선택과 엔코더 설계를 빠뜨렸다. (근거: §I) 이 논문은 그 파편화를 비디오 중심으로 수습한 것이다.

새로운 접근법: 파이프라인 4단계 택소노미 + 통제 비교

이 논문의 “방법"은 새 모델이 아니라 분류 체계와 비교 방법론이다. VideoLLM을 Embedder 계열(엔코더–커넥터–LLM)로 한정하고, 각 효율화 메커니즘을 비용을 제거하는 파이프라인 단계에 배정한다. (근거: §III-A, §IV)

단계질문대표 기법군
1. 입력 구성어떤 프레임·패치를 인코딩할까?시간 샘플링(TSN, AKS, FOCUS, TSPO), 해상도/패치 예산(Q-Frame, LDDR)
2. 엔코더 계산특징 추출을 어떻게 싸게?경량 백본(TSM, X3D, MViTv2, Hiera), 상태공간(VideoMamba), 토큰 병합(ToMe)
3. 표현 & 커넥터LLM에 몇 개 토큰을 줄까?선택/병합(VisionZip, PruneVid, HoliTom), 그리드 풀링(NVILA, STORM), 리샘플링(LLaMA-VID, BLIP-3-Video)
4. LLM 실행 & 상태LLM 내부와 KV를 어떻게 줄일까?디코더 프루닝(FastV, HieraVid), 희소 어텐션(MMInference), KV 압축·오프로드(VidKV, ReTaKe, StreamMem)

(근거: Fig. 4, §IV-B–E)

핵심 설계 판단은 통제 비교의 원칙이다. 서로 다른 호스트에서 나온 정확도는 한 표에 올리더라도 ‘랭킹’으로 읽지 않는다. 대신 다음 조건이 맞을 때만 같은 표에서 비교한다: (1) 같은 호스트 LLM(주로 7B–8B), (2) 같은 프레임 수와 입력 모달리티, (3) 같은 평가 하니스(예: LLaVA-OneVision-7B, 32프레임, LMMs-Eval). (근거: §IV-A, Tab. V)

작동 원리: 구체적인 예시로 살펴보기

1) 토큰은 어디서 폭증하는가

표준 CLIP ViT-L/14를 가정한 toy 예시다. (근거: §III-B)

  • 프레임 해상도 $336 \times 336$, 패치 크기 $14 \times 14$ → 프레임당 패치 수 $$N_p = \frac{H}{P}\cdot\frac{W}{P} = 24 \times 24 = 576$$
  • 64프레임을 넣으면 엔코더 출력 토큰은 $$N_v^{enc} = T \cdot N_p = 64 \times 576 = 36{,}864$$
  • 텍스트 프롬프트 $N_t$ 까지 더한 LLM 컨텍스트는 $$L = N_t + N_{ev} + N_{ea}$$

즉, 프롬프트 몇십 토큰에 비해 시각 토큰이 압도적으로 많고, prefill 어텐션 비용은 $FLOPs_{attn} \propto N d^2 + N^2 d$, KV 메모리는 $Mem_{KV} \propto 2B \cdot n_{layers} \cdot L \cdot d_{KV} \cdot b$ 로 증가한다. (근거: §III-B)

  flowchart LR
  A["비디오/오디오 입력"] --> B["1. 입력 구성<br/>프레임·패치 선택"]
  B --> C["2. 엔코더 계산<br/>비전·오디오 백본"]
  C --> D["3. 표현 & 커넥터<br/>토큰 압축/리샘플링"]
  D --> E["4. LLM 실행 & 상태<br/>prefill / KV 캐시"]
  E --> F["응답 생성"]

2) 4단계가 각각 무엇을 아끼는가

핵심 통찰은 단계마다 아끼는 것이 다르고, 서로 상호작용한다는 점이다. (근거: §V)

  • **1단계(프레임 선택)**는 엔코더가 프레임을 보기 전에 $T$ 를 줄이므로, 엔코더 비용과 LLM 컨텍스트 양쪽을 동시에 줄인다. 다만 이 단계에서 버린 프레임은 되돌릴 수 없다. (근거: §IV-B)
  • **2단계(엔코더)**는 특징 추출 자체를 싸게 만든다. 경량 백본은 낮은 컴퓨트 구간을, 풀링-어텐션 트랜스포머는 넓은 정확도 범위를 담당한다. (근거: §IV-C, Fig. 5)
  • **3단계(커넥터)**는 이미 인코딩 비용을 지불한 뒤 LLM 입력만 줄인다. prefill 비용은 줄지만, 남은 프레임의 인코딩 비용은 그대로다. (근거: §IV-D)
  • **4단계(LLM 내부)**는 prefill 계산(디코더 프루닝) 또는 디코딩 메모리/지연(KV 압축)을 줄인다. 두 메커니즘은 상호 보완적으로 결합된다. (근거: §IV-E)

저자들이 특히 강조하는 반전은 선택(selection)이 항상 ‘상류’에서 일어나지 않는다는 점이다. Frame-Voyager나 FlexSelect는 모든 후보 프레임을 먼저 인코딩한 뒤 선택하므로 LLM 컨텍스트는 줄지만 엔코더 비용은 전혀 아끼지 못하고, Frame-Voyager는 균일 샘플링보다 오히려 27.6% 더 느렸다. (근거: §IV-D, §V)

3) “비밀 병기” — 시간적 중복을 명시적으로 모델링하라

통제 비교(Tab. V)에서 가장 분명한 패턴은 이것이다. 25% 예산에서는 대부분의 기법이 기준선의 1.5% 이내로 따라붙지만, 10% 예산으로 가면 기법 선택이 결정적이 된다. (근거: §IV-D, Tab. V)

기법 (10% 예산)MVBenchEgoSchema평균(상대)
LLaVA-OV-7B (기준)58.360.4100%
VisionZip (공간 선택만)53.558.091.6%
PruneVid (시간 중복 모델링)56.259.896.9%
HoliTom (전체적 병합)57.361.299.1%

(근거: Tab. V)

왜 이런 차이가 생기는가? VisionZip은 공간적으로 “중요한” 토큰만 남기지만, 비디오의 핵심 중복은 프레임 간 시간적 중복이기 때문이다. PruneVid와 HoliTom은 이 시간적 중복을 명시적으로 병합해, 낮은 예산에서도 훨씬 우아하게 열화한다. (근거: §IV-D) 같은 논리가 디코더 단계에도 적용된다: HieraVid는 24.5% FLOPs로 기준선과 0.2–2.1 포인트 차이를 유지해, 더 큰 예산의 FastV(39.3% FLOPs)를 능가했다. (근거: §IV-E, Tab. VII)

성능 검증: 주요 결과

서베이이므로 “자체 성능"보다 교차 검증된 통찰이 결과다. 핵심을 추리면:

① 25% 규칙. 여러 기법군이 시각 토큰의 약 25%만 남겨도 거의 기준선 정확도를 유지한다 — pixel-shuffle(InternVL2.5), 풀링(PLLaVA), 시간 압축(STORM), 오디오 유도 프루닝(DASH), 디코더 계층 구조(HieraVid) 모두. 다만 이는 서로 다른 호스트에서 나온 결과라 모든 모델이 75%를 버려도 안전하다는 뜻은 아니다. (근거: §V)

② 프레임 선택의 수확 체감. 같은 LLaVA-Video-7B · 64프레임 프로토콜에서, query-aware 선택기는 균일 샘플링 대비 LongVideoBench에서 최대 5포인트까지 이득을 보지만, Video-MME에서는 이점이 거의 사라진다. 최고 성능은 겨우 3.5M 파라미터의 정책(TSPO)이 차지했다. (근거: §IV-B, Tab. II)

③ 강한 2025–2026 방법은 ‘단계 결합’이다. PruneVid, MeToM, FlashVID, HieraVid, HoliTom은 LLM 이전과 내부에서 동시에 토큰을 줄인다. 이 경우 end-to-end 이득을 어느 단계 탓으로 돌릴 수 없고, HoliTom만이 두 단계를 분리하는 ablation을 보고했다. (근거: §V)

④ 스트리밍의 retrieval–eviction 트레이드오프. ReKV의 검색 기반 방식은 스트리밍 정확도를 가장 잘 지키지만 피크 GPU 메모리가 full-cache 수준에 머물고, 하드 캡 eviction(InfiniPot-V, StreamMem)은 약 6포인트(RVS-Ego)를 내주는 대신 메모리 상한을 약 10 GB 낮춘다. (근거: §IV-E, Tab. VI)

우리의 관점: 강점, 한계, 그리고 이 연구가 중요한 이유

강점

이 서베이의 진짜 기여는 “비교 가능성"을 방법론의 중심에 세웠다는 점이다. 수백 편 논문이 저마다 다른 호스트·프레임 수·모달리티로 GFLOPs와 정확도를 보고하는 상황에서, 저자들은 숫자를 추정하거나 환산하지 않고 명시적으로 보고된 값만 쓰고, 조건이 맞는 표만 ‘랭킹’으로 읽도록 경계를 그었다. (근거: §IV-A) 특히 **“토큰 유지율 25%라는 단일 숫자는 어디서 절약됐는지 아무것도 말해주지 않는다”**는 지적(§V)은, 효율화 논문을 읽을 때 반드시 물어야 할 질문을 정확히 짚어낸다.

한계

저자 스스로 인정하듯, 비교는 본질적으로 제한적이다. (근거: §IV-E)

  • 엔코더 FLOPs ≠ end-to-end 효율. 효율적인 Kinetics 백본이 VideoLLM QA에서도 효율적임을 보장하지 않는다. (근거: §V)
  • 정확도 지표의 편향. 거의 모든 비교가 다지선다형(Multiple Choice) QA 하나로 집약되어, 캡셔닝·검색·시간적 접지 지표가 표에 단 하나도 없다. MCQ는 거친 객체·장면 단서로 풀리는 경우가 많아, MCQ에서 무손실인 유지율이 생성 과제에서도 무손실일 필요가 없다. (근거: §V)
  • 오디오비주얼 증거의 부재. 오디오 엔코더 비용이 자주 생략되고, 모달리티 ablation이 드물어 오디오 유도 선택의 이득·비용을 분리하기 어렵다. (근거: §V)
  • 에너지 미보고. 조사된 어떤 방법도 에너지 소비를 보고하지 않았다. (근거: §IV-A)

왜 중요한가

이 논문은 “무엇이 새 기법인가"보다 “무엇이 검증 가능한 주장인가“를 묻는 서베이다. 비디오 LLM 효율화는 이제 매달 새 논문이 나오는 분야인데, 이 서베이는 그 혼란 속에서 다음 실험을 설계할 때의 기준 — 같은 호스트, 같은 입력, FLOPs 회계 경계 명시, 선택기 자체 비용 포함 — 을 제공한다. 특히 “절약한 컴퓨트를 더 많은 프레임에 재투자하면 압축이 오히려 정확도를 올릴 수 있다"는 관찰(§V)은 효율화를 단순 손실 압축이 아니라 시간적 커버리지 확장으로 재해석하게 해 준다.

다음 단계는?: 앞으로의 길

저자들은 세 갈래의 연구 아젠다를 제시한다. (근거: §V)

  1. 공통 분석 프로토콜 수립. 같은 비디오·프롬프트·모달리티, 고정 해상도·디코딩 설정, 동결 호스트, 그리고 선택/할당 모듈 자체의 비용까지 포함한 FLOPs 회계. 실용적 출발점으로 LLaVA-OneVision-7B · 32프레임 · LMMs-Eval 셋업을 제안한다. (근거: §V)
  2. 도메인·과제군별 보고. Video-MME는 내용 도메인과 길이를 주석으로 달고 있는데도 대부분 집계치만 보고한다. 강의 영상에서 검증된 예산과 스포츠 하이라이트에서 검증된 예산은 구분되어야 한다. (근거: §V)
  3. 오디오가 언제 압축에 개입해야 하는지 학습. OmniZip·DASH가 오디오 유도 압축의 가능성을 보였지만, 음성이 화면 밖 사건을 가리키거나 눈에 보이는 사건에 소리가 없을 수 있다. 다음 단계는 학습 기반의, 쿼리·컨텍스트 조건부 모달리티 간 예산 할당이며, 그 비용 회계에 오디오 엔코더를 반드시 포함해야 한다. (근거: §V)

저자들은 LLM 측 기법군(KV eviction·양자화·희소 어텐션)이 텍스트 LLM에서 거의 그대로 전이되어 왔고, pre-LLM 압축이 성숙한 뒤 남는 비용은 다중 턴·스트리밍의 디코딩 메모리와 캐시 성장이므로 이 기법군이 가장 빠르게 성장할 것으로 전망한다. (근거: §V) 더불어 디코더 백본이 조밀 트랜스포머를 넘어 Mamba–Transformer 하이브리드로 다변화하면서, 제거된 토큰의 정보를 순환 상태에 보존하는 방식이 새로운 평가 과제로 떠오르고 있다. (근거: §IV-E)


정리하면, 이 서베이는 “비디오 LLM을 싸게 만드는 방법"의 지도를 그리는 동시에, 그 지도 위의 숫자들이 얼마나 믿을 만한지를 솔직하게 드러낸다. 효율화 논문을 읽을 때 이제 우리가 던져야 할 질문은 명확해졌다. “몇 %를 줄였는가"가 아니라, “어느 단계에서, 어떤 호스트와 입력 조건으로, 그 선택기 자체의 비용까지 포함해서 줄였는가.”

논문 원문의 표

arXiv e-print 의 LaTeX 원본에서 기계적으로 옮긴 표입니다. 숫자는 논문의 값이며 모델을 거치지 않았습니다.

표 1. VideoLLM benchmarks used in the comparisons of this survey. Mod.\ denotes the modalities provided beyond the question text (V=video, A=audio, T=transcript/subtitles). Dur.: short ($<$1 min), medium (1–10 min), long ($>$10 min). #V = Number of videos, #Q = Number of questions. Fmt.: MCQ = Multiple Choice Question, OE = Open Ended

BenchmarkMod.Fmt.Dur.#V#Q
MVBenchVMCQS3,6414,000
Video-MMEV+A+TMCQS/M/L9002,700
EgoSchemaVMCQM5,0635,063
LongVideoBenchV+TMCQM/L3,7636,678
MLVUVMCQM/L1,7303,102
RVS-Ego / RVS-MovieVOEL323,500

표 2. color-frameFrame samplers on LLaVA-Video-7B at a $\sim$64-frame budget. All rows share the same uniform baseline (LongVideoBench 58.9 / Video-MME 64.4) unless marked. $^\dagger$FOCUS reports a 32–64 frame budget, not a fixed 64. $^\ddagger$Own uniform-baseline reproduction differs from the shared one (EFS: 58.8/64.6).

MethodQuery-awareTrain-freeFramesLongVideoBenchV-MME
Uniform baseline6458.964.4
MaxInfonoyes6461.564.2
AKSyesyes6462.765.3
AdaRD-Keyyesyes6462.9
FOCUSyesyes32–64$^\dagger$63.565.4
EFSyesyes6462.1$^\ddagger$65.6$^\ddagger$
QCAyesyes6462.966.1
TSPOyesno6463.965.5

표 3. color-backboneVision Encoder efficiency methods. GFLOPs$\times$v gives inference GFLOPs per view times the number of temporal$\times$spatial views used for the reported accuracy, as stated by each paper; $^t$ marks papers reporting only the total across views (per-view cost not separately stated). Abbreviations: K-400/600 = Kinetics-400/600 , MiT = Moments in Time , AS = AudioSet , UCF = UCF101 , HMDB = HMDB51 .

MethodYearParams (B)GFLOPs$\times$vK-400K-600MiTASUCFHMDB
TSM20190.02465$\times$174.795.973.5
MMV20200.09470.530.995.275.0
X3D20200.01135.84$\times$1078.481.9
MoViNet20210.031386$\times$184.839.9
MViT20210.037170$\times$580.283.4
VATT20210.15515 020$^t$79.980.837.839.3
MViTv220220.051225$\times$582.985.5
Video Swin20220.088282$\times$1282.7
UniFormer20220.0503108$^t$83.084.9
Hiera20230.213413$\times$1587.3
UniFormerV220230.35475 300$^t$90.090.147.8
VideoMamba20240.074403$\times$1282.488.260.8
VideoMamba-ST20240.02768$\times$1577.775.7
VideoMambaPro20250.0724700$^t$84.091.663.2

표 4. Reported performance of token reduction methods before and within the LLM. Groups follow the families in Figure ; joint methods may also act at other stages. $^h$ marks a plug-in host size. Retained budgets follow the source and may describe tokens, memory or audio rate. Hosts, inputs, protocols and baselines differ, so these rows are indicative and do not rank methods. NX-QA = NExT-QA, MSR = MSR-VTT-QA, MSVD = MSVD-QA, MVB = MVBench, VME = Video-MME w/o, ES = EgoSchema, ActNet = ActivityNet-QA. HyperCLOVA\textquotesingle s budget describes its documented audio compression; its QA score is a system-level result.

MethodYearParams (B)LLM/hostRetained budgetNX-QAMSRMSVDMVBVMEESActNet
color-context{white3a. Selection and merging of encoded representations}
VisionZip20247$^h$Video-LLaVA6.6%52.163.543.0
LLaVA-PruMerge20247$^h$Video-LLaVA256/img59.371.147.7
Chat-UniVi20247Vicuna-1.544%55.069.346.1
LongVU20247Qwen245%66.960.667.6
PruneVid20257$^h$LLaVA-OV15–17%57.558.659.5
HoliTom20257LLaVA-OV10%57.356.861.2
FlashVID20267$^h$LLaVA-OV10%57.457.860.0
EchoPrune20267$^h$LLaVA-OV10%/320f61.860.4
FastVID20257$^h$LLaVA-OV25%56.358.0
LLaVA-Scissor20257$^h$LLaVA-OV10%80.057.955.257.547.8
VidCom220257$^h$LLaVA-OV25%57.258.659.7
MMG-Vid20257$^h$LLaVA-OV25%56.758.6
TS-LLaVA20247Vicuna-1.53456/50f66.565.179.045.550.256.7
VideoChat-Flash20257Qwen216/frame74.065.3
StreamingTOM20257LLaVA-OV25.5%59.963.7
TimeChat-Online20257Qwen2.5-VL$\sim$17%62.5
OmniZip20257$^h$Qwen2.5-Omni35%66.1
DASH20267Qwen2.5-Omni25%66.0
color-context{white3b. Grid pooling and downsampling}
VideoLLaMA 220247$^h$Mistral50%70.954.647.951.750.2
InternVL2.520248.1InternLM2.525%72.064.2
PLLaVA20247LLaVA-NeXT25%62.076.656.3
SF-LLaVA20247LLaVA-NeXT3680 total64.265.879.147.255.5
STORM20257Qwen225%71.363.4
NVILA20248Qwen21/882.268.164.260.9
PVC20248InternLM2.564/frame82.073.864.159.657.1
VideoScan20257LLaVA-Video1/frame48.953.7
Baichuan-Omni20247own182–546/video72.260.958.258.858.6
HyperCLOVA X 8B20268own1/s audio58.2
color-context{white3c. Latent resampling and compact representation construction}
LLaMA-VID20237Vicuna2/frame57.769.747.4
LLaVA-Mini20257Vicuna-1.51/frame59.570.944.551.253.5
BLIP-3-Video20244Phi-3-Mini32/video76.460.077.754.955.7
Quicksviewer20258Qwen2.5-7B64/cube77.555.656.947.6
VidCompress20247Vicuna1/frame+QF57.768.946.943.048.3
Oryx20247Qwen21/4–1/1681.963.958.3
FAVOR20237$^h$Vicuna160/25 s42.5
video-SALMONN20247$^h$Vicuna-1.5160/25 s42.5
color-context{white3d. Representation-memory compression and retrieval}
MovieChat20247$^h$Vicuna576 mem52.775.245.7
MA-LMM20247Vicuna32 mem48.560.649.8
$\infty$-Video20257V-LLaMA/VC241.142.446.8
Flash-VStream20257Qwen211.5K/stream65.461.268.2
VideoLLaMB20257Vicuna-1.532 mem/seg71.152.541.453.8
color-llm{black4a. Decoder token pruning and merging}
STTM20257$^h$LLaVA-OV50%80.460.761.7
color-llm{black4c. LLM-computed summary tokens}
VoCo-LLaMA20247Vicuna2/frame61.172.347.9
Video-XL20247Qwen2KV 1/1655.355.5

표 5. Training-free reduction on a shared LLaVA-OneVision-7B host (32 frames, LMMs-Eval). HoliTom re-runs the upper blocks under one harness ; the lower block collects own-paper runs on the same host and frame count. FLOPs are relative LLM-prefill costs, except $^e$, which also includes vision encoding. Avg.\ is relative to the 58.4 baseline mean; $^p$ marks a paper-reported relative average against that paper’s own baseline. $^m$ marks methods whose own MVBench baseline reproduction differs from the shared 58.3 (VidCom2 and FastVID report 56.9, MMG-Vid 57.6).

MethodTokens keptFLOPsMVBenchEgoSch.LongVideoBenchV-MME w/oAvg.\ %
LLaVA-OV-7B (base)100%100%58.360.456.458.6100
DyCoke25%21.3%53.159.549.554.392.6
VisionZip25%21.3%57.960.356.558.299.7
PruneVid25%21.3%57.459.955.757.498.6
FastVID$^m$25%21.3%56.556.358.0
HoliTom25%17.4%58.461.256.758.9100.7
VisionZip10%8.3%53.558.049.353.491.6
PruneVid10%8.3%56.259.854.556.096.9
FastVID$^m$10%8.3%55.956.357.3
HoliTom10%6.9%57.361.256.356.899.1
FlashVID25%58.060.456.859.2100.3
EarlyTom25%44.2%$^e$57.460.556.358.599.7
FlashVID10%57.460.056.557.899.1
EarlyTom10%39.0%$^e$56.560.152.455.896.2
VidCom2$^m$25%57.259.754.958.699.6$^p$
MMG-Vid$^m$25%56.756.658.699.5$^p$

표 6. Streaming memory systems, including representation memory and LLM KV state, under the two protocols the literature shares. Top: offline long-video QA on a shared Qwen2-VL-7B backbone against its full-KV baseline. Baseline reproductions drift with frame count (Video-MME w/o 63.3–63.9, MLVU 63.9–65.8, LongVideoBench 55.6–58.8); each method is judged against its own reproduction, so cross-row gaps within a point are not meaningful. Bottom: streaming QA on a shared LLaVA-OneVision-7B backbone (RVS-Ego / RVS-Movie ), reproduced under one protocol by StreamMem ; peak memory is for a 1-hour 0.5-FPS stream where reported.

Offline long video, Qwen2-VL-7B MethodOffline long video, Qwen2-VL-7B KV budgetOffline long video, Qwen2-VL-7B V-MME w/oOffline long video, Qwen2-VL-7B MLVUOffline long video, Qwen2-VL-7B LongVideoBenchOffline long video, Qwen2-VL-7B EgoSch.
Full KV cache (range of reproductions)100%63.3–63.963.9–65.855.6–58.865.2
ReTaKe$8\times$ compr.63.969.857.7
InfiniPot-V6K tokens62.865.858.465.6
StreamMem6K tokens62.165.967.2
Streaming QA, LLaVA-OneVision-7B (RVS-Ego / RVS-Movie), StreamMem reproduction
MethodMechanismRVS-EgoRVS-MoviePeak memory
Full KV / backbone baseline56.2–60.143.0–53.437.5 GB
ReKVKV offload + retrieval63.754.438 GB$^{o}$
Flash-VStreamlearned fixed memory57.053.1
InfiniPot-Vcapped KV eviction57.951.427.8 GB
StreamMemquery-agnostic KV memory57.652.7$<$28 GB$^{c}$

표 7. color-llmDecoder-layer visual-token pruning on a shared LLaVA-Video-7B backbone, as re-run by HieraVid at matched ${\sim}30\%$ token budgets (FastV runs at a larger $39.3\%$ FLOPs budget). ``FLOPs’’ is prefilling FLOPs relative to the unpruned model; accuracy is %.

MethodFLOPsMVBenchNExT-QAEgoSch.VME w/oVME w/
LLaVA-Video (base)100%60.480.259.464.171.4
FastV39.3%56.677.255.159.366.7
FrameFusion23.8%56.778.856.861.970.1
HieraVid24.5%58.379.959.262.370.8

라이선스

작성자: Jaehun Ryu

링크: https://jaehun.me/posts/why-is-video-still-so-expensive-a-survey-of-inference-efficiency-mechanisms-in-video-and-audiovisual-llms/

라이선스: CC BY 4.0

이 저작물은 크리에이티브 커먼즈 저작자표시 4.0 국제 라이선스에 따라 이용할 수 있습니다. 출처를 밝히면 상업적 목적을 포함해 자유롭게 이용 가능합니다.

댓글