논문 링크

ShallowStream: 얕게 인덱싱하고, 깊게 답하라 — 스트리밍 비디오 이해의 계산 병목을 푸는 방법

TL;DR — 스트리밍 비디오 이해에서 가장 비싼 비용은 매 프레임을 MLLM의 전체 깊이(28~32개 레이어) 로 prefill하는 것이다. ShallowStream은 얕은 레이어 4~5개 만으로 프레임 인코딩과 검색 인덱스를 동시에 구축하고, 질문이 들어온 순간에만 검색된 증거에 대해 전체 깊이 연산을 수행한다. 그 결과 SOTA 수준의 성능(OVO-Bench 69.5 / StreamingBench 78.2)을 유지하면서, 프레임당 prefill은 최대 52.1배, 10초 구간 엔드투엔드 지연은 최대 11.9배 줄였다 (근거: Abstract).


핵심 아이디어

스트리밍 비디오 이해는 워크로드가 비대칭(asymmetric) 이다. 영상 프레임은 쉬지 않고 계속 들어오는 반면, 사용자 질문은 간헐적으로만 발생한다 (근거: §1). 그런데 기존 방식은 “나중에 무슨 질문이 올지도 모르면서” 들어오는 프레임마다 전체 Transformer 스택을 통과시켜 KV 캐시를 쌓아둔다. 이렇게 만든 딥(depth) KV 캐시는 결국 한 번도 attend되지 않을 수도 있는 계산 이다 (근거: §1).

ShallowStream의 출발점은 하나의 실험적 관찰이다. Qwen3-VL-8B는 28개 레이어 중 4번째 레이어에서, LLaVA-OneVision-7B는 32개 중 3번째 레이어에서 이미 강한 검색 능력 을 보인다 (근거: §3, Fig. 2). 즉, “어떤 과거 프레임이 이 질문과 관련 있는가"를 판별하는 일에는 전체 깊이가 필요 없다는 뜻이다.

Qwen3-VL과 LLaVA의 레이어별 검색 능력과 스트림 시점 prefill 비용

LLaVA-OneVision의 레이어별 검색 능력과 스트림 시점 prefill 비용

이 관찰을 바탕으로 ShallowStream은 스트리밍 파이프라인을 두 단계로 분리한다 (근거: §4):

  1. 쿼리 무관 스트림 처리(query-agnostic) — 들어오는 프레임을 얕은 레이어만 으로 인코딩하고, 그 KV 캐시로 가벼운 전체 히스토리 인덱스 를 유지한다.
  2. 쿼리 시점 답변(query-time) — 가벼운 게이트(gate) 가 히스토리 검색 필요성을 판단하고, 필요한 경우에만 검색된 증거에 전체 깊이 연산을 집중한다.

쉽게 말해, “평소에는 얕게 훑어만 두고, 질문이 왔을 때 관련 장면만 깊게 다시 본다” 는 전략이다. 비싼 deep-layer 연산을, 질문이 실제로 필요로 하는 증거가 특정될 때까지 미루는 것이다 (근거: §1).


배경: 그들이 해결한 문제

MLLM 기반 스트리밍 비디오 이해는 체화 지능, 자율주행, 산업 모니터링, 감시·조기 경보, 웨어러블 어시스턴트 등 실시간 응용의 핵심 역량이다 (근거: Abstract). 오프라인 장기 비디오 이해와 달리, 스트리밍 환경에서는 미래 프레임도, 미래 질문도 알 수 없는 채로 열린 스트림을 인과적으로 처리해야 한다 (근거: §2).

저자들은 기존 연구가 공통적으로 안고 있는 세 가지 도전 을 명시적으로 지목한다 (근거: §1):

  • 비싼 스트림 처리(Expensive Stream Processing) — ReKV, StreamMem, InfiniPot-V 같은 KV 중심 방법들은 미래 질문을 모른 채 매 프레임을 전체 Transformer 스택으로 prefill한다. 이후 캐시를 줄여도 이미 지불한 계산 은 되돌릴 수 없고, 한 번도 attend되지 않을 deep KV 캐시를 만들어낸다 (근거: §1).
  • 손실 있는 증거 축소(Lossy Evidence Reduction) — 메모리를 줄이려고 쿼리 무관 압축·병합·축출을 하면, 미래의 회고적 질문(retrospective query)이 필요로 할 증거를 버릴 위험 이 있다. 반대로 전체 상태를 보존하면 메모리가 폭증하고 대역폭 제한적인 offloading에 의존하게 된다 (근거: §1).
  • 비효율적인 히스토리 사용(Inefficient History Use) — 항상 히스토리를 컨텍스트에 붙이면 지연이 늘고 현재 장면 인식이 방해받는다. 반면 OASIS·WeaveTime처럼 필요할 때만 검색을 트리거하는 방식은 라우팅 자체에 비싼 answer-level 추론 을 한 번 쓰고, 검색이 활성화되면 두 번째 추론 을 또 써야 한다 (근거: §2).

이 세 문제를 한 문장으로 요약하면, 기존 방법들은 “모델 깊이(depth)” 라는 차원을 간과했다 는 것이 이 논문의 핵심 진단이다 (근거: Abstract).


새로운 접근법: ShallowStream

ShallowStream은 프리트레인된 MLLM을 그대로 쓰되, 어디서(얕은/깊은 레이어), 언제(스트림/쿼리 시점), 무엇을(선택된 증거만) 계산하는지를 재설계한다. 추가 학습은 전혀 없다(training-free) (근거: §5).

전체 파이프라인은 다음과 같다 (근거: Fig. 3):

ShallowStream의 전체 파이프라인: 얕은 레이어 인코딩 → 가벼운 시각 인덱스 → 게이트 라우팅 → 토큰 보팅/다양성 선택 → 선택 증거만 전체 깊이 처리

1) 쿼리 무관 얕은 인덱스 구축 (§4.1)

  • 스트리밍 얕은 prefill — 각 비디오 유닛 $$x_t$$ 는 비전 인코더 $$E_{\mathrm{v}}$$ 를 거쳐 $$\bm{H}_t^0$$ 가 되고, 얕은 레이어 $$[0, P)$$ 만 통과하여 검색용 KV를 만든다. deep 레이어 $$F^P, \dots, F^{L-1}$$ 은 건너뛰므로, 유닛당 연산이 $$L$$ 레이어에서 $$P$$ 레이어로 줄어든다 (근거: §4.1). 여기서 pruning boundary $$P$$ 는 Qwen3-VL-8B에서 5, LLaVA-OneVision-7B에서 4다 (근거: Tab. Appx).
  • 전체 히스토리 얕은 캐시 — 관찰된 모든 유닛의 얕은 KV를 보존한다: $$ \mathcal{C}T^{\mathrm{shallow}} = \left{ (\bm{K}{1:T}^{i}, \bm{V}{1:T}^{i}) \right}{i=0}^{P-1} $$ 캐시 크기는 전체 깊이 보존 대비 대략 $$P/L$$ 로 줄어든다 (근거: §4.1).
  • 유닛 단위 다양성 디스크립터 — 마지막 얕은 레이어의 키를 평균하고 $$\ell_2$$ 정규화하여 고정 길이 디스크립터 $$\bm{k}_t$$ 를 만든다 (근거: Eq. 3).
  • 선택적 장기 클러스터 압축(long-cluster) — 히스토리가 예산 $$B$$ 를 넘으면, 오래된 유닛들을 시간 인접 클러스터로 묶고 고정 크기 대표 KV를 유지한다. 클러스터당 호스트→디바이스 전송은 멤버 수와 무관하게 대표 1개 로 고정된다 (근거: §4.1).

2) 쿼리 시점 답변 (§4.2)

  • 쿼리-로짓 게이트 — 질문을 10-shot 라우팅 프롬프트에 넣고, 단일 토큰 선택(A: 과거 메모리 필요 / B: 최신 장면으로 충분)의 로짓 차이 $$\ell_{\mathrm{ret}} - \ell_{\mathrm{recent}}$$ 를 임계값 $$\tau_g$$ 와 비교한다. 텍스트 한 번의 forward만 으로 라우팅이 끝나므로, 별도 라우터 학습도, 비싼 추론 pass도 없다 (근거: §4.2). 임계값은 벤치마크와 무관한 캘리브레이션 셋에서 한 번 정하고 고정한다 (근거: §4.2, Appx).
  • 토큰 보팅(token voting) — 게이트가 검색을 활성화하면, 마지막 프롬프트 토큰이 각 얕은 레이어에서 모든 히스토리 시각 토큰에 대해 attend한 RoPE-aware 어텐션 스코어를 계산한다. 각 레이어에서 상위 $$M=64$$ 개 토큰을 뽑고, 각 히스토리 유닛은 자기에게 속한 선택 토큰 수만큼 투표 를 받는다 (근거: §4.2).
  • max-min 다양성 선택 — 투표 순위로 상위 $$4K$$ 개 후보를 남긴 뒤, 디스크립터 공간에서 가장 먼 쌍으로 시작해, 선택된 집합과의 최소 코사인 거리가 가장 큰 후보를 반복 추가 하여 중복 장면에 예산을 낭비하지 않는다. 최종적으로 $$K=8$$ 개 유닛을 고르고, 각 유닛에 시간적 이웃(직전 유닛 1개)을 붙인다 (근거: §4.2).
  • 선택적 재-prefill — 선택된 유닛의 입력 상태 $$\bm{H}_t^0$$ 만 모아 질문과 함께 전체 $$L$$ 레이어 를 처음부터 다시 통과시켜 답을 생성한다. 얕은 KV는 “무엇을 깊게 볼지"를 결정하는 데만 쓰이고, 부분 깊이 상태를 생성에 그대로 이어 쓰지 않는다 (근거: §4.2).

작동 원리: 구체적인 예시로 살펴보기

아주 작은 장난감 예시로 파이프라인을 따라가 보자. Qwen3-VL-8B(총 $$L=28$$ 레이어, $$P=5$$, 비디오 유닛 = 프레임 2장)를 가정한다.

Step 1 — 스트림 시점: 얕게 인코딩만

비디오 유닛이 차례로 들어온다: $$x_1, x_2, x_3, \dots$$ 각 유닛은 비전 인코더를 거쳐 $$\bm{H}_t^0$$ 가 되고, 레이어 0~4만 통과해 $$(\bm{K}_t^i, \bm{V}t^i){i=0}^{4}$$ 를 만든다. 레이어 5~27은 건드리지 않는다. 따라서 유닛당 계산은 전체의 $$5/28 \approx 17.9%$$ 수준으로 줄어든다 (근거: §4.1).

동시에 마지막 얕은 레이어(레이어 4)의 키를 평균·정규화해 유닛 디스크립터 $$\bm{k}_t$$ 를 하나씩 저장한다. 이제 메모리에는 “얕은 KV + 디스크립터"만 쌓인다. 전체 깊이 KV를 보관할 때보다 훨씬 가볍다.

Step 2 — 질문 도착: 게이트가 판단

사용자가 “영상 초반에 열쇠를 어디에 두었지?” 라고 묻는다. 이 질문을 10-shot 라우팅 프롬프트에 넣고 다음 토큰 로짓을 본다. $$\ell_{\mathrm{ret}} - \ell_{\mathrm{recent}} \geq \tau_g$$ 이면 A(과거 필요) 로 분류되어 검색이 활성화된다. 반면 “지금 화면의 차량 색은?” 같은 질문은 B(최신 장면으로 충분) 로 분류되어 최근 컨텍스트만 사용한다 (근거: §4.2). 이 판단 비용은 텍스트 forward 한 번 , 약 92.7 ms에 불과하다 (근거: Tab. Appx).

Step 3 — 토큰 보팅으로 증거 선별

검색이 활성화되면, 질문 토큰이 얕은 레이어 0~4에서 저장된 모든 히스토리 토큰 에 attend한다. 작은 예시로, 후보 유닛이 3개뿐이라고 치자. 각 얕은 레이어에서 상위 64개 토큰을 뽑아 보팅을 집계하면, 유닛별 득표가 다음과 같다고 하자:

유닛$$x_1$$ (초반 장면)$$x_2$$ (중간 장면)$$x_3$$ (최근 장면)
득표 $$v_t$$910

$$x_1$$ 이 압도적으로 많은 투표를 받았다. 여기서 max-min 다양성 선택이 적용된다. 만약 $$x_1$$ 과 매우 유사한 장면이 여러 개라면, 첫 선택 후 “이미 고른 것과 가장 다른” 장면을 우선 추가한다. 그 결과 중복 장면 대신 상호보완적인 장면 들이 $$K=8$$ 개 선택된다 (근거: Fig. 6의 정성 사례에서 이 효과를 직접 확인할 수 있다).

Step 4 — 선택된 증거만 깊게 다시 본다

선택된 유닛들의 입력 $$\bm{H}_t^0$$ 만 모아 질문과 함께 레이어 0~27 전체 를 통과시킨다. 즉, 전체 스트림을 깊게 다시 보는 것이 아니라, 검색이 가리킨 장면만 전체 깊이로 재구성하는 것이다 (근거: §4.2).

핵심은 여기에 있다: 평소의 스트림 처리는 $$P$$ 레이어로 싸게 유지하고, 비싼 $$L$$ 레이어 연산은 질문이 특정한 증거에만 쓴다.


성능 검증: 주요 결과

정확도 — SOTA와 동급, 그러나 훨씬 저렴하게

ShallowStream은 두 백본 모두에서 가장 강한 스트리밍 방법들과 동급 의 성능을 낸다 (근거: Tab. 1, Tab. 2).

BenchmarkQwen3-VL-8B + ShallowStreamLLaVA-OneVision-7B + ShallowStream
OVO-Bench (Avg)69.562.2
StreamingBench (Avg)78.275.5

OVO-Bench에서 Qwen3-VL-8B 기준으로, 기존 최강 베이스라인인 OASIS(67.7)를 상회하고, 실시간 시각 인식(Real-Time) 평균 80.9, 회고적 추적(Backward Tracing) 평균 58.1 을 기록한다 (근거: Tab. 1). 주목할 점은 Backward Tracing 과제다. 이는 “과거 장면을 회상해야만” 풀 수 있는 회고 질문으로, ShallowStream의 얕은 검색이 실제로 과거 증거를 되살려내는지를 직접 검증하는 지표다. ShallowStream은 이 부문 평균 58.1로, OASIS(57.2)보다도 높다 (근거: Tab. 1).

효율성 — 연속 스트림 비용을 급격히 낮춤

정확도를 유지하면서 비용은 크게 내려간다. 핵심 지표는 per-frame prefill(스트림 처리의 1차 비용)과 10초 엔드투엔드 지연 이다 (근거: Fig. 1).

프레임당 prefill과 10초 구간 엔드투엔드 지연 — 기존 방법 대비 ShallowStream의 효율 우위

지표감소폭
Per-frame prefill최대 52.1배
10s end-to-end latency최대 11.9배

구체적인 수치도 명확하다 (근거: Tab. Appx):

측정 항목
Stream prefill ($$P=5$$)10.72 ms/frame
Stream prefill ($$P=19$$)15.53 ms/frame
Full query (매칭 LC-off)1.759 s/query
Gate92.7 ms/query
Evidence selection106.0 ms/query

$$P=5$$ 는 $$P=19$$ 대비 31.0% 더 적은 프레임당 prefill로 최고 정확도를 유지한다 (근거: Appx). 게이트와 증거 선택은 전체 쿼리 계산의 약 11% 만 차지할 뿐이다.

메모리 관점 에서도 장기 클러스터 압축(LC-on)을 켜면 64~1024 프레임 범위에서 피크 GPU 메모리가 약 18 GiB로 거의 평평하게 유지되는 반면, 비압축(LC-off)은 21.76 GiB까지 자란다. HERMES와 OASIS는 긴 프리픽스에서 더 많은 GPU 메모리를 요구한다 (근거: Fig. 4-left, §5).

실시간 헤드룸 관점 에서, 80초 질문 간격에서 ShallowStream은 약 2.6초 의 총 연산을 쓰는 반면, HERMES는 6.2초, OASIS는 50.4초 를 쓴다 (근거: Fig. 4-right, §5). 즉 ShallowStream만이 실시간 경계선 아래에서 안정적으로 동작한다.

게이트와 리트리버의 기여 (Ablation)

  • 게이트 는 회고 질문에만 선택적으로 검색을 활성화한다. Backward와 Real-Time 질문에서 라우팅 행동이 뚜렷이 달라, 검색이 “무차별적"이 아니라 “역사적 필요"를 따라간다는 것을 보여준다 (근거: Fig. 5-left, §5).
  • 토큰 보팅 은 pooled shallow Q-K나 독립 SigLIP 인코더보다 강한 증거 선택 신호를 제공하고, max-min 다양성 이 중복 선택을 억제해 추가 이득을 준다 (근거: Fig. 5-right, §5).

정성 사례에서도 이 효과가 드러난다. “빨간 체크무늬 러그는 어디에 있는가?” (정답 E)라는 질문에서, pooled Q-K는 유사한 주방 뷰만 반복 선택해 오답 B를 내지만, 토큰 보팅 + 다양성 선택은 방 전체의 상호보완적 뷰 를 선택해 정답 E를 맞힌다 (근거: Fig. 6, §5).


우리의 관점: 강점, 한계, 그리고 이 연구가 중요한 이유

강점

  • 모델 깊이라는 새로운 축 을 열었다. 기존의 효율화(토큰 프루닝, 병합, 양자화, 검색, offloading)는 모두 “토큰 수"나 “캐시 저장"을 건드렸지만, ShallowStream은 언제 전체 깊이를 실행할지 를 제어한다 (근거: §2, §4). 이는 기존 기법과 직교(orthogonal) 하므로 결합 가능성이 높다.
  • 추가 학습이 전혀 없다. 게이트도 프리트레인 모델의 로짓을 그대로 재사용할 뿐, 별도 라우터를 학습하지 않는다 (근거: §4.2). 어떤 오프라인 MLLM에도 붙일 수 있는 drop-in 방식이다.
  • 게이트 캘리브레이션이 벤치마크와 무관 하다. 평가 셋의 레이블을 쓰지 않고 합성 질문으로 임계값을 정해, 평가 편향을 피하려는 설계가 인상적이다 (근거: §4.2, Appx).

한계

  • “Work in Progress” 표기가 붙어 있어, 리뷰가 아직 미완성 단계임을 알 수 있다 (근거: 제목 footnote).
  • LLaVA 백본의 게이트 recall이 44.00% 로 낮다 (Qwen3-VL은 97.00%). 즉 LLaVA에서는 “과거가 필요하다"고 판단해야 할 질문의 절반 이상을 “최신으로 충분"으로 잘못 라우팅한다. 다만 precision-first 설계(정밀도 97.78%) 덕에 실제 검색 활성화는 신뢰할 만하다 (근거: Tab. Appx).
  • 장기 클러스터 압축은 근사(손실) 다. 클러스터 대표 1개만 소비하므로, 멤버 수준의 세밀한 증거는 복구되지 않는다. 비압축이 메모리에 맞을 때는 이 근사를 꺼둔다 (근거: §4.1). 즉 초장기 스트림에서 정확도가 얼마나 떨어지는지에 대한 직접 평가가 아직 부족하다.
  • 평가가 1 FPS 샘플링과 16 토큰 고정 생성 에 국한되어 있고, 단일 GPU(RTX 5090)에서 측정되었다 (근거: §5). 더 높은 프레임레이트·긴 생성·멀티 GPU 확장에서의 동작은 미검증이다.

왜 중요한가

스트리밍 비디오 이해는 “매초 들어오는 프레임” 이 일상이고 “드문 질문” 이 이벤트 인 도메인이다. 그렇다면 시스템 비용의 1차 항은 당연히 per-frame prefill이어야 하는데, 기존 연구들은 이 점을 일관되게 1급 비용으로 다루지 않았다 (근거: §1). ShallowStream은 “얕은 레이어로 검색은 충분하다"는 경험적 발견을 시스템 설계 원리로 승화시켜, 성능을 거의 희생하지 않고 연속 스트림 비용을 한 자릿수 이상 낮추는 운영점을 확립했다 (근거: Abstract, §6).


다음 단계는?: 앞으로의 길

저자들은 명시적으로 향후 방향을 길게 나열하지는 않지만, 논문의 구조와 한계에서 합리적인 다음 단계를 읽어낼 수 있다.

  • 게이트의 견고성 개선 — LLaVA처럼 recall이 낮은 백본에서의 라우팅을 개선하거나, 로짓 기반 게이트를 다른 온디맨드 방식(OASIS·WeaveTime)과 정량적으로 비교할 여지가 있다 (근거: §2, Appx).
  • 초장기 스트림에서의 압축-정확도 trade-off 정량화 — 장기 클러스터의 근사 손실이 누적될 때 정확도가 어떻게 변하는지, 비압축과의 정면 비교가 필요하다 (근거: §4.1).
  • 다른 효율화 기법과의 결합 — 토큰 프루닝·양자화·offloading과 ShallowStream의 깊이 제어는 직교하므로, 중첩 적용 시의 이득을 확인하는 것이 자연스러운 후속 연구다 (근거: §2).
  • 확장성 검증 — 1 FPS·RTX 5090·16 토큰 고정이라는 설정을 넘어, 고프레임레이트, 긴 생성, 멀티 GPU, 그리고 엣지 디바이스 배포에서의 동작을 확인할 필요가 있다 (근거: §5).

요약하면, ShallowStream은 “모든 프레임을 끝까지 읽어야 한다“는 암묵적 가정을 깨고, 스트리밍 비디오 이해에서 깊이를 미루는(deferred depth) 설계가 성능과 효율을 동시에 잡는 유효한 길임을 설득력 있게 보여준다. 얕게 인덱싱하고, 필요할 때만 깊게 답하는 것 — 직관적이지만 그동안 아무도 진지하게 밀어붙이지 않았던 아이디어다.

논문 원문의 표

arXiv e-print 의 LaTeX 원본에서 기계적으로 옮긴 표입니다. 숫자는 논문의 값이며 모델을 거치지 않았습니다.

표 1. Main implementation settings for the two evaluated backbones.

SettingQwen3-VL-8BLLaVA-OneVision-7B
Backbone and Stream Processing
Pruning boundary $P$54
Sampling rate, OVO / StreamingBench1 / 1 FPS1 / 1 FPS
Video unit2 frames1 frame
Stream prefill window64 units, 128 frames128 units, 128 frames
Query Routing
Gate promptten shotten shot
Gate calibration set200 shared query-only examples
Gate threshold $\tau_g$11.00.875
Evidence Selection and Generation
Query representationlast prompt token
Visual candidates per shallow layer64 tokens
Vote-ranked candidate pool32 historical units
Selected historical evidence8 units with max-min diversity
Temporal expansionone preceding unit per selected unit
Recent context, retrieval / recent-only6 / 2 units
Maximum new tokens16

표 2. Cost summary under the final calibrated Gate and token-vote retriever. Stream-time prefill is averaged over the same five long videos; query components use the matched full-history LC-off setting.

MeasurementSetting or componentCost
Stream-time prefill$P=1$$9.47$ ms/frame
$P=5$$10.72$ ms/frame
$P=19$$15.53$ ms/frame
Query-time computationFull query$1.759$ s/query
Gate$92.7$ ms/query
Evidence selection$106.0$ ms/query

표 3. Query-logit Gate calibration on the benchmark-independent query-only set.

Backbone$\tau_g$Precision95% lower boundRecall
Qwen3-VL-8B11.096.04%91.47%97.00%
LLaVA-OneVision-7B0.87597.78%90.63%44.00%

표 4. Main results on the OVO-Bench. Baseline results marked with $\ddagger$ are from our controlled reruns. Results marked with $\dagger$ enable long-cluster compression. Dashes indicate unreported entries.

\multirow[c]{2}{*}[-0.55ex]{Model / Method}\multirow[c]{2}{*}[-0.55ex]{#Frames}Real-Time Visual Perception OCRReal-Time Visual Perception ACRReal-Time Visual Perception ATRReal-Time Visual Perception STUReal-Time Visual Perception FPDReal-Time Visual Perception OJRReal-Time Visual Perception Avg.Backward Tracing EPMBackward Tracing ASIBackward Tracing HLDBackward Tracing Avg.Avg.
Open-source Online MLLMs
VideoLLM-online-8B2 fps8.123.912.114.045.521.220.822.218.812.217.719.3
Flash-VStream-7B1 fps25.532.129.333.729.728.829.936.433.85.925.427.6
Dispider-7B1 fps57.749.562.144.961.451.654.648.555.44.336.145.3
TimeChat-Online-7B1 fps75.246.870.747.869.361.461.955.959.59.741.751.8
StreamForest-7B1 fps68.553.271.647.865.460.961.258.964.932.352.056.6
Streamo-7B1 fps79.257.875.049.464.470.166.054.652.031.746.156.1
Offline-to-Online Methods
LLaVA-OneVision-7B3266.453.271.651.172.359.262.353.952.718.841.852.1
\quad + ReKV0.5 fps52.454.169.843.367.357.157.357.656.118.844.250.8
\quad + HERMES$^{\ddagger}$0.5 fps71.161.574.152.372.366.366.362.060.826.949.958.1
\quad + WeaveTime1 fps72.569.774.153.475.267.968.8
\quad + CausalMem0.5 fps71.861.576.748.976.266.865.7
\quad + SimpleStream$^{\ddagger}$477.271.675.952.377.271.771.053.252.043.649.660.3
\quad + ShallowStream (Ours)1 fps87.373.477.662.974.377.275.450.250.746.249.062.2
\quad + ShallowStream (Ours)$^{\dagger}$1 fps87.373.477.663.574.377.275.550.550.746.249.162.3
Qwen3-VL-8B6476.558.775.059.068.359.266.153.266.99.743.354.7
\quad + HERMES$^{\ddagger}$2 fps85.264.273.355.670.365.869.150.565.519.945.357.2
\quad + OASIS92.080.781.067.467.379.978.162.060.147.357.267.7
\quad + SimpleStream$^{\ddagger}$492.081.781.969.775.381.080.253.260.144.152.566.4
\quad + ShallowStream (Ours)1 fps92.083.582.871.975.379.980.952.572.349.558.169.5
\quad + ShallowStream (Ours)$^{\dagger}$1 fps92.083.582.871.976.279.981.051.271.050.057.469.2

표 5. Main results on the Real-Time Visual Understanding subset of StreamingBench. Baseline results marked with $\ddagger$ are from our controlled reruns. Results marked with $\dagger$ enable long-cluster compression. Dashes indicate unreported results.

\multirow[c]{2}{*}[-0.55ex]{Model / Method}\multirow[c]{2}{*}[-0.55ex]{#Frames}Real-Time Visual Understanding OPReal-Time Visual Understanding CRReal-Time Visual Understanding CSReal-Time Visual Understanding ATPReal-Time Visual Understanding EUReal-Time Visual Understanding TRReal-Time Visual Understanding PRReal-Time Visual Understanding SUReal-Time Visual Understanding ACPReal-Time Visual Understanding CTAvg.
Open-source Online MLLMs
Flash-VStream-7B25.943.624.923.927.313.118.525.223.948.723.2
VideoLLM-online-8B2 fps39.140.134.531.146.032.431.534.242.527.936.0
Dispider-7B1 fps74.975.574.173.174.459.976.162.962.245.867.6
TimeChat-Online-7B1 fps80.282.079.583.376.178.578.764.669.658.075.4
StreamForest-7B1 fps83.182.882.784.377.578.276.969.175.654.477.3
Offline-to-Online Methods
LLaVA-OneVision-7B3277.776.677.681.971.771.766.765.565.744.071.0
\quad + ReKV0.5 fps74.478.978.677.168.367.967.662.664.344.669.2
\quad + HERMES$^{\ddagger}$0.5 fps78.279.786.881.569.273.275.064.268.645.673.2
\quad + StreamKV1 fps74.778.187.779.470.867.670.464.664.045.171.0
\quad + WeaveTime1 fps71.581.386.878.675.273.272.269.168.844.772.1
\quad + SimpleStream$^{\ddagger}$480.471.985.285.576.173.869.465.571.137.373.5
\quad + LiveVLM0.5 fps79.879.784.980.767.170.174.166.368.042.571.3
\quad + CausalMem0.5 fps82.679.783.283.269.678.475.067.370.939.474.3
\quad + ShallowStream (Ours)1 fps82.867.283.990.871.781.964.870.774.835.275.5
\quad + ShallowStream (Ours)$^{\dagger}$1 fps82.867.283.990.872.381.964.870.774.835.275.6
Qwen3-VL-8B6480.475.083.083.574.284.477.863.869.757.075.9
\quad + SimpleStream$^{\ddagger}$479.372.789.984.873.679.183.371.176.839.476.5
\quad + HERMES$^{\ddagger}$2 fps79.077.381.484.273.677.987.070.772.561.176.6
\quad + ShallowStream (Ours)1 fps79.371.989.985.877.479.188.971.577.352.978.2
\quad + ShallowStream (Ours)$^{\dagger}$1 fps79.371.990.285.577.479.188.971.577.349.778.0

이 글의 그림은 arXiv:2609.02780 원본에서 가져왔습니다 (CC BY 4.0). 크기와 형식만 바꿨습니다.

라이선스

작성자: Jaehun Ryu

링크: https://jaehun.me/posts/shallowstream-index-shallow-then-answer-deep-for-streaming-video-understanding/

라이선스: CC BY 4.0

이 저작물은 크리에이티브 커먼즈 저작자표시 4.0 국제 라이선스에 따라 이용할 수 있습니다. 출처를 밝히면 상업적 목적을 포함해 자유롭게 이용 가능합니다.

댓글