게시글

기술과 일상에 대한 글 목록입니다.

546페이지
1 / 91

Who Pays for the KV Cache? Attributing Shared AI Inference Spend Across Kubernetes and LLM Provider Bills

논문 링크 KV 캐시 비용은 누가 내는가? — 쿠버네티스·게이트웨이·프로바이더 청구서를 하나의 장부로 TL;DR — 같은 AI 기능 한 건에 드는 비용은 쿠버네티스 할당, 게이트웨이 로그, 프로바이더의 토큰 단위 청구서라는 서로 연결되지 않은 세 장부 …

15분
KV Cache Prefix Caching LLM Inference vLLM Distributed Computing Tensor Parallelism

SPECTRA: Adaptive Execution of Speculative Decoding on a Runtime-Reconfigurable Tiled Architecture

논문 링크 SPECTRA: 추론 단계가 바뀔 때마다 하드웨어도 옷을 갈아입는 재구성 가능 LLM 가속기한 줄 요약 (TL;DR)스펙큘레이티브 디코딩은 프리필(연산 바운드 GEMM)·디코드(메모리 바운드 GEMV)·그 사이의 병렬 검증을 오가며 산술 강 …

13분
Speculative Decoding Hardware Architecture Efficient Inference LLM Inference Inference Acceleration Transformer