StepAudio 3 Gen Technical Report
논문 링크 StepAudio 3 Gen: 이산 자회귀(RVQ) 하나로 음성·노래·음악·효과음을 통합하다한 줄 요약 (TL;DR)StepFun이 발표한 StepAudio 3 Gen 은 12.5 Hz 프레임률의 $16 \times 2048$ 잔차 벡터 양 …
논문 링크 StepAudio 3 Gen: 이산 자회귀(RVQ) 하나로 음성·노래·음악·효과음을 통합하다한 줄 요약 (TL;DR)StepFun이 발표한 StepAudio 3 Gen 은 12.5 Hz 프레임률의 $16 \times 2048$ 잔차 벡터 양 …
논문 링크 SAS: 증류 없이 문맥 랭킹을 직접 학습하는 단순한 어텐션 스파시피케이션TL;DR — 사후 학습(post-training) 어텐션 스파시피케이션에서, 선택기(selector)가 만든 연속 점수를 어텐션 로짓에 로그 게이트(log gate) …
논문 링크 SQS: 가지치기와 양자화를 하나의 베이지안 학습으로 — 스파이크-앤-슬랩과 GMM의 만남TL;DR — 프루닝(pruning)과 저비트 양자화(quantization)를 따로 하면 남는 잉여가 생긴다. SQS는 스파이크-앤-슬랩 사전분포와 …
논문 링크 X-AuT: 행동 프로브와 크로스스케일 증류로 음성 LLM의 오디오 인코더를 깎아내는 방법한 줄 요약 (TL;DR)음성 LLM의 오디오 인코더(오디오 Transformer)를 18→16→14 레이어로 점진적으로 프루닝 하면서, 짧은 행동 프 …
논문 링크 비디오 LLM은 왜 아직도 비싼가? — 추론 효율화 메커니즘 4단계 총정리TL;DR — 이 논문은 2022년 말부터 2026년 8월까지 발표된 VideoLLM 추론 효율화 연구 125편을 엔코더–커넥터–LLM 파이프라인의 4단계로 분류하고, …
논문 링크 Miles v0.1: 프론티어 RL 사후학습을 위한 “검증·청결·확장 가능"한 풀스택 시스템TL;DR : Miles는 rolluout 생성과 트레이닝이 서로 다른 엔진·커널·정밀도로 돌아가며 발생하는 …
논문 링크 Peri-LayerNorm: Post-LN와 Pre-LN을 넘어서는 세 번째 선택지한 줄 요약 (TL;DR)Residual 직후에 LayerNorm을 한 번 더 넣는 “Peri-LayerNorm(Peri-LN)” 구조만으로 — 400 …
논문 링크 Janus-Pro 7B: Dual-Encoder Multimodal LLM That Outsmarts Bigger Models한 줄 요약 (TL;DR)SigLIP 이해 인코더 + VQ 생성 인코더를 완전히 분리한 뒤 7 B 파라미터 LLM에 …
논문 링크 한 줄 요약 (TL;DR)Fire-Flyer 2는 1만 대의 PCIe A100 GPU를 HFReduce·HaiScale 스택으로 묶어 DGX-A100의 80 %대 성능을 장비·전력 40 % 절감으로 달성한 ‘가성비형 초대규모 LLM 훈련 클 …
논문 링크 한 줄 요약 (TL;DR)STAND (STochastic Adaptive N-gram Drafting)은 추가 학습이나 별도 드래프트 모델 없이도 대규모 LLM의 테스트-타임 스케일링(Test-Time Scaling)을 가속한다. 표준 오토 …
논문 링크 ⚡️TL;DRKVzip는 LLM의 KV 캐시를 한 번 압축해도 이후 모든 질의 · 세션에서 재사용할 수 있도록 설계된 query-agnostic 캐시 컴프레서다. 그 결과 정확도 손실 ≤ 3 pp를 유지하면서 레이턴시 2 × ↓, 메모리 …