StepAudio 3 Gen Technical Report
논문 링크 StepAudio 3 Gen: 이산 자회귀(RVQ) 하나로 음성·노래·음악·효과음을 통합하다한 줄 요약 (TL;DR)StepFun이 발표한 StepAudio 3 Gen 은 12.5 Hz 프레임률의 $16 \times 2048$ 잔차 벡터 양 …
논문 링크 StepAudio 3 Gen: 이산 자회귀(RVQ) 하나로 음성·노래·음악·효과음을 통합하다한 줄 요약 (TL;DR)StepFun이 발표한 StepAudio 3 Gen 은 12.5 Hz 프레임률의 $16 \times 2048$ 잔차 벡터 양 …
논문 링크 SAS: 증류 없이 문맥 랭킹을 직접 학습하는 단순한 어텐션 스파시피케이션TL;DR — 사후 학습(post-training) 어텐션 스파시피케이션에서, 선택기(selector)가 만든 연속 점수를 어텐션 로짓에 로그 게이트(log gate) …
논문 링크 Marigold V2: 이미지 편집 확산 트랜스포머(DiT)를 단안 깊이 추정기로 되살리기한 줄 요약 (TL;DR)Qwen-Image-Edit-2509라는 이미지 편집용 확산 트랜스포머(DiT)를 4-bit QLoRA로 파인튜닝해, 단일 …
논문 링크 SQS: 가지치기와 양자화를 하나의 베이지안 학습으로 — 스파이크-앤-슬랩과 GMM의 만남TL;DR — 프루닝(pruning)과 저비트 양자화(quantization)를 따로 하면 남는 잉여가 생긴다. SQS는 스파이크-앤-슬랩 사전분포와 …
논문 링크 X-AuT: 행동 프로브와 크로스스케일 증류로 음성 LLM의 오디오 인코더를 깎아내는 방법한 줄 요약 (TL;DR)음성 LLM의 오디오 인코더(오디오 Transformer)를 18→16→14 레이어로 점진적으로 프루닝 하면서, 짧은 행동 프 …
논문 링크 데드라인을 채우는 프리필 청크: SLOWeave — LLM 서빙의 적응형 청킹 스케줄러 TL;DR — 고정된 프리필 청크 크기 대신, 매 반복(iteration)마다 “가장 이른 디코드 데드라인 전에 끝나는 가장 큰 프리필 청크 …
논문 링크 SMELT: 계산량을 맞춘 MoE 루프 트랜스포머의 스케일링 법칙한 줄 요약 (TL;DR)루프 트랜스포머는 레이어 블록을 반복 실행해 깊이를 늘리지만, 기존 연구는 대부분 파라미터 수만 고정한 채 FLOPs를 늘려 “공짜 점수 …
![[논문리뷰] Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality](https://icml.cc/media/PosterPDFs/ICML%202024/32613.png)
논문 링크 같은 논문을 2024-12-24 에도 한 번 더 정리해 두었다. Structured State Space Duality: Mamba-2로 본 SSM↔Attention 통일과 2–8× 가속한 줄 요약 (TL;DR)SSD(Structured …
논문 링크 Massive Activations, Hidden Biases: 재해석된 Self-Attention의 비밀 한 줄 요약 (TL;DR)수천만 개 중 4–10 개의 초거대 스칼라(×10 000) 가 LLM · ViT의 성능을 사실상 ‘혼자서’ …
논문 링크 CODE I/O: 코드 입·출력 + 자연어 CoT로 범용 추론까지 — 데이터 설계만으로 7B-30B LLM을 평균 +2 점 끌어올리다TL;DR“코드 함수 → 입력·출력 예측 + 체계적 Chain-of-Thought(CoT)”라는 단일 데이터 …
논문 링크 한 줄 요약 (TL;DR)Loss-Free Balancing(LFB)은 auxiliary loss를 완전히 제거한 채, 전문가별 bias 한 줄 업데이트만으로 Mixture-of-Experts(MoE) 모델의 ‘로드 밸런스 ↔ 성능’ 딜레마 …