StepAudio 3 Gen Technical Report
논문 링크 StepAudio 3 Gen: 이산 자회귀(RVQ) 하나로 음성·노래·음악·효과음을 통합하다한 줄 요약 (TL;DR)StepFun이 발표한 StepAudio 3 Gen 은 12.5 Hz 프레임률의 $16 \times 2048$ 잔차 벡터 양 …
6분
Multimodal Learning
Large Language Models
Transformer
Audio Generation
Text-to-Speech
Reinforcement Learning