StepAudio 3 Gen Technical Report
Paper StepAudio 3 Gen: Unifying Speech, Song, Music, and Sound Effects with a Single Discrete Autoregressive (RVQ) ModelTL;DRStepAudio 3 …
5 min
Multimodal Learning
Large Language Models
Transformer
Audio Generation
Text-to-Speech
Reinforcement Learning