Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers
Apple Machine Learning Research631 字 (约 3 分钟)
85
苹果提出基于解耦时间深度扩散变换器的音频合成架构,实现21MB内存下10ms/步的实时音频生成,MOS评分提升0.28。
入选理由:单个深度解码器替代多级解码器,内存复杂度恒定为21MB
精选文章#Diffusion Transformers#RVQ#音频合成#苹果#AMX英文