Apple Machine Learning Research

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

8.5内容质量

TL;DR · AI 摘要

苹果提出基于解耦时间深度扩散变换器的音频合成架构,实现21MB内存下10ms/步的实时音频生成,MOS评分提升0.28。

核心要点

  • 单个深度解码器替代多级解码器,内存复杂度恒定为21MB
  • 因果滑动窗口注意力实现序列长度无关的常数内存消耗
  • MOS评分提升0.28,对话场景提升0.42

结构提纲

按章节快速跳转。

  1. 介绍苹果Siri Expressive Voices的音频合成需求与挑战。

  2. 提出解耦时间深度扩散变换器的三组件设计框架。

  3. 因果滑动窗口注意力与固定窗口键值缓存实现内存优化。

  4. 验证架构在MOS评分与生成速度上的显著提升。

  5. 架构已部署于AFM 3 Core Advanced实现实时语音合成。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 解耦时间深度扩散变换器
    • 架构设计
      • 三组件设计(流式编码器/时间解码器/深度解码器)
      • RVQ表示转换
    • 关键技术
      • 因果滑动窗口注意力
      • 固定窗口键值缓存
    • 应用效果
      • 21MB内存下10ms/步生成
      • MOS评分提升0.28

金句 / Highlights

值得收藏与分享的关键句。

#Diffusion Transformers#RVQ#音频合成#苹果#AMX
打开原文

采用解耦时序深度扩散变换器的高效音频合成 - 苹果机器学习研究

研究领域

方法与算法

,

语音与自然语言处理

内容类型

论文

发布日期

2026年7月

采用解耦时序深度扩散变换器的高效音频合成

作者:Dongseong Hwang*, Prasanth Yadla*, Kaan Elgin*, Shifas Padinjaru Veettil, Sivanand Achanta, Dipjyoti Paul, Ramya Rasipuram, Tyler Johnson, Emad Soroush, Chung-Cheng Chiu, Zhifeng Chen

查看出版物

复制Bibtex

Siri Expressive Voices通过AFM 3 Core Advanced(苹果最强大的设备端基础模型)实时在设备上生成丰富且可配置的语音。这项工作展示了实现该能力的高效音频合成架构:一个解码器,它能在苹果矩阵协处理器(AMX)的严格计算和内存预算内,将基础模型生成的语义音频标记转换为高保真音频。我们通过包含三个组件的设计——流式编码器、时序解码器和深度解码器——将时序处理与深度处理系统性解耦,将语义音频标记转换为残差向量量化(RVQ)表示。单个可复用的深度解码器通过具有扩散变换器(DiT)风格阶段条件的架构自回归生成所有RVQ层级,取代了先前多解码器架构中每个层级的专用解码器,同时因果滑动窗口注意力结合固定窗口键值缓存实现了与序列长度无关的恒定内存复杂度。部署在AMX上时,该解码器每生成步骤仅需约10毫秒——比实时速度快约16倍——峰值运行内存仅约21MB,设备端资产占用329MB,可与设备端基础模型协同实现20至320秒音频的连续流式合成。这种恒定的小型内存占用替代了传统基于Transformer和GAN方法的线性及二次内存扩展。全面的消融研究验证了关键架构组件的有效性,包括DiT条件机制、时序前瞻处理和统一深度解码策略。通过音素可区分性分析、感知质量指标和神经质量评估的音频质量评估确认,所提出的架构在保持合成保真度的同时,相比现有方法实现了计算效率的提升。该架构已作为Siri Expressive Voices的一部分投入生产,为苹果设备中的Pace和Expressivity自定义滑块功能提供语音 overhaul 支持,并支持自定义助手语音。在AFM 3 Core Advanced中以10亿参数激活规模运行,该架构使平均意见得分(MOS)整体提升+0.28(4.15 vs. 3.87),对话语音提升+0.42(4.24 vs. 3.82),优于先前的设备端文本到语音系统。

  • * 贡献相同

相关阅读与更新

苹果基础模型第三代发布

2026年6月8日

我们的下一代苹果智能以用户为中心,深度集成到操作系统中,由以隐私为核心的新架构驱动。

在这一架构的核心是我们的第三代苹果基础模型(AFM),这是苹果与谷歌合作定制开发的五款基础模型家族。这些模型覆盖了从设备端模型到基于私有云计算(Private Cloud Compute)运行的服务器端模型……

阅读更多

Siri的语音触发系统

2023年8月11日 研究领域 语音与自然语言处理

越来越多的消费设备(包括智能音箱、耳机和手表)开始以语音作为主要用户输入方式。因此,语音触发检测系统——一种利用语音识别技术控制设备或功能访问权限的机制——已成为用户交互流程中的重要组成部分,因为它们标志着用户与设备之间交互的开始。由于这些系统完全在设备端部署,其设计需要考虑多个因素,如隐私保护、延迟控制、识别准确率和功耗表现。

在机器学习领域发现机遇

我们的机器学习研究每天都在取得突破性进展。

与我们合作