Apple Machine Learning Research

Accelerating Text-to-Video Generation with Calibrated Sparse Attention

8.5内容质量

TL;DR · AI 摘要

Apple提出CalibAtt方法,通过校准稀疏注意力机制实现视频生成加速,最高达1.58倍。

核心要点

  • CalibAtt方法在Wan 2.1 14B等模型上实现最高1.58倍端到端加速
  • 离线校准阶段可识别跨输入稳定的块级稀疏模式
  • 该方法在保持视频生成质量的同时无需额外训练

结构提纲

按章节快速跳转。

  1. 指出扩散模型在视频生成中的计算瓶颈问题

  2. 揭示token-to-token连接中存在大量可忽略的低分连接模式

  3. 通过离线校准生成优化的稀疏注意力操作

  4. 在多个模型上实现1.58倍加速且保持生成质量

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Calibrated Sparse Attention
    • 问题定义
      • 扩散模型计算瓶颈
    • 核心方法
      • 离线校准
      • 稀疏注意力优化
    • 实验结果
      • 1.58倍加速
      • 质量保持

金句 / Highlights

值得收藏与分享的关键句。

#Computer Vision#Transformer#视频生成#注意力机制
打开原文

通过校准稀疏注意力加速文本到视频生成 - 苹果机器学习研究

研究领域

计算机视觉

会议

ECCV

内容类型

论文

发布日期

2026年7月

通过校准稀疏注意力加速文本到视频生成

作者 Shai Yehezkel†**, Shahar Yadin, Noam Elata, Yaron Ostrovsky-Berman, Bahjat Kawar

查看出版物

复制Bibtex

近年来,扩散模型实现了高质量的视频生成,但存在运行速度慢的问题。这些模型中使用的大型基于Transformer的主干网络受到时空注意力的限制。在本文中,我们发现大量token到token的连接在各种输入中始终产生可忽略的分数,且它们的模式在查询中经常重复。因此,在这些情况下,可以跳过注意力计算而对结果影响极小。这一观察对于局部token块之间的连接同样适用。受此启发,我们引入了CalibAtt(校准稀疏注意力),这是一种无需训练的方法,通过校准稀疏注意力加速视频生成。CalibAtt执行离线校准过程,识别在不同输入中稳定的块级稀疏性和重复模式,并为每一层、每个注意力头和扩散时间步编译优化的注意力操作。在推理时,我们密集计算选定的输入相关连接,以硬件高效的方式跳过未选定的连接。在Wan 2.1 14B、Mochi 1和不同分辨率下的少量步骤蒸馏模型上的大量实验表明,CalibAtt实现了高达1.58倍的端到端加速,在保持视频生成质量和文视频对齐的同时,优于现有的无训练方法。

  • â€特拉维夫大学
  • **在苹果工作期间完成的研究

相关阅读和更新

VideoFlexTok:灵活长度的粗到细视频分词

2026年7月2日 研究领域 计算机视觉 会议 ICML

视觉分词器将高维原始像素映射到压缩表示以供下游建模。除了压缩之外,分词器还决定了保留哪些信息以及如何组织这些信息。视频分词的公认标准方法是将视频表示为时空3D网格的token,每个token捕获原始信号中对应的局部信息。这要求下游模型消耗的...

阅读更多

STARFlow-V:使用归一化流的端到端视频生成建模

2026年4月30日 研究领域 计算机视觉 , 研究领域 方法和算法 会议 CVPR

归一化流(NFs)是针对连续数据的端到端基于似然的生成模型,最近在图像生成方面取得了令人鼓舞的进展,重新受到关注。然而在视频生成领域,时空复杂性和计算成本显著更高,最先进的系统几乎完全依赖于扩散模型。在本工作中,我们通过提出STARFlow-V重新审视这一设计空间,...

发现机器学习领域的机遇

我们的机器学习研究每天都在取得新突破。

与我们合作 /think