T
traeai
登录

概念

Flash Attention

用于注意力机制的高效计算方法。

已跟踪 3 条高相关材料

TraeAI 观察

相关材料

已收录 3 条与 Flash Attention 相关的内容,按评分排序。

Helion on TPU: Towards Hardware Heterogeneous Kernel Authoring

Helion on TPU: Towards Hardware Heterogeneous Kernel Authoring

PyTorch Blog2268 字 (约 10 分钟)
85

Helion通过高级DSL和自动调优,使TPU内核开发更高效,性能达838 TFLOPs。

入选理由:Helion生成的TPU内核在flash attention任务中达到838 TFLOPs,接近79%的MFU。

精选文章#PyTorch#TPU#DSL#性能优化英文
The First Real LLM Breakthrough Is Here...  SubQ (1000x Less Compute)

The First Real LLM Breakthrough Is Here... SubQ (1000x Less Compute)

TheAIGRID2793 字 (约 12 分钟)
85

SubQ 是首个基于完全次二次稀疏注意力架构的大型语言模型,其计算成本降低 1000 倍,上下文窗口达 1200 万 token。

入选理由:SubQ 的上下文窗口达到 1200 万 token,是 Opus 的 52 倍。

精选视频#LLM#SubQ#AI#稀疏注意力#计算效率英文

跨材料问答 · Flash Attention

回答基于:Flash Attention 相关 3 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容