Helion on TPU: Towards Hardware Heterogeneous Kernel Authoring
Helion通过高级DSL和自动调优,使TPU内核开发更高效,性能达838 TFLOPs。
入选理由:Helion生成的TPU内核在flash attention任务中达到838 TFLOPs,接近79%的MFU。
概念
用于注意力机制的高效计算方法。
已跟踪 3 条高相关材料
最近变化
2026-07-23 · Helion生成的TPU内核在flash attention任务中达到838 TFLOPs,接近79%的MFU。
为什么值得关注
Flash Attention 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Helion on TPU: Towards Hardware Heterogeneous Kernel Authoring
PyTorch Blog · 8.5 分
Helion通过高级DSL和自动调优,使TPU内核开发更高效,性能达838 TFLOPs。
The First Real LLM Breakthrough Is Here... SubQ (1000x Less Compute)
TheAIGRID · 8.5 分
SubQ 是首个基于完全次二次稀疏注意力架构的大型语言模型,其计算成本降低 1000 倍,上下文窗口达 1200 万 token。
YC and Together AI are partnering to bring the first dedicated YC GPU cluster online, giving YC star...
Y Combinator(@ycombinator) · 6.5 分
Y Combinator与Together AI合作建立GPU集群,为初创公司提供更便捷的计算资源,但技术细节和工程实践指导不足。
已收录 3 条与 Flash Attention 相关的内容,按评分排序。
Helion通过高级DSL和自动调优,使TPU内核开发更高效,性能达838 TFLOPs。
入选理由:Helion生成的TPU内核在flash attention任务中达到838 TFLOPs,接近79%的MFU。
SubQ 是首个基于完全次二次稀疏注意力架构的大型语言模型,其计算成本降低 1000 倍,上下文窗口达 1200 万 token。
入选理由:SubQ 的上下文窗口达到 1200 万 token,是 Opus 的 52 倍。
Y Combinator与Together AI合作建立GPU集群,为初创公司提供更便捷的计算资源,但技术细节和工程实践指导不足。
入选理由:YC与Together AI合作建立首个专用GPU集群,服务8000+客户