From CUDA to MLX: How K-Search Brings Decades of Kernel Expertise to Apple Silicon
K-Search框架实现CUDA到MLX的自动转换,使Apple Silicon性能接近专家优化水平,Attention和Mamba SSM内核分别提升0.97x和20x。
入选理由:K-Search框架实现CUDA到MLX的自动转换,无需人工重写内核
概念
别名:attention mechanism
Transformer模型中的核心机制
已跟踪 2 条高相关材料
最近变化
2026-07-29 · K-Search框架实现CUDA到MLX的自动转换,无需人工重写内核
为什么值得关注
Attention 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
From CUDA to MLX: How K-Search Brings Decades of Kernel Expertise to Apple Silicon
BAIR Blog · 8.5 分
K-Search框架实现CUDA到MLX的自动转换,使Apple Silicon性能接近专家优化水平,Attention和Mamba SSM内核分别提升0.97x和20x。
Kimi founder and XLNet co-creator, Zhilin Yang: "Adam was invented in 2014, and now we have Muon Clip as a drop-in replacement. Attention was invented over eight years ago, and now we have Kimi Linear. Residual connections are now also challenged with attention residue." Three foundations of modern deep learning, all being replaced in the same generation of models. 39 minutes of pure insight from the architect behind Kimi, one of the most watched open models on earth right now. His team scaled Muon to o
God of Prompt(@godofprompt) · 8.5 分
Kimi模型团队在GTC keynote中展示了万亿参数模型、线性注意力机制和注意力残差技术,显著提升效率和性能。
已收录 2 条与 Attention 相关的内容,按评分排序。
K-Search框架实现CUDA到MLX的自动转换,使Apple Silicon性能接近专家优化水平,Attention和Mamba SSM内核分别提升0.97x和20x。
入选理由:K-Search框架实现CUDA到MLX的自动转换,无需人工重写内核
Kimi模型团队在GTC keynote中展示了万亿参数模型、线性注意力机制和注意力残差技术,显著提升效率和性能。
入选理由:Kimi Linear线性注意力机制全面超越传统注意力机制