From CUDA to MLX: How K-Search Brings Decades of Kernel Expertise to Apple Silicon
K-Search框架实现CUDA到MLX的自动转换,使Apple Silicon性能接近专家优化水平,Attention和Mamba SSM内核分别提升0.97x和20x。
入选理由:K-Search框架实现CUDA到MLX的自动转换,无需人工重写内核
概念
苹果设备上的机器学习框架
已跟踪 6 条高相关材料
最近变化
2026-08-12 · MLX支持由Prince_Canuma贡献,允许在Apple设备快速运行模型
为什么值得关注
MLX 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
From CUDA to MLX: How K-Search Brings Decades of Kernel Expertise to Apple Silicon
BAIR Blog · 8.5 分
K-Search框架实现CUDA到MLX的自动转换,使Apple Silicon性能接近专家优化水平,Attention和Mamba SSM内核分别提升0.97x和20x。
Viability of local models for coding
Martin Fowler · 8.5 分
本地AI模型在编码场景中具备可行性,但受硬件资源和工具链限制,需权衡模型规模与性能表现。
Fine-tuning Language Models on Apple Silicon with MLX
KDnuggets · 8.5 分
使用 MLX 框架可在 Apple Silicon 上本地微调语言模型,无需云 GPU 或成本。
已收录 6 条与 MLX 相关的内容,按评分排序。
K-Search框架实现CUDA到MLX的自动转换,使Apple Silicon性能接近专家优化水平,Attention和Mamba SSM内核分别提升0.97x和20x。
入选理由:K-Search框架实现CUDA到MLX的自动转换,无需人工重写内核
本地AI模型在编码场景中具备可行性,但受硬件资源和工具链限制,需权衡模型规模与性能表现。
入选理由:15-25GB模型在Apple M3 Max/M5 Pro设备上运行时,RAM是核心性能瓶颈
使用 MLX 框架可在 Apple Silicon 上本地微调语言模型,无需云 GPU 或成本。
入选理由:MLX 是专为 Apple Silicon 设计的开源数组库,支持本地微调语言模型。
Cohere宣布通过MLX支持在Apple设备上运行模型,并与合作伙伴合作优化边缘设备的文档理解。
入选理由:MLX支持由Prince_Canuma贡献,允许在Apple设备快速运行模型
Ollama宣布Gemma 4模型在MLX平台实现多令牌预测优化,但推文内容未展开技术细节。
入选理由:Gemma 4模型在MLX平台实现多令牌预测优化
Cohere宣布对North Mini Code 1.0模型提供MLX支持,该模型参数量为30B,运行速度达66 tok/s。
入选理由:North Mini Code 1.0是一个30B参数的MoE模型,拥有3B活跃参数。