T
traeai
登录

模型

TLX

别名:triton language extensions

Meta开发的自定义GPU编译器优化方案。

已跟踪 3 条高相关材料

TraeAI 观察

相关材料

已收录 3 条与 TLX 相关的内容,按评分排序。

FBTriton Infra: Upstream Ingestion, Hierarchical Validation, Ideals vs Realities

Meta通过fbtriton基础设施实现与上游Triton的同步,结合分层验证框架管理GPU优化创新,解决代码冲突与验证难题。

入选理由:使用agentic ingestion机制实现上游代码自动分类合并,降低冲突风险。

精选文章#Triton#GPU优化#代码同步#验证框架中英混合
Towards Free Normalization: Fusing Normalization into GEMM and Attention Kernels

PyTorch通过融合归一化操作到GEMM和注意力内核,实现高达35%的性能提升,减少内存IO开销。

入选理由:Lazy Pre-Norm和Multi-CTA Norm Fusion技术可隐藏90%的归一化延迟

精选文章#PyTorch#深度学习优化#归一化#GEMM#注意力机制英文
Triton Plugin Extensions: Enabling TLX and Custom Compiler Passes Out of the Box

PyTorch 3.7引入Triton Plugin Extensions,支持动态加载自定义编译器传递,无需分叉Triton,性能匹配厂商库。

入选理由:Triton Plugin Extensions允许动态加载自定义编译器传递,无需分叉或重新编译。

精选文章#PyTorch#Triton#编译器优化#GPU内核英文

跨材料问答 · TLX

回答基于:TLX 相关 3 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容