#549. AI 芯片究竟如何工作?GPU/TPU 的底层设计
AI芯片通过底层电路设计实现高效矩阵运算,核心在于multiply-accumulate操作与systolic array架构,数据移动成本远高于计算本身。
入选理由:低精度计算(如FP4/FP8)带来平方级性能提升
概念
别名:Floating Point 8
低精度计算格式
已跟踪 5 条高相关材料
最近变化
2026-08-04 · Ling-3.0-flash开源权重支持BF16和FP8两种量化格式
为什么值得关注
FP8 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
#549. AI 芯片究竟如何工作?GPU/TPU 的底层设计
跨国串门儿计划 · 9.2 分
AI芯片通过底层电路设计实现高效矩阵运算,核心在于multiply-accumulate操作与systolic array架构,数据移动成本远高于计算本身。
蚂蚁百灵发布Ling-3.0-flash开源权重
AI HOT 精选 · 8.5 分
蚂蚁百灵发布Ling-3.0-flash开源权重,提供BF16和FP8量化版本以适应不同硬件需求。
The Secret to Cheaper LLM Inference: NVFP4
NVIDIA Developer · 8.5 分
NVFP4通过4位量化技术降低大模型内存占用,在保持质量前提下提升推理效率,使更大模型或更高并发成为可能。
已收录 5 条与 FP8 相关的内容,按评分排序。
AI芯片通过底层电路设计实现高效矩阵运算,核心在于multiply-accumulate操作与systolic array架构,数据移动成本远高于计算本身。
入选理由:低精度计算(如FP4/FP8)带来平方级性能提升
蚂蚁百灵发布Ling-3.0-flash开源权重,提供BF16和FP8量化版本以适应不同硬件需求。
入选理由:Ling-3.0-flash开源权重支持BF16和FP8两种量化格式
NVFP4通过4位量化技术降低大模型内存占用,在保持质量前提下提升推理效率,使更大模型或更高并发成为可能。
入选理由:NVFP4量化格式可减少模型内存占用达50%以上
GLM 5.2 是一个新发布的开源模型,性能接近 Anthropic 和 OpenAI 的模型,且已开放权重。
入选理由:GLM 5.2 已发布完整版和 FP8 版本的权重。
Ideogram开源了fp8和nf4模型检查点,nf4版本可在单块24GB GPU上运行。
入选理由:Ideogram开源了fp8和nf4模型检查点。