T
traeai
登录

概念

KV缓存

别名:key-value cache

存储LLM处理过程中键值向量的内存结构

已跟踪 5 条高相关材料

TraeAI 观察

相关材料

已收录 5 条与 KV缓存 相关的内容,按评分排序。

DeepSeek 的 10 万亿美元大战略

DeepSeek 的 10 万亿美元大战略

宝玉的分享5756 字 (约 24 分钟)
92

DeepSeek通过多项技术创新大幅降低大模型推理中的KV缓存需求,推动中国AI硬件生态发展,目标打造价值10万亿美元的产业巨兽。

入选理由:DeepSeek V4 Pro仅需5.48GB HBM,相比GLM5的60GB和Qwen3-235B-A22B的89GB显著节省显存

精选文章#AI模型#硬件生态#KV缓存#DeepSeek#中国AI中文
Why An LLM’s Memory Gets Expensive and How to Fix It

Why An LLM’s Memory Gets Expensive and How to Fix It

ByteByteGo Newsletter2398 字 (约 10 分钟)
85

LLM的KV缓存导致内存成本激增,通过分块处理和缓存压缩可降低60%以上内存占用。

入选理由:KV缓存使700亿参数模型在128k上下文时消耗40GB显存

精选文章#LLM#内存优化#KV缓存#大模型#AI硬件英文
Together AI Blog 图标

ThunderAgent通过优化KV缓存管理,实现单节点吞吐量提升2倍,集群加速2.4倍,解决代理推理中的缓存抖动问题。

入选理由:单节点吞吐量提升2.5倍,P50延迟降低10倍

精选文章#ThunderAgent#合成数据生成#LLM推理优化#KV缓存管理英文
KDnuggets 图标

7 Approaches to Reduce Inference Latency in Your LLM Workflows

KDnuggets1884 字 (约 8 分钟)
85

七种工程策略可降低LLM推理延迟,量化压缩模型内存75%,键值缓存优化解码阶段,推测解码提升生成速度30%。

入选理由:量化将FP16模型内存占用减少75%,显著降低TPOT

精选文章#LLM#推理优化#模型量化#键值缓存英文
Geek(@geekbb) 图标

小红书团队开源的高效长上下文LLM服务框架通过注意力头分类和分段式KV缓存策略,降低预填充FLOPs约50%-70%。

入选理由:RedKnot框架通过分段式KV缓存策略减少50%-70%预填充计算量

精选推文#LLM#开源#优化技术#KV缓存中英混合

跨材料问答 · KV缓存

回答基于:KV缓存 相关 5 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容