A Guide to Saving Token Usage with Multi-Agent AI
TL;DR · AI 摘要
通过四策略优化多智能体AI的token使用,显著降低计算成本。静态缓存、语义复用、工具响应缓存和动态指令调整可减少30%-50%的token消耗。
核心要点
- 静态指令缓存可减少重复处理,节省40%的token成本
- 语义缓存通过意图匹配复用历史响应,降低50%重复计算
- 工具响应缓存避免重复生成,节省30%计算资源
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 多智能体AI token优化策略
- 静态指令缓存
- 前缀匹配技术
- 减少重复处理
- 语义缓存
- 嵌入向量匹配
- 意图复用
- 工具响应缓存
- 结果存储
- 避免重复生成
金句 / Highlights
值得收藏与分享的关键句。
静态缓存通过存储系统指令减少重复处理,可降低40%的token成本。
语义缓存利用嵌入向量匹配相似意图,使不同用户问题可复用历史响应。
工具响应缓存避免重复调用工具生成结果,节省30%计算资源。
如何通过多智能体AI节省Token使用量 - KDnuggets
publ: 2026年8月3日
- 博客热门文章
- 主题 人工智能 职业建议 计算机视觉 数据工程 数据科学 语言模型 机器学习 MLOps NLP 编程 Python SQL
- 数据集
- 活动
- 资源 快速参考指南 推荐 技术简报
- 广告
订阅简报
#header end
/ad_wrapper
如何通过多智能体AI节省Token使用量
如果了解如何正确实施以下四种节省Token使用量的策略,那么扩展和优化多智能体架构并不必然导致成本上升。
作者:
Iván Palomares Carrascosa,KDnuggets技术内容专家,2026年8月3日发布于
人工智能
<div class="addthis_native_toolbox"></div>
# 引言
当多个AI智能体串联协作处理复杂工作流时,Token(文本元素或单位)的数量可能迅速激增。从内存日志到详细的工具规格、系统指令等,所有内容都会累积。最终这会导致执行速度下降和计算预算耗尽。
因此,对于当今的AI开发者和从业者来说,管理Token使用量至关重要。好消息是:如果知道如何正确实施节省Token使用量的策略,扩展和优化多智能体架构并不必然导致成本同比上升。本文将介绍并演示其中四种有效策略。
# 节省Token使用的四大核心策略
以下是四种常见最佳实践,可在优化Token使用的同时简化多智能体AI解决方案。
多智能体AI系统中节省Token使用的策略
#### // 1. 使用静态指令缓存(前缀匹配缓存)
将这个策略视为"不要重复自己"原则。大型语言模型(LLMs)作为现代AI智能体不可或缺的组成部分,在连续交互中会耗费大量计算资源重复阅读相同的系统提示。前缀缓存通过存储键值对来解决这个问题,它将这些静态的长指令作为预先准备好的参考指南进行存储。当模型接收到查询时,它会将"如何作为该智能体行动"的完整操作手册进行摘要标记。在后续交互中,模型只需打开该标记,直接处理新提示即可。这样显著减少了准备阶段的延迟,也大幅降低了相关的Token成本。
#### // 2. 使用语义缓存:基于意图的召回
如果AI智能体之前已经解决过特定问题,为什么还要让它从零开始生成全新响应?该策略利用嵌入(文本的数值化向量表示,能够"保留"语义特性)快速识别相似的历史意图。例如,通过语义缓存,两个不同用户的提示"如何重置我的路由器?"和"重启我的WiFi盒子的步骤是什么?"会被识别为相同意图。在某些情况下,这甚至可以完全绕过LLM,同时仍提供正确答案。
#### // 3. 使用即时工具调用
也称为延迟加载,这种技术旨在解决AI代理构建中的一个常见陷阱:在上下文窗口前端加载大量"参考手册",包含其可访问的每个API、工具和数据库模式。当然,这会导致提示信息臃肿嘈杂且消耗大量token。相反,为什么不给代理一个简洁的高层能力目录呢?只有当代理识别出某个特定时刻需要执行的具体任务时,才会触发获取该特定工具所需的详细参数和指令。
#### // 4. 使用任务升级:成本效益模型路由
并非所有用户提示都需要使用大型重型模型来妥善处理。有效的多代理AI架构被设计为分诊中心,具备能够根据任务性质和复杂度进行分析的路由层。因此,格式化数据、文本摘要或意图分类等简单任务会被路由到轻量级模型,这些模型通常免费且能够本地成功执行这些任务。同时,计算密集型且token消耗显著的重型模型则"专用于"需要深度推理或多步骤协调的复杂任务。
import numpy as np
from sentence_transformers import SentenceTransformer
# 加载一个免费的本地模型,将文本转换为嵌入向量
embedder = SentenceTransformer('all-MiniLM-L6-v2')
# 内存语义缓存和相似度阈值(0.90 = 90% 相似)
semantic_cache = {}
SIMILARITY_THRESHOLD = 0.90
def cosine_similarity(vec1, vec2):
"""计算两个查询之间的相关程度。"""
return np.dot(vec1, vec2) / (np.linalg.norm(vec1) * np.linalg.norm(vec2))
def route_and_respond(user_query):
# 1. 将当前查询转换为嵌入向量
query_vector = embedder.encode(user_query)
# 2. 语义缓存:检查是否最近解决了类似的问题
for cached_vector, past_response in semantic_cache.values():
if cosine_similarity(query_vector, cached_vector) >= SIMILARITY_THRESHOLD:
return f"[从缓存中获取] {past_response}"
# 3. 模型路由:根据任务复杂度进行分类
# 简单任务路由到免费的本地模型(例如通过 Ollama 的 Llama 3)
# 此路由逻辑仅为示例,不适用于生产环境
if "summarize" in user_query.lower() or len(user_query) < 100:
response = call_free_local_agent(user_query)
else:
# 复杂的多步骤推理升级到更大的编排代理
response = call_heavy_reasoning_agent(user_query)
# 4. 将新的向量和响应保存到缓存中供未来用户使用
semantic_cache[user_query] = (query_vector, response)
return response
# --- 为说明目的而模拟代理函数:此处未实际调用任何 LLM ---
def call_free_local_agent(prompt):
return "由本地零成本模型完成操作。"
def call_heavy_reasoning_agent(prompt):
return "由复杂编排代理完成操作。"
# 示例用法:模拟不同代理/模型的替代使用方式
# 注释/取消注释以尝试两个示例并自行测试
print(route_and_respond("总结今天的服务器日志"))
# print(route_and_respond("为我即将到来的日本之旅制定最优的一个月行程。请考虑提供的文档、公共交通时刻表和其他文档,以及实时 API 信息"))传递给 route_and_respond() 的提示中请求的任务复杂度将决定使用哪种模型类型。
执行此代码的输出将是以下两个函数中的一个返回消息:
def call_free_local_agent(prompt):
return "由本地零成本模型完成操作。"
def call_heavy_reasoning_agent(prompt):
return "由复杂编排代理完成操作。"# 总结
本文介绍了在实现多代理 AI 应用程序和架构时需要关注的四个关键策略,重点强调优化 token 使用、降低成本和减少延迟。通过一个基于模拟的实用示例,我们加深了对其中两种策略结合应用的理解:语义缓存和模型路由。
Iván Palomares Carrascosa 是 AI、机器学习、深度学习和 LLM 领域的领导者、作家、演讲者和顾问。他培训和指导他人如何在现实世界中利用 AI。
更多相关内容
- LLM 应用中跟踪 Token 使用的初学者指南
- 减少 Claude 代码 Token 使用的 7 种实用方法
- Make.com 自动化:数据专业人士的省时利器
- 大数据如何实时拯救生命:IoV 数据分析助力…
- 纳米香蕉实用提示与使用指南
- 使用 NumPy 数组优化内存占用
<hr class="grey-line"><br> <div><h3>我们推荐的 5 门免费课程</h3><br> </div>
WordPress 的 Mailchimp 插件 v4.13.1 - https://wordpress.org/plugins/mailchimp-for-wp/
/ WordPress 的 Mailchimp 插件
您可以从此处开始编辑。
如果评论已关闭。
<= 上一篇
下一篇 =>
#content end
<script type="text/javascript">kda_sid_write(kda_sid_n);</script>
最新文章
- MiniMax 代理真的能让工作更轻松吗?多智能体 AI 节省 Token 使用指南 KDnuggets 每周回顾:构建并部署您的首个自主代理 • 7 个仍具重要性的机器学习算法... 构建语音控制的 AI 代理 5 本加深对大型语言模型理解的书籍 新手指南:如何与 Claude 设计协作
热门文章
- 5 本加深对大型语言模型理解的书籍
- 7 个适用于 CLI 智能体编程的 Claude 代码最佳替代方案
- 7 个仍具重要性的机器学习算法
- Kaggle + Google 免费 5 天智能体 AI 课程
- 新手指南:如何与 Claude 设计协作
- 构建并部署首个自主代理的 7 个步骤
- 2026 年值得尝试的 5 个最佳数据分析师 AI 工具
- KimiClaw 是一个有用的工具吗?
- 每个工程师必须了解的智能体 AI 5 个关键概念
- 停止使用 If-Else 链:在 Python 中改用注册表模式
#content_wrapper end
© 2026
Guiding Tech Media
|
关于
联系我们
广告合作
隐私政策
服务条款
2026 年 8 月 3 日由 Iván Palomares Carrascosa 发布
blank
不,谢谢!
/.main_wrapper
<script defer type="text/javascript" src="https://s7.addthis.com/js/300/addthis_widget.js#pubid=gpsaddthis"></script>
noptimize
/noptimize