首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >DecentMem 双池记忆:借鉴强化学习的利用与探索设计,Token 消耗降了近一半

DecentMem 双池记忆:借鉴强化学习的利用与探索设计,Token 消耗降了近一半

作者头像
deephub
发布2026-07-24 20:47:28
发布2026-07-24 20:47:28
590
举报
文章被收录于专栏:DeepHub IMBADeepHub IMBA

点击上方“Deephub Imba”,关注公众号,好文章不错过 !

基于大语言模型的多智能体系统有一个问题就是所有智能体共享一个存储库。这样会限制着性能、可扩展性和多样性。

一个名为 DecentMem 的新框架为每个智能体配备各自私有的双池记忆,在复用已验证策略和生成新想法之间做平衡,同时支持跨不同框架的协作。

使用者可以最小的改动把它接入现有的多智能体系统,在准确性、效率和适应性上都能得到提升。本文将拆解其架构、说明关键机制、总结优势,并给出在实际项目中的用法。

多智能体系统中集中式记忆的问题

多智能体框架里,记忆通常像一个共享数据库:智能体从公共池中读取经验、摘要或交互历史,再写回去。MetaGPT 的全局消息池、G-Memory 这类系统里的分层共享图,都是这个思路。

这种做法看起来合乎逻辑,所有智能体信息同步、步调一致。但问题随之而来。

  • 智能体专业化的丧失: 智能体反复从同一记忆中取用信息,行为会趋同,原本清晰的角色分工开始模糊,多智能体系统赖以发挥价值的互补优势也就没了。
  • 可扩展性与成本问题: 检索成本随共享池规模增长,每个智能体要处理更多无关上下文,Token 消耗上升,速度变慢。
  • 隐私与安全隐患: 所有经验都被共享,企业级或多组织部署场景下风险不小。
  • 自我进化受阻: 长期改进需要在从集体经验中学习的同时保留多样性,集中式设计往往把系统推向单一的主导策略。

任务重复执行、工作流变得复杂时,这些问题会暴露得更明显。经验越积累,收益反而递减——智能体不断重复相似模式,很少真正创新或走向专业化。

DecentMem 的去中心化双池记忆

DecentMem 没有走单一共享存储库的方向:每个智能体维护自己的私有记忆,划分成两个互补的池:

利用池(Exploitation Pool,E-pool)

存储从过去成功完成的任务中提炼出的经验,捕捉丰富的、带协作感知能力的细节。每条记忆包含:

  • 所采取的行动轨迹(任务分解、直接回应、工具使用);
  • 协作历史——谁处理了什么、信息如何在智能体之间传递;
  • 智能体自身的评注和内部决策依据。

该池支持一种"局部游走(local-walk)"机制:被选中时,智能体检索相似的过往策略,复用行之有效的方法,充当行动与协作的先验。

探索池(Exploration Pool,X-pool)

这是当前任务的临时缓冲区。它调用 LLM 的生成能力,为未曾遇到过的情境创造新的候选方案和经验,不只依赖历史。

这种"启发式传送(heuristic teleportation)"能跳跃到解空间的新区域,防止智能体陷入局部最优——旧方案已经不适用新问题的情况。

对每个智能体 m,其记忆可正式表示为:

这种划分是让智能体既能保持个性化的知识,又能通过轨迹中明确的协作记录实现有效协调。

在线路由器与反馈回路

DecentMem 不在利用与探索之间设定固定比例,而是用一个在线路由器,针对每个子任务动态决策。

子任务在阶段 t 到达某个智能体时:

  1. 路由器计算两个池的权重;
  2. 以概率 αE-pool 选择 E-pool,或以概率 αX-pool 选择 X-pool;
  3. 智能体检索过往成功案例,或生成新的候选方案;
  4. 执行完毕后,外部 LLM 充当评判者(LLM-as-a-judge),逐阶段评估轨迹,就解决方案质量、协作情况、优缺点给出反馈;
  5. 系统据此重新调整该智能体两个池的权重,更新未来决策的偏好。

这套类似赌博机(bandit)问题的在线学习方式让系统能自我调整:探索成功了,X-pool 权重上升;过往策略靠谱,E-pool 权重上升。该方法可实现 O(log T) 的累积遗憾(regret),与随机赌博机问题的理论下界相匹配。

框架的兼容性也很好:可以作为插件接入 AutoGen 的脚本化工作流、DyLAN 的自适应选择、AgentNet 的机会式协调,或者自定义拓扑。智能体照常协作只是各自多了一份私有且具备协作感知能力的记忆。

关键发现

从开发角度看:

  • 全局可达性: 双池机制保证智能体能到达局部解空间中任何可行的策略。利用池负责局部优化,探索池负责向遥远可能性传送;不会被永久困在次优模式里。
  • 在保持协调的同时保留多样性: 私有记忆保住了专业化程度。详细的轨迹记录了"谁做了什么",协作信号依然清晰,知识不会被磨平成一样。
  • 效率提升: 智能体只访问自己相关的记忆,上下文冗余少,Token 消耗随之下降。
  • 支持自我进化: 任务累积得越多,多样性保留得越好,系统改进得也越快——性能提升是复利式的,不会陷入停滞。

实证结果也印证了这些说法。测试覆盖 AutoGen、DyLAN、AgentNet 三个框架,Qwen3(4B/8B/14B)、Gemma4 等模型系列,以及数学、代码、问答和具身任务等多个基准:

  • 相较最强的集中式基线,准确率最高提升 23.8%;
  • 相较无记忆方案,最高提升 52.5%;
  • Token 使用量最多减少 49%;
  • 进化速度更快,在 DyLAN 等框架中达到较强性能的速度快了约 2.5 倍;
  • 在更松散、更随机的协调场景中收益更大,这类场景恰恰最看重多样性。

如何运用 DecentMem

集成步骤

  1. 封装现有智能体: 把 DecentMem 作为中间件接入,每个智能体的双池以向量存储或结构化数据库实现,E-pool 中用 Embedding 做基于相似度的检索。
  2. 定义记忆片段: 条目结构包含轨迹、评注和协作元数据,可能需要给智能体间的消息记录加上来源信息(provenance)。
  3. 实现路由器: 一个轻量模块根据当前权重采样即可,初始设为等权重,后续靠反馈调整。
  4. 加入 LLM 评判者: 用一个能力足够的模型(或用心设计提示的同一骨干模型)做分阶段评估,提示重点放在协作、质量和改进建议上。
  5. 处理持久化: E-pool 条目跨会话持久存储;X-pool 可以是临时的,成功后再选择性提升到 E-pool。

最佳实践:

  • 持续监控路由器权重的变化,了解每个智能体的偏好演化,这本身就是调试的好线索;
  • 结合现有的 RAG 技术在池内检索;
  • 生产环境中给私有记忆加上访问控制和加密;
  • 用固定式和动态式混合的工作流测试,看看哪种场景收益最大;
  • 把智能体分布到多个节点上做扩展,去中心化记忆天然适合分布式系统。

潜在扩展方向:

  • 给 E-pool 加衰减(decay)或摘要(summarization)机制,提升长期效率;
  • 换用不同的评判模型或多标准反馈;
  • 与工具调用(tool-calling)框架集成,丰富轨迹数据;
  • 在隐私允许的情况下,探索跨智能体选择性共享高价值的、已提炼的记忆。

开发中的优势

  • 运营成本更低: Token 消耗少,API 调用或推理的开销就低,高流量应用尤其受益;
  • 可靠性更好: 动态平衡机制减少了因过时知识或重复性错误导致的失败;
  • 调试和维护更省心: 私有记忆带着丰富元数据,追溯"哪个智能体贡献了什么"更容易;
  • 面向未来: 支持持续学习而无需重新训练整个系统,智能体可以个体和整体两个层面共同进化;
  • 协作合规: 适合涉及敏感数据或多组织协作的场景。

注意事项

评判者和路由器会带来一些额外开销,不过相较于节省下来的 Token,通常不算什么。每个智能体维护两个池,存储方案得花心思设计;评判者的质量直接影响权重分配,反馈提示要谨慎调整。

总结

多智能体 LLM 系统正走向真正的自我进化,记忆是这一切的基础,其架构决定了系统是变聪明了,还是只是变大了。DecentMem 证明:把记忆去中心化,同时保持结构化和自适应能力,能够化解协作、专业化与效率之间的张力。

论文https://www.alphaxiv.org/abs/2605.22721

作者:Minervee

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-23,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 DeepHub IMBA 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 多智能体系统中集中式记忆的问题
  • DecentMem 的去中心化双池记忆
    • 利用池(Exploitation Pool,E-pool)
    • 探索池(Exploration Pool,X-pool)
  • 在线路由器与反馈回路
  • 关键发现
  • 如何运用 DecentMem
  • 总结
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档