
点击上方“Deephub Imba”,关注公众号,好文章不错过 !
基于大语言模型的多智能体系统有一个问题就是所有智能体共享一个存储库。这样会限制着性能、可扩展性和多样性。
一个名为 DecentMem 的新框架为每个智能体配备各自私有的双池记忆,在复用已验证策略和生成新想法之间做平衡,同时支持跨不同框架的协作。
使用者可以最小的改动把它接入现有的多智能体系统,在准确性、效率和适应性上都能得到提升。本文将拆解其架构、说明关键机制、总结优势,并给出在实际项目中的用法。

多智能体框架里,记忆通常像一个共享数据库:智能体从公共池中读取经验、摘要或交互历史,再写回去。MetaGPT 的全局消息池、G-Memory 这类系统里的分层共享图,都是这个思路。
这种做法看起来合乎逻辑,所有智能体信息同步、步调一致。但问题随之而来。
任务重复执行、工作流变得复杂时,这些问题会暴露得更明显。经验越积累,收益反而递减——智能体不断重复相似模式,很少真正创新或走向专业化。

DecentMem 没有走单一共享存储库的方向:每个智能体维护自己的私有记忆,划分成两个互补的池:

存储从过去成功完成的任务中提炼出的经验,捕捉丰富的、带协作感知能力的细节。每条记忆包含:
该池支持一种"局部游走(local-walk)"机制:被选中时,智能体检索相似的过往策略,复用行之有效的方法,充当行动与协作的先验。
这是当前任务的临时缓冲区。它调用 LLM 的生成能力,为未曾遇到过的情境创造新的候选方案和经验,不只依赖历史。
这种"启发式传送(heuristic teleportation)"能跳跃到解空间的新区域,防止智能体陷入局部最优——旧方案已经不适用新问题的情况。
对每个智能体 m,其记忆可正式表示为:

这种划分是让智能体既能保持个性化的知识,又能通过轨迹中明确的协作记录实现有效协调。
DecentMem 不在利用与探索之间设定固定比例,而是用一个在线路由器,针对每个子任务动态决策。
子任务在阶段 t 到达某个智能体时:

这套类似赌博机(bandit)问题的在线学习方式让系统能自我调整:探索成功了,X-pool 权重上升;过往策略靠谱,E-pool 权重上升。该方法可实现 O(log T) 的累积遗憾(regret),与随机赌博机问题的理论下界相匹配。
框架的兼容性也很好:可以作为插件接入 AutoGen 的脚本化工作流、DyLAN 的自适应选择、AgentNet 的机会式协调,或者自定义拓扑。智能体照常协作只是各自多了一份私有且具备协作感知能力的记忆。
从开发角度看:


实证结果也印证了这些说法。测试覆盖 AutoGen、DyLAN、AgentNet 三个框架,Qwen3(4B/8B/14B)、Gemma4 等模型系列,以及数学、代码、问答和具身任务等多个基准:
集成步骤
最佳实践:
潜在扩展方向:
开发中的优势
注意事项
评判者和路由器会带来一些额外开销,不过相较于节省下来的 Token,通常不算什么。每个智能体维护两个池,存储方案得花心思设计;评判者的质量直接影响权重分配,反馈提示要谨慎调整。
多智能体 LLM 系统正走向真正的自我进化,记忆是这一切的基础,其架构决定了系统是变聪明了,还是只是变大了。DecentMem 证明:把记忆去中心化,同时保持结构化和自适应能力,能够化解协作、专业化与效率之间的张力。
论文https://www.alphaxiv.org/abs/2605.22721
作者:Minervee
本文分享自 DeepHub IMBA 微信公众号,前往查看
如有侵权,请联系 cloudcommunity@tencent.com 删除。
本文参与 腾讯云自媒体同步曝光计划 ,欢迎热爱写作的你一起参与!