换个会话就失忆?Agent 记忆乱象,迎来首个全球统一评测基准

举报
记忆之巅排行榜 发表于 2026/08/12 17:08:34 2026/08/12
【摘要】 同一个 Agent,隔几天换个上下文,就不记得你之前交代过的偏好;写代码时,刚修过的 Bug 换个新 Session 又踩一遍。业界虽然有记忆张量、Mem0 等许多方案,但 “各家各自跑,标准不统一” 。近期,由国内外二十多所高校与研究机构联合发起的 Agent Memory Leaderboard (AML)  正式发布,并在 7 月 29 日启动了首届 Agent 记忆挑战赛。这不只是一...

同一个 Agent,隔几天换个上下文,就不记得你之前交代过的偏好;写代码时,刚修过的 Bug 换个新 Session 又踩一遍。业界虽然有记忆张量、Mem0 等许多方案,但 “各家各自跑,标准不统一”

近期,由国内外二十多所高校与研究机构联合发起的 Agent Memory Leaderboard (AML)  正式发布,并在 7 月 29 日启动了首届 Agent 记忆挑战赛。这不只是一个新榜单,而是试图为记忆系统建立一套 “统一、开放、可复现、可长期运行” 的评测基准。

今天我们来聊聊,AML 到底在测什么?以及为什么它可能是 Agent 长线协作的关键基础设施。

为什么需要一场“记忆大考”?

过去一年,Agent Memory 的方法与产品快速涌现。但症结在于:评测标准不统一。

  • 数据集不统一:你的短对话,我的长上下文。
  • 回答模型不统一:有的用 GPT-4 测,有的用开源模型测。
  • 评分逻辑不统一:有的看重关键词命中,有的看重逻辑推理。

这就导致一个尴尬的局面:一个系统在单一数据集上拿高分,未必代表它的整体记忆能力强;同一个方法换个回答模型,结果可能天差地别。

“在这个领域,分数混合了记忆系统、回答模型和裁判规则等多重因素,很难单独衡量记忆本身的价值。”  这正是 AML 诞生的背景——需要一把“统一标尺”。

AML 到底在测什么?—— 三项核心设计揭秘

AML 并不打算再造一个单点 benchmark,而是搭建一个“只要接入,就能测全项”的长线体系。

1. 统一评测机制:把变量锁死
平台将参评系统的职责极度压缩:只提供 Add(写入)  和 Search(检索)  两个接口。
回答(Answer)和评分(Eval)全部由平台统一大模型完成。这意味着,你再也不能用“我的模型更聪明”去掩盖“我的记忆检索能力差”。成绩的差异,将更多归因于记忆系统本身。

2. 能力剖面重构:不只是总分,而是“诊断书”
AML 打破了总分覆盖一切的现状。它将文本记忆拆解为 7 项核心能力

  • 显式事实召回、关系与多跳组合、时间与事件序列;
  • 记忆治理(更新、冲突与遗忘)、个性化与关怀、规则与流程执行;
  • 认识论安全与隐私(证据不足不臆造、守住边界)。

除文本外,它还引入了代码大类评测。系统需从真实 GitHub 仓库的历史 Issue/Pull Request 中检索过往工程经验,考察其抗噪能力和经验复用精准度。

3. 低门槛、长期运行
参赛者只需写好 Add/Search 接口即可,无需搭建全套评测环境。平台会统一运行、记录并公示结果,确保榜单的长期可追溯。

不止是一个平台,它已经跑起来了

一套评测体系是否站得住,最终要靠真实的系统来检验。AML 并非只停留在论文或架构图里——它已经进入了实战阶段。

2026 年 7 月,基于上述评测平台,首届 Agent 记忆挑战赛(Agent Memory Challenge 2026) 正式启动。这是 AML 第一次面向全球社区开放征集参评系统,邀请研究者、开源项目维护者和商业产品团队,在同一条跑道上完成首次集中的横向评测。

本次挑战赛的报名将持续至 8 月 7 日,成绩与榜单将于 8 月中旬 正式公布。

与许多短期打榜活动不同,AML 本身是一个长期运行的平台。本次挑战赛更像是整个评测体系的首轮压力测试,所有参赛者的成绩将与系统版本绑定,长期可追溯;提交一次,即可在统一的评测规则下,获得覆盖 7 项文本记忆能力与 2 项代码记忆能力的全景评估报告。

如果你是研究者或开发者,目前仍然可以前往官网报名,平台将承担所有评测与评审算力,你只需提供 Add/Search 接口即可参与:

  • 核心入口
    官方公众号:记忆之巅排行榜

【结语】

大模型 Agent 的演进,正从单次问答走向长线协作。而这背后最底层的基础设施,无疑是 “记忆系统”

AML 的价值不仅仅在于发布一个排行榜,而在于为整个产业界和学术界提供了一个  “可以横向比较、相互复用诊断工具”的基准平台。当所有记忆系统都能在同一把尺子下比试,真正的好系统才能被识别、被验证、被持续改进。

8 月中旬放榜日,无论你是否参赛,都值得蹲守一下这份首期成绩单。记忆技术要往前走,我们需要一套大家认可、任何人都能核验的度量衡。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。