CSIG主办|15万奖金池,第二届Agent Memory Challenge即将启动
发布时间:2026-08-23
截稿时间:2026-09-20
阅读量:19次
第二届Agent Memory Challenge(Agent记忆公开挑战赛)即将启动。本届挑战赛由中国图像图形学会(CSIG)主办,南京大学、浙江大学、Datawhale、CSIG企业联络与标准化工作委员会承办,并依托Agent Memory Leaderboard(AML)统一评测平台,完成报名、评测、结果复核和榜单发布。
随着大模型智能体从单轮交互走向长期协作,长期记忆已成为提升Agent连续性、稳定性和个性化能力的重要基础。当前不同记忆系统常使用不同的数据集、回答模型和评测流程,公开成绩难以直接横向比较。AML挑战赛旨在基于统一的Add/Search接口协议、固定的评测协议和可复核的运行流程,推动建设更加开放、公平、可复现的Agent Memory Benchmark,为研究者和开发者提供可比较的评测环境,促进长期记忆技术的研究交流、工程验证与产业应用。
2026年8月12日,首期AML挑战赛正式揭榜。榜单发布后,AML持续受到研究者、开源社区和产业团队关注,也收到了许多肯定与建设性建议。
截至本文发布,AML官网累计点击量已超过30万;AML官方主页自上线以来持续位列Hugging Face Spaces Trending热门榜单前十,近期更连续多日位居趋势榜第一。对一个面向前沿研究与工程实践的评测项目而言,这些数据不仅体现了首期赛事的传播热度,也说明Agent Memory统一评测正获得越来越多的社区关注,公开、可比的评测结果也受到广泛期待。
感谢所有提交系统、参与讨论、分享经验和提出建议的研究者与开发者。
组织机构与赛事安排
主办单位:中国图像图形学会(CSIG)
承办单位:南京大学、浙江大学、Datawhale、CSIG企业联络与标准化工作委员会
统一评测平台:Agent Memory Leaderboard(AML)
AML指导委员会:由来自近30所高校及研究机构的科研团队代表组成,就AML长期评测方向、评测方法和榜单治理提供指导与审议意见。
2026年9月20日00:00起,参赛者可进入官网Evaluation页面提交报名信息并申请评测Key。
比赛期间,平台将按提交顺序滚动开展接入与评测。
本次比赛不收报名费。
赛道与参赛组别
本届赛事面向全球高校、科研院所、开源社区、独立研究团队及个人开放,支持个人参赛、团队参赛及跨单位自由组队。赛事设置文本、代码和多模态三个赛道,分别评测并排名:
文本赛道:考查长期多轮对话中的事实精准召回、多跳逻辑关联、时间序列推理、用户画像个性化对齐和记忆安全边界。
代码赛道:面向软件工程场景,考查系统从历史任务中找回调试过程、开发经验和项目上下文,并支持后续开发与排障。
多模态赛道:考查系统对图像、音频、视频和文本信息的记忆、跨模态关联、线索检索和上下文衔接能力。
每个赛道内设置开源方法榜和商业产品榜:
开源方法榜:需提供可公开核验的GitHub仓库,并固定commit(提交)或版本号,说明方法来源、作者及方法实现细节。
商业产品榜:无需公开内部实现,但需提供固定产品版本和稳定可用的Add/Search API。
同一参赛者可同时参加多个赛道,但只能选择一种参赛组别。
统一评测与提交流程
Add:接收评测记忆,完成存储、组织、索引和更新。
Search:根据问题返回相关记忆或证据,不负责生成最终答案。
平台统一完成任务编排、Answer(回答生成)、Eval(自动评测)、结果复核和榜单发布。公开Smoke测试用于检查接口结构、鉴权和端到端链路;Full评测用于正式计分。私有题目、答案和其他受保护材料不向参赛者开放。
【提交流程】:
阅读参赛说明和API接入指南,选择赛道与参赛组别。
固定参赛版本,准备系统说明、运行环境及接口材料。
在Evaluation页面提交报名信息并申请评测Key。
配置Add/Search接口,完成Smoke测试。
确认接口稳定且返回结构符合协议后,发起Full正式评测。
在Evaluation页面查看私有结果。
平台完成材料、版本、结果和合规复核后,符合条件的成绩进入公开榜单。
Full任务受理后,参赛版本将被冻结。代码、镜像、API、鉴权信息和容量设置须与申报内容保持一致。
按本期安排,每位参赛者在完整赛事周期内最多发起2次Full评测;任务成功或部分完成后,参赛者将在该赛道进入30天冷却期。失败或取消的任务,按页面提示及当期配额处理。最终榜单成绩以最新一次有效Full评测结果为准。
【接口运行、结果复核与合规要求】:
参赛方在Evaluation页面发起Full评测后,平台会在48小时内完成资源调度并启动评测。其中,48小时仅指资源调度并启动评测的时限,不代表任务将在48小时内完成。从资源调度开始,直至任务处理完成并结束必要的后续复核,参赛方应保持接口公网可访问,并保持API契约、鉴权方式和容量设置稳定(整体运行时间通常约为2–10天,具体取决于方法实现复杂度和评测规模)。
Full任务完成且平台未提出进一步复核要求后,参赛方原则上可停止记忆管理服务。若平台在结果、版本或合规复核中发现需要进一步核验的问题,将通过登记邮箱通知参赛方。请及时关注邮件和Evaluation页面状态,并按通知要求恢复接口服务,补充运行日志、版本材料或其他复核材料。
评测过程中,每个user_id、任务和样本必须独立处理,评测记忆不得跨用户、跨任务、跨团队或跨运行共享。严禁硬编码、基准泄漏、提示词注入、人工实时答题、结果操纵、恶意刷榜和未披露的代码复用。
评测数据及其派生副本仅用于本次评测任务,不得用于训练、微调、产品分析、数据集重建或对外传播。
奖金、Benchmark Contribution
与报名入口
三个赛道合计奖金150,000元,奖金仅面向开源方法榜设置。
AML将持续征集Benchmark Contribution(基准贡献)。欢迎高校、科研机构、开源团队、产品团队和社区成员提交来源明确、难度适当、具有补充价值且可复核的Benchmark、测试场景、数据或评测维度建议,以及公开评测契约改进方案。提交内容不得包含私有评测轨迹、参赛者数据、访问凭据或商业系统内部信息;请保留上游作者署名和许可证信息。欢迎通过AML官网「基准贡献」模块或下方咨询邮箱联系我们。
报名与评测Key申请:
https://agentmemoryleaderboard.ai/evaluation
参赛说明:
https://agentmemoryleaderboard.ai/rules
API接入指南:
https://agentmemoryleaderboard.ai/api-guide
赛事仓库:
https://github.com/AML-memory/agent-memory-leaderboard
咨询邮箱:
contactus agentmemoryleaderboard.ai
请关注AML官网及官方公众号「记忆之巅排行榜」后续公告,及时获取报名入口、接口协议、评测安排和成绩发布信息。
欢迎符合条件的高校、科研机构、企业、开源团队和个人研究者报名参赛,共同推动Agent Memory Benchmark的建设与演进。
本文赛事信息依据本期赛事方案整理。具体主办承办信息、参赛资格、接口规范、评测配置、复核流程、奖金发放及赛程调整,以主办方正式公告和官网最新规则为准。
https://mp.weixin.qq.com/s/SS4itah0sa4R2vcDQ4uevQ