AgentOdyssey:用于测试时持续学习智能体的开放式长时程文本游戏生成

arXiv cs.CL 2026-06-25T09:22:46.330265

AgentOdyssey:用于测试时持续学习智能体的开放式长时程文本游戏生成

提交日期:2026年5月29日

作者:Zheyuan Zhang, Zehao Wen, Alvin Zhang, Andrew Wang, Jianwen Xie, Daniel Khashabi, Tianmin Shu

为了让智能体在测试时通过与世界交互持续学习,它们必须能够有效探索、获取新的世界知识和技能、保留相关的情景经历,并在长时程内进行规划。为了评估测试时持续学习智能体的这些关键能力,我们引入了AgentOdyssey,一个新颖的评估框架,该框架程序化地生成包含丰富实体、世界动态和长时程任务的开放式文本游戏。关键在于,AgentOdyssey超越了传统机器学习中“测试时不发生学习”的假设,通过将智能体置于一个持续的长时程环境中,使其在部署过程中交错进行学习和推理。我们进一步提出了一种多维度评估方法,不仅衡量游戏进展,还对世界知识获取、情景记忆、物体和动作探索、动作多样性和模型成本进行诊断性测试。我们在生成的游戏中评估了多种智能体范式。实验结果表明,智能体的关键能力存在严重局限,并且揭示了影响其有效时程的因素。尽管性能随着更强的基础模型而提升,但即使是最优秀的智能体也远低于人类表现,留下了巨大的改进空间。在智能体机制中,我们发现短期记忆有助于多种智能体范式,并且是智能体测试时训练的重要组成部分。

查看原文