Long-Horizon-Terminal-Bench:基于密集奖励评分的长期终端任务代理能力极限测试
论文信息
论文信息
摘要
AI 代理已能自主完成短且定义明确的任务。然而,现有终端基准(terminal benchmark)主要关注几分钟内可完成的简单问题,且仅通过最终结果进行评估。这种设置忽视了中间进展和部分解决方案,导致稀疏的奖励信号以及对代理能力不完整的刻画。我们提出 Long-Horizon-Terminal-Bench,这是一个包含 46 个长期任务的终端基准,涵盖九个类别,包括实验复现、软件工程、多模态分析、交互式游戏和科学计算。每个任务均采用 Terminal-Bench 风格设置(配备参考解决方案或仿真引擎),但进一步分解为细粒度的分级子任务。这种设计实现了密集的中间奖励和部分得分,使得评估不仅能捕捉代理是否达到最终目标,还能衡量其在开放式工作流中的进展程度。Long-Horizon-Terminal-Bench 中的任务通常需要数百个回合以及数分钟到数小时的执行时间,强调长期规划、长上下文管理和迭代调试,而非一次性问题解决。我们评估了 15 个前沿模型,发现代理平均每个任务消耗 990 万个 token,每轮运行约 231 个回合和 85.3 分钟的执行时间,这使得 Long-Horizon-Terminal-Bench 比以往基于终端的基准更具挑战性。即使是最强测试模型,在部分奖励阈值 0.95 下也仅达到 15.2% 的 pass@1,在完美奖励阈值 1.0 下为 10.9%,而两个阈值下各模型的平均通过率分别为 4.3% 和 1.7%。这些结果揭示了改进空间。我们进一步分析了失败模式和错误模式,并发布 Long-Horizon-Terminal-Bench 以支持长期终端代理领域的未来进展。