Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
论文概述
当前 AI Agent 能够自主完成短而定义明确的任务,但现有终端基准大多聚焦于几分钟内可完成、仅以最终结果评判的简单问题。这种设置忽略了中间进展和部分解决方案,导致稀疏的 reward 信号,无法完整反映 Agent 的能力。来自多家机构的研究者(共同作者包括 Zongxia Li、Zhongzhi Li、Yucheng Shi 等 13 人)提出了 Long-Horizon-Terminal-Bench,一个包含 46 个长时任务的终端基准,覆盖实验复现、软件工程、多模态分析、交互游戏和科学计算等 9 个类别。
每个任务采用 Terminal-Bench 风格的设置(参考解决方案或仿真引擎),并进一步分解为细粒度的分级子任务。这种设计实现了密集的中间奖励和部分得分,不仅能评估 Agent 是否达成最终目标,还能衡量它在开放式工作流中的进展程度。任务通常需要数百个回合、几分钟到几小时的执行时间,考验的是长时规划、长上下文管理和迭代调试能力,而非一次性的问题求解。
研究团队评估了 15 个前沿模型,发现 Agent 平均每个任务消耗 990 万 token,约 231 个回合,每次运行平均执行 85.3 分钟,这使得 Long-Horizon-Terminal-Bench 比以往的终端基准更具挑战性。即使在部分奖励阈值为 0.95 的条件下,最强模型也仅达到 15.2% 的 pass@1;在完美奖励阈值 1.0 下,这一数字降至 10.9%。所有模型的平均通过率分别为 4.3% 和 1.7%,显示出巨大的提升空间。
关键技术点
- 密集奖励(Dense Reward)设计:通过将长时任务分解为细粒度子任务,并赋予每个子任务明确的得分步骤,使得 Agent 不仅获得最终结果信号,还能在过程中获得中间反馈,从而支持更精细的评估与学习。
- 长时规划与上下文管理:任务需要 Agent 在数百回合内维持对目标、历史行为和中间结果的记忆与推理,这对当前模型的长期规划能力和上下文窗口管理提出了严苛要求。
- 迭代调试能力:许多任务并非一次完成,Agent 需要多次尝试、观察结果并修正策略,这与真实软件开发和科研工作中反复调试的过程高度一致。
- 基准难度与资源消耗:平均每个任务消耗近 1000 万 token,运行超过 80 分钟,远高于传统终端基准,表明其在计算资源和评估复杂性上的显著提升。
对数据科学与 AI Agent 落地的意义
对于数据科学领域,许多实际工作流(如实验复现、数据分析、模型调优、科学计算)本质上都属于长时、多步骤的终端任务。Long-Horizon-Terminal-Bench 提供的评估框架引导研究者关注 Agent 在真实复杂场景下的逐步推理和执行能力,而非仅关注一次性的正确率。这一基准将推动 Agent 在数据科学自动化、AI 辅助科研、软件工程辅助等场景中的实用化进程。同时,密集奖励机制也为设计更高效、更鲁棒的训练策略(如过程监督)提供了参考范本。
我的技术点评
Long-Horizon-Terminal-Bench 是当前 Agent 评估领域的一次重要补充与升级。它直面现有基准“任务短、反馈稀疏、评价片面”的痛点,通过任务分解和密集奖励设计,让评估更贴近实际应用。测试结果(最强模型通过率仅 10%~15%)客观暴露出当前前沿 Agent 在长时、多步任务上的严重不足,也指明了未来优化方向:长上下文推理、迭代性错误恢复、以及高效的 token 利用策略。
不过,该基准的计算开销极高(单个任务平均 990 万 token),对研究者复现和扩展构成一定门槛。此外,原文未说明具体涵盖哪些前沿模型(如 GPT-4 或开源 LLM),也未披露任务实例的细节,这留给读者一定的想象空间。期待后续工作能公开更多任务样本和评估细节,以促进社区共同进步。
