OSWorld 2.0 正式发布,对 AI 代理进行 1500 项桌面任务测试

Dev.to ML 2026-06-28T22:22:33.463041

Epoch AI 发布了 OSWorld 2.0,将桌面任务从 v1 的 369 项扩展至 1500 项,用于测试 AI 代理在对抗性任务及跨应用工作流中的表现。此次更新瞄准了计算机使用型 AI 代理的可靠性天花板,新增了对抗性测试和跨应用工作流。

关键数据 OSWorld 2.0:1500 项任务,是 v1 的 369 项的 4 倍;覆盖 macOS、Windows 和 Ubuntu 平台;30% 的任务需要跨应用工作流;对抗性测试会注入拼写错误和 UI 变更;Gemini 3.5 Flash 在 2026 年 6 月的 v1 测试中得分为 78.4。

据消息来源,Epoch AI 发布了 OSWorld 2.0,将该基准测试扩展至 1500 项真实桌面任务,覆盖 macOS、Windows 和 Ubuntu —— 相比 v1 的 369 项大幅增加。新版本针对计算机使用型代理的可靠性天花板,新增了对抗性鲁棒性测试(注入拼写错误和 UI 变更),并且有 30% 以上的任务需要跨多个应用进行多步推理。

为什么 OSWorld 很重要

OSWorld 已成为计算机使用型代理的事实标准基准——这类模型通过解读截图并执行鼠标/键盘操作来控制桌面界面。Google 的 Gemini 3.5 Flash 在 2026 年 6 月的 OSWorld v1 测试中得分为 78.4,与 GPT-5.5 持平。该基准的难度源于其扎根于真实操作系统:代理必须处理文件对话框、浏览器导航以及随操作系统更新而变化的应用程序菜单。

v2 有何变化

OSWorld 2.0 新增了对抗性示例——故意拼写错误的文件名、更改的按钮标签以及窗口缩放——以测试代理是依赖脆弱的视觉模式还是语义理解。新任务涵盖 12 个应用类别,包括电子表格操作、图像编辑和终端命令。Epoch AI 没有透露是否有任何模型在 v2 上完成了完整评估。

可靠性问题

根据公开排行榜,当前计算机使用型代理在 OSWorld v1 任务上的成功率为 20-30% 左右。v2 的扩展表明,该领域需要从根本上改进代理的规划和错误恢复能力,而非仅仅提升视觉模型性能。该基准的多应用工作流要求代理执行例如:从 Gmail 下载 CSV 文件,在 LibreOffice Calc 中编辑,然后将结果通过邮件发送——任何一个步骤出错都会导致整个流程失败。

值得关注的点

关注 OSWorld 2.0 的首个公开排行榜分数,预计将在 60 天内公布。如果顶级模型从 v1 的约 25% 成功率降至 15% 以下,则表明计算机使用型代理距离生产级可靠性仍需多年。

查看原文