SWE-Bench Multimodal:AI 系统能否泛化到可视化软件领域?
论文信息
- 标题:SWE-Bench Multimodal: Do AI Systems Generalize to Visual Software Domains?
- 原文:查看原文
概述
初版 SWE-bench Multimodal 在基准测试中新增了 517 个包含视觉元素的问题,例如:
-
Bug 或界面问题的截图
-
设计稿或线框图
-
说明目标功能的图表
-
带有视觉上下文的错误信息
这项扩展用来评估模型能否理解并处理同时以文字和图像呈现的信息。
Multimodal v2
2026 年 9 月 1 日
V2 保留了 480 个任务,这些任务经过筛选,确保评测结果可复现,已知不稳定或无法评分的测试均已剔除。
-
完整的测试集和评测工具均已开源。
-
Docker 环境已重建,解决依赖漂移和浏览器版本漂移的问题。