SWE-Bench Multimodal:AI 系统能否泛化到可视化软件领域?

HN I Built AI Coding 2026-09-15T06:22:42.989686

论文信息

概述

初版 SWE-bench Multimodal 在基准测试中新增了 517 个包含视觉元素的问题,例如:

这项扩展用来评估模型能否理解并处理同时以文字和图像呈现的信息。

Multimodal v2

2026 年 9 月 1 日

V2 保留了 480 个任务,这些任务经过筛选,确保评测结果可复现,已知不稳定或无法评分的测试均已剔除。

查看原文