Harbor 评测框架接入 Vercel Sandbox:每个任务独占一台微型虚拟机,换模型只改一个参数
开源评测框架 Harbor 现在可以在 Vercel Sandbox 上跑基准测试,每个测试任务运行在独立的 Firecracker 微型虚拟机中,并发规模不再受本地机器限制。搭配 AI Gateway,同一套基准换模型重跑只需修改
--model参数。该功能要求 Harbor 0.22.0 及以上版本。
评测环境正在搬进托管沙箱
做 AI 编程工具、玩氛围编程(vibe coding,指用自然语言和 AI 结对写代码)的团队,基本绕不开基准测试。过去这一步通常在本机或自建集群上完成:手工搭环境、调依赖,既费时又容易出错。
现在这部分工作开始挪到托管沙箱里。Harbor 支持 Vercel Sandbox 就是一个有代表性的例子——把评测环境「外包」出去,省下的时间可以放回模型和产品本身。
Harbor 是什么
Harbor 是 Terminal-Bench 背后的开源评测框架。
所谓评测框架(harness),可以理解成一套「跑分脚手架」:负责派发任务、隔离运行环境、收集结果的那层基础设施。
它的基准仓库里不只有 Terminal-Bench,还收录了 SWE-bench、tau3-bench、OSWorld 等常用基准。团队不必为每个基准单独搭一套评测环境,常见评测都能在同一个框架下统一管理。
用法:加一个 --env vercel
给 harbor run 命令加上 --env vercel,评测就会切到 Vercel Sandbox 上执行。这个模式带来几处变化:
- 每个任务独立隔离:单次测试(trial)都跑在自己的 Firecracker 微型虚拟机里,任务之间互不干扰,不会串扰,也不会留下脏环境。
- 并发不再受本机限制:评测不占用本地资源,可同时运行的任务数量远超单机上限,适合需要大规模并行扫描模型的场景。
- 网络策略在虚拟机之外生效:任务的网络访问规则由沙箱防火墙统一控制。防火墙位于虚拟机外部,虚拟机内部无法绕过。
- 凭据注入更安全:可选的凭据注入机制会把密钥附加到匹配的出站请求上,密钥保存在防火墙层,不会进入沙箱内部。对需要调用外部 API 的评测任务来说,这一点比较关键。
换模型重跑:只改 --model
配合 AI Gateway,一个 AI_GATEWAY_API_KEY 就能调用多家厂商的数百个模型。
要给另一个模型跑同一套基准测试,命令结构不用变,只改 --model 参数即可:
--model vercel_ai_gateway/openai/gpt-5.6-luna
上面这行就是把同一套基准测试指向 OpenAI 的模型。想对比 Claude、Gemini 等模型,改这一处就行,评测流程和结果格式保持不变。
版本要求
该功能需要 Harbor 0.22.0 或更高版本。安装、配置和排查问题的分步说明见官方文档,更多沙箱侧的细节可查阅 Vercel Sandbox 文档。