Harbor 评测框架接入 Vercel Sandbox:每个任务独占一台微型虚拟机,换模型只改一个参数

Vercel Blog 2026-09-18T17:35:20.710165

开源评测框架 Harbor 现在可以在 Vercel Sandbox 上跑基准测试,每个测试任务运行在独立的 Firecracker 微型虚拟机中,并发规模不再受本地机器限制。搭配 AI Gateway,同一套基准换模型重跑只需修改 --model 参数。该功能要求 Harbor 0.22.0 及以上版本。

评测环境正在搬进托管沙箱

做 AI 编程工具、玩氛围编程(vibe coding,指用自然语言和 AI 结对写代码)的团队,基本绕不开基准测试。过去这一步通常在本机或自建集群上完成:手工搭环境、调依赖,既费时又容易出错。

现在这部分工作开始挪到托管沙箱里。Harbor 支持 Vercel Sandbox 就是一个有代表性的例子——把评测环境「外包」出去,省下的时间可以放回模型和产品本身。

Harbor 是什么

Harbor 是 Terminal-Bench 背后的开源评测框架。

所谓评测框架(harness),可以理解成一套「跑分脚手架」:负责派发任务、隔离运行环境、收集结果的那层基础设施。

它的基准仓库里不只有 Terminal-Bench,还收录了 SWE-bench、tau3-bench、OSWorld 等常用基准。团队不必为每个基准单独搭一套评测环境,常见评测都能在同一个框架下统一管理。

用法:加一个 --env vercel

harbor run 命令加上 --env vercel,评测就会切到 Vercel Sandbox 上执行。这个模式带来几处变化:

换模型重跑:只改 --model

配合 AI Gateway,一个 AI_GATEWAY_API_KEY 就能调用多家厂商的数百个模型。

要给另一个模型跑同一套基准测试,命令结构不用变,只改 --model 参数即可:

--model vercel_ai_gateway/openai/gpt-5.6-luna

上面这行就是把同一套基准测试指向 OpenAI 的模型。想对比 Claude、Gemini 等模型,改这一处就行,评测流程和结果格式保持不变。

版本要求

该功能需要 Harbor 0.22.0 或更高版本。安装、配置和排查问题的分步说明见官方文档,更多沙箱侧的细节可查阅 Vercel Sandbox 文档。

关键要点

查看原文