Agents on Rails:大语言模型基准测试项目
2026年8月12日 星期三
由 Rails Foundation 发布今天我们分享 Agents on Rails 的首批成果。这是一个新的长期项目,旨在衡量当下领先的编码智能体工具(包括前沿模型和开放权重模型)在 Ruby on Rails 代码库上的实际表现。
Rails Foundation 委托 Evil Martians 负责这个项目,项目将在未来几周分多个阶段陆续发布。
你可以继续阅读下面的项目介绍、查看排行榜,或者直接跳到第一份基准测试报告。
为什么我们要做这件事
过去一年,编码智能体的使用量激增,几乎每个开发者或团队都在用 AI 写代码。但选择太多,新模型几乎每周都在发布。运行智能体的成本和 token 消耗也是一笔不小的额外开销,而在去年之前,大多数公司都没有把这笔钱计入预算。
所以我们产生了一些疑问:哪些模型能写出高质量的 Rails 代码?每个模型相对而言要消耗多少 token?前沿模型和开放权重模型相比,是更好、更差,还是不相上下?选择不同模型有没有什么权衡?这些都是每个工程团队眼下正在纠结的问题。所以我们也在想:我们能做些什么,帮助社区在这些决策中理清方向?
我们一直听 Rails 开发者说 Rails 和 AI 是绝配——得益于“约定优于配置”,Rails 和 AI 配合得很好,Rails 很省 token,模型往往能把 Rails 写得很不错,诸如此类。Rails Foundation 董事会成员在自己团队中使用智能体的经验,也印证了这些说法。
我们很高兴听到这些,但我们需要的不只是经验之谈。于是我们委托 Evil Martians 让主流智能体在真实的 Rails 应用上完成真实的 Rails 任务,并把结果转化成实用的建议,供你的团队在选择模型(或多种模型)时参考。
我们测试了什么
这个基准测试项目分阶段推进,第一阶段今天启动。
Stage 1:原子任务。当前的评估集由小型、自包含的任务组成,每个任务只针对一项特定能力,如果涉及 API,也只会调用唯一的一个。除了测试 8 个不同前沿模型和开放权重模型的准确率、速度、Token 消耗和成本之外,我们还会考察模型是否能主动调用 Rails 现有的 API。
完整方法论可以在这里查看。
这个基准测试会在有潜力的新模型发布时持续运行,因此 Ruby 社区总能获取到最新的模型对比信息,以及成本与能力之间的权衡考量。
最新排行榜可以在新的 AI 页面上找到,每次运行基准测试后,我们都会发布一份完整的研究报告,并链接到该页面。我们还为这些报告创建了一个新的标签,方便你随时在博客中查找:Agents。
接下来做什么
Stage 2:更贴近实际的工作。(即将推出。)我们将从孤立的单点任务转向更真实、更复杂的工作——测试智能体在更长、多步骤任务中的表现,比如添加新功能、从零搭建一个完整应用。这些测试对智能体来说更具挑战性,也会更接近你和你的团队在生产环境中的实际开发方式。
全面开源。任务集和方法论现在已经开放,原始运行数据明天将上传到仓库中。此外,Evil Martians 为运行这套基准测试而构建的 Ruby 测试框架 Soonlemans 也将开源给社区。
感谢 Evil Martians
向 Evil Martians 团队致以诚挚的谢意。他们设计并构建了基准测试框架和测试语料,运行了全部评估,并将结果整理成了我们今天发布的第一份研究报告。感谢 Svyatoslav Kryukov、Artur Petrov、Vladimir Dementyev、Albert Pazderin、Alexander Baygeldin、Anton Senkovskiy 和 Irina Nazarova——她在还没想起要先跟团队成员商量一下的情况下就热情地让整个团队投入到这个项目中。幸运的是,团队成员对这个项目的热情丝毫不减。我们很乐见这样的结果。
我们还要感谢 Rob Zolkos 设计了新的 AI 页面,并帮助我们完成了报告成果的可视化。
如果你所在的 Rails 团队对我们接下来应该测试什么有想法,或者只是想聊聊你的看法,欢迎联系我们:foundation@rubyonrails.org。