字节跳动发布 Seed 2.1 系列语言模型:AI Agent 自主运行 18 小时完成芯片设计代码

量子位 2026-06-23T15:19:47.084114

字节跳动发布 Seed 2.1 系列语言模型:AI Agent 自主运行 18 小时完成芯片设计代码

字节跳动推出 Seed 2.1 系列语言模型(Doubao-Seed-2.1-Pro / Turbo),API 服务已全量上线火山方舟。该模型在多项基准测试中与 Claude Opus 4.7 持平甚至超越,并以仅为后者 1/4 的价格提供同等能力。在芯片设计 RTL 代码生成任务中,模型连续自主运行近 18 小时,完成 6 个核心模块、1303 行代码,展示了在复杂工程任务中的长时自主迭代能力。

模型发布:Seed 2.1 系列

字节跳动刚刚发布了 Seed 2.1 系列语言模型,包含两个版本:

API 服务已全量上线至火山方舟平台。

△火山引擎总裁,谭待

在发布的演示案例中,模型展现了惊人的工程能力——围绕一个 16×16 PE 的 Tiny NPU Tile,Seed 2.1 Pro 连续运行近 18 小时,经历 9 轮迭代,最终生成了 6 个核心模块、1303 行 RTL 代码。RTL 是芯片设计中极为严谨的环节,涉及每个寄存器和信号线在每个时钟周期内的流动描述,通常需要 3-5 名工程师花费数周完成。

视频演示地址:https://mp.weixin.qq.com/s/Q4UufKRH4-BTlA3mRE7Uvg

评测表现:多项基准达到顶尖

Seed 2.1 Pro 在贴近真实终端编程环境的 Terminal Bench 2.1 评测中,表现基本与 Claude Opus 4.7 持平。在 SciCode(科学计算代码评测)上,Seed 2.1 Pro 甚至超越了 Opus 4.7 和 GPT-5.5。在工具调用评测 MCP-Atlas 中同样超过两者。

在六月发布的 Agents’ Last Exam(ALE) 基准评测中——该测试覆盖 13 个行业集群、1000 多项高经济价值真实任务——Seed 2.1 Pro 已处于当前参评模型的第一梯队水平。

定价优势方面:

Seed 2.1 Pro 在能力与国外头部模型比肩的同时,价格仅为同级别模型的 1/4(以 Opus 4.6-4.8 为参考)。具体定价为:

在国内模型中也具备显著竞争优势。根据火山引擎总裁谭待介绍,豆包日均 Token 使用量已突破 180 万亿

实际测试:在真实工作流中的表现

我们使用 OpenCode(类 Claude Code / Codex 的开发者环境)调用 Seed 2.1 Pro API,测试其在长 Prompt、代码生成、文件型交付和结构化报告等场景中的实际能力。

任务一:生成完整 3D 房屋(WebGL2)

测试要求: 仅用一个 index.html 文件,原生 WebGL2,实现可交互的 3D 房屋,包括多层结构、坡屋顶、窗户、车库、烟囱、庭院环境等,并支持鼠标拖拽旋转、滚轮缩放、WASD 移动、R 键重置视角。

Seed 2.1 Pro 首先生成了一版基础模型。随后我们要求增量优化,将“简陋盒子模型”升级为完整郊区别墅展示。模型并非一次性生成所有代码,而是逐行检查后再输出。

第一版后,经过两次细化指令,最终效果从简陋逐步变为柔和、精细的 3D 房屋。整个过程展示了模型在复杂几何结构拆解、WebGL 渲染、相机控制、光照材质等方面的综合能力。

任务二:直接生成可用的 PPT

测试要求: 基于网络材料,生成 10 页中文汇报 PPT《AI Agent 进入企业生产系统的三个信号》,包括完整目录、每页核心结论与要点、3 页强视觉页面(产业链地图、时间轴、竞争象限图),并输出核心逻辑总览图的 SVG 代码。

Seed 2.1 Pro 首先分析任务需求,制定 TODO 列表,然后逐步执行。最终一次性生成了所有所需文件。生成的 PPT 在内容与设计感上不再有“一眼 AI”的感觉,几乎可直接用于汇报。

任务三:乱表秒做数据分析

测试要求: 给定 8 周 AI 办公产品模拟数据(新增用户、活跃用户、付费转化等),模型需完成趋势判断、异常点识别、转化率计算、业务结论撰写、图表方案制定及下一步验证问题。

与 PPT 任务类似,Seed 2.1 Pro 执行 TODO 列表后,输出了带排版和图表分析的 Word 报告,以及整理好的 Excel 数据。这种需要多种格式、多模态输出的工作,已可安心交给模型完成。

附加测试:截图直接变 PRD(豆包办公任务模式)

我们还提前体验了豆包办公任务模式(背后模型为 Seed 2.1 Pro)。该模式面向普通用户,无需配环境、无需写代码。拖拽文件即可上传,例如:

实测表明,API 能完成的任务,办公任务模式基本都能支撑,并且相比之下更加便捷。

生态与总结:不止是又一个新模型

Seed 2.1 Pro 并非只服务豆包一个入口。据悉,它已同步进入 TRAE、TRAE WORK、扣子 等字节系产品。这意味着同一个基座模型,同时连接了 API 开发者、AI Coding 工具以及办公入口,形成了一条从技术到用户的全链路。

回顾过去,国产基模的竞争多停留在“聊天能力追没追上”、“榜单分数高不高”。但进入 Agent 时代,用户更关心的是任务完成率——模型能否连续理解上下文、拆解任务、执行任务、生成文件、看图并输出结论。Seed 2.1 Pro 的核心变化正在于此。


关键要点

查看原文