智能体编程与专业知识持续回报
核心发现
-
在之前工作的基础上,我们基于2025年10月至2026年4月期间约40万次Claude Code会话的隐私保护分析,提出了一套用于研究交互式智能体编程的框架。我们评估了任务构成、人机协作方式以及成功率的分布。
-
典型的会话中,人负责大部分规划决策(做什么),而Claude负责大部分执行决策(怎么做)。人在会话中带来的领域专业知识越强,Claude每一条指令完成的工作量就越大。在编码任务上,几乎所有职业的人都能以与软件工程师近乎相同的成功率完成任务——即通过测试或提交代码等可验证的证据,达成了用户设定的目标。
-
人的领域专业知识越丰富,会话越容易成功——虽然中级与专家用户之间的差距并不显著。在我们观察的七个月里,花在调试上的会话比例下降了近一半,使用方向也转向更端到端的智能体化:部署和运行代码、分析数据、以及编写非代码类文档。
-
在这七个月里,通过对比自由职业招聘信息来估算,几乎各类任务的典型价值都上升了——平均涨幅约25%。
引言
智能体编程(Agentic coding)已经火起来了。自2025年底以来,GitHub上活跃着编码智能体活动的项目占比翻了一倍多¹,而Claude Code用户平均每周使用该工具的时间已达20小时²。没有正式编程经验的人能否成功引导智能体完成复杂的技术工作?这些工具的快速普及和进步对广义的知识工作又意味着什么?虽然我们还没有完整的答案,但可以从Claude Code的使用数据中寻找早期信号。
代理式编程与领域专长的持续回报
这份报告基于隐私保护分析,覆盖了2025年10月至2026年4月期间约23.5万人的近40万次交互会话,为Claude Code的实际使用情况提供了证据。它建立在之前的研究之上,那些研究聚焦于Claude Code会话中的自主性衡量指标,以及Claude Code如何改变Anthropic内部的工作方式。本文提出了一个描述交互式AI编程助手用法的框架:包括工作类型、执行者以及成功与否。我们重点关注通过命令行界面、Claude.ai或Claude Code桌面应用的使用情况。通过追踪代理式编程使用随模型能力增强的变化,我们可以更好地理解这些工具对编程专业人员和知识工作者劳动力市场的影响。
Claude Code上的情况,或许预示着知识工作的未来走向——随着智能体嵌入到非编程工作中。我们发现Claude正在处理更复杂、更有价值的任务。与此同时,代理式编程中仍存在明确的分工:人决定构建什么,智能体决定如何构建。
我们还发现,有效使用该工具的关键并非编程熟练度,而是领域专长。具体来说,领域专家成功率更高,并且更容易从错误和误解中恢复。不过,专家与中等水平者之间的差距并不大——这表明只要具备某个领域的熟练度,就能几乎像深度掌握者一样高效地使用工具。
这些发现让我们初步观察到劳动力市场可能出现的转变。在我们的数据中,成功取决于一个人对所要解决问题的理解程度,而非是否接受过编程训练。如果这些模式在整个经济领域成立,那就说明:虽然代理式编程工具可能正在接管一些实现密集型工作,但它们也在奖励那些对自己工作中要解决的问题有深刻理解的人。编程智能体并未取代领域专长——工作者带给智能体的理解越深,智能体能做的优质工作就越多。
劳动分工
人们用 Claude Code 做什么
为了了解大家用 Claude Code 做什么,我们把每个会话归入九种工作模式之一——即最能概括该会话目标的那一类活动。其中四种模式直接涉及写代码或维护代码:构建新功能、修复故障、测试代码、以及编排其他 agent 或自动化流水线。另一类是运维——部署、配置、运行流水线、监控系统。还有两类更偏向弄清楚该做什么:理解现有系统的工作原理,以及在动手改动前先做规划。最后两类操作与代码无关,或者代码只是最终产品的附带内容:分析数据,以及通过演示文稿或纯文本文档进行沟通。
大约 56% 的会话涵盖写代码(25%)、修代码(26%)以及测试和编排代码(5%)。运维软件占 17%,14% 的会话是规划或探索,13% 用于生成分析或文档(见图 1)。

我们的做法是:先让一个模型读取会话记录,然后利用隐私保护的分析工具将其与每个会话自动记录的遥测数据做对照——后者包括是否有代码行被增删。两种手段的结果高度一致——例如,被分类器标记为“创建或修改代码”的会话中,超过 90% 在遥测数据里也显示有代码改动。详见附录。
谁来做决定
Claude Code 的自主程度有多高?能力评估显示,它的上限已经很高并且还在提高:在 METR 的“时间跨度”这类基准测试中,前沿模型现在可以完成人类需要耗时数小时的软件任务,并自主绕过途中遇到的障碍。但在实际使用中,情况又是怎样的呢?我们接下来看看,在真实的会话里,人类和 Claude 各自承担了多少引导工作。
代理编程与专业技能的持续回报
我们从两个角度来探究这个问题。首先,关注用户在多大程度上将决策托付给 Claude;其次,看他们交给 Claude 多少动作。为了理解一次会话中的决策分工,我们基于会话内容构建了一个注重隐私保护的决策归属分类器。分类器会列出会话中所有有意义的决策,并将它们分为两类:规划决策(做什么、用哪种方法、怎样才算完成)和执行决策(改哪些文件、写什么代码、用什么语言、运行哪些命令)。接着,分类器将每个决策归因于 Claude 或用户,最终为每次会话给出两个数字:用户占规划决策的比例,以及用户占执行决策的比例。
平均来看,用户做出约 70% 的规划决策,但只做出约 20% 的执行决策(图 2)。实际上,在代理编程中存在明确的分工——用户决定构建什么,代理决定如何构建。
为了理解会话中动作的委托情况,我们转而观察会话的结构而非内容。一次 Claude Code 会话中,用户和 Claude 来回交替:用户给出提示,Claude 执行动作——用户写一条提示,Claude 就去完成一些工作,然后用户再写下一条提示,如此循环。一次典型的会话大约有四个这样的轮次。根据我们从 10 月到 4 月的历史数据,用户每发送一条提示,平均会触发 Claude 执行大约 10 个动作——有时甚至超过 100 个⁶。在每个轮次中,Claude 会读取文件、编辑代码、运行命令,平均输出 2400 词的内容。
Claude 在两次检查点之间做了多少工作,很大程度上与谁在做决策相关。当用户牢牢掌控执行决策(即做出超过 80% 的执行决策)时,Claude 每轮执行的动作较少(大约 8 个)。而当 Claude 掌控了规划决策(即做出超过 80% 的规划决策)时,它执行的动作最多(大约 16 个)。
Agentic 编码与专业经验的持续回报

专家水平
Claude 根据每条对话记录,将用户在任务中的表现从新手到专家划分为五个等级。专家分类器关注三个信号:用户下达指令的精确度、用户要求 Claude 验证的内容,以及究竟是用户纠正 Claude 还是 Claude 纠正用户。请注意,专家水平衡量的是与职位头衔或通用能力截然不同的东西——而且关键的是,它是针对具体任务的。一位高级工程师第一次问 Rust 问题,在 Rust 上就是新手;一位从未用过 Python 的会计师,却能准确告诉 Claude 必须执行哪些对账规则,并在月末结账时抓住 Claude 遗漏的边缘情况,那他就是这项任务上的专家。
下表展示了分类器中每个专家等级的定义,以及来自公开编码代理会话数据集 SWE-chat 的示例请求。被归类为“新手”的对话给出的指令非常笼统,不包含任何领域特定知识。而“专家”对话则展现了对代码库和技术环境的深入理解。

我们量化了专家水平与 Claude 每次提示的输出和活动之间的关系。在典型的新手会话中,每次提示会触发大约 5 次 Claude 动作,输出约 600 词;而在专家会话中,动作链长度达到两倍以上(12 次动作),输出量更是新手的五倍(3,200 词)(图 3)。新手与专家会话之间的这一差距,在各类工作以及所有任务价值区间中都普遍存在。
代理式编程与专业知识持续回报
这些指标补充了我们此前关于 Claude Code 的报告中的自主性指标——当时我们追踪的是代理运行时长以及用户自动批准操作的频率。而这次引入的决策归因指标,则从整体上捕捉了整个会话中谁在做实质性决策;同时,每次提示的输出和动作指标,则衡量了每条人类提示究竟触发了 Claude 多少自主活动。

谁在用 Claude Code,用来做什么
用户画像
为了弄清这些工作是谁在做,我们根据会话转录推断每位用户的职业,并将其映射到美国劳工统计局标准职业分类(SOC)体系中的 23 个大类。分类器被明确告知:只能依据代理在会话开始时加载的项目上下文、用户文件的名称和结构、用户引用的任何工件(例如法律文件、临床数据、财务报告、课程大纲等)以及他们使用的词汇来推断。指令还明确要求:不能把“编码行为”本身当作编码职业的证据。只有当有明确信号表明软件或数据工作就是用户的职业时,才会将会话归类到编码 SOC 代码(计算机与数学职业)。例如,一位律师编写脚本来自动检测合同文件夹中缺失的条款,这个会话会被归入法律职业——即使会话的主要工作是写代码。当没有任何关于用户职业的信号时,该会话会被标记为“未分类”。
我们能够推断出约 70% 的会话中用户的职业。在这些已分类的会话中,计算机与数学职业(涵盖大多数软件相关岗位)毫无悬念是最大的群体。接下来是商业与金融运营、艺术/设计与媒体、管理以及生命/物理/社会科学。在我们的样本中,增长最快的非软件职业组是管理、销售和法律。
代理式编程与专业技能的持续回报
工作内容的变化
2025年10月至2026年4月期间,使用 Claude Code 完成的工作构成发生了显著变化。最明显的是,用于修复损坏代码的会话占比从33%下降到了19%(图4)。取而代之的是,与代码相关的工作占比上升。运维软件从14%增长到21%。写作和数据分析的占比大约翻了一番,从约10%增长到20%。
工作任务本身的价值也在提升。我们通过询问这些工作在自由职业平台上需要多少费用来估算每个会话的经济价值,并对照一个公开的真实任务数据集进行校准。按此衡量,平均每个会话的估算价值在10月到4月期间上涨了27%。这种增长在多种任务类型中普遍存在。构建、运维和修复类任务的价值均增长了约三分之一或更多(分别约为43%、34%和32%)。这些价格估算比较粗略,因此我们主要将其用于比较不同任务随时间的变化,而不是将其视为字面上的货币价值。关于任务估算器的构建细节,请参见附录。

成功取决于使用者的水平
任务的估算价值是了解 Claude Code 如何帮助人们工作的一种方式。另一个角度是观察有多少会话是成功的,以及会话的哪些特征与成功相关。在我们所有的成功衡量指标中,我们看到了一个清晰的模式:人在会话中表现出的专业水平越高,成功的可能性就越大。大部分收益集中在专业水平较低的一端——新手会话与中级会话之间的差距,大于中级会话与专家会话之间的差距。