SkillOpt:将智能体技能作为可训练参数

Microsoft Research 2026-07-03T09:05:28.606283

概览而言,AI 智能体常常因其指令或技能被手动修改而失败,且修改后无法保证性能提升。SkillOpt 将技能编辑转化为一个训练过程,使智能体行为更加可靠,而无需修改模型权重。SkillOpt 将智能体技能文件视为冻结目标模型之外的一个可训练参数,将技能编写从一次性提示转变为受控的优化过程。在六个基准测试、七个目标模型和三种执行模式下,SkillOpt 在所有 52 个评估单元中均为最佳或并列最佳方法,在不更新模型权重的情况下提升了性能。通过受限文本编辑、验证门控、拒绝编辑反馈以及慢速/元更新,SkillOpt 保持技能紧凑且可审计,避免了不受控制的提示漂移。优化后的技能可跨模型规模、智能体框架及相关任务迁移,表明它们捕获了可复用的工作流知识,而非特定于基准测试的指令。

大语言模型(LLM,Large Language Model)越来越多地被部署为智能体,用于收集证据、调用工具并执行多步骤任务。对于这些智能体来说,难题已不再是如何调用工具,而是能否可靠且一致地完成任务。如今,智能体技能通常来自三个来源:专家手写、前沿模型一次性生成,或智能体在执行后粗略修订。这些方法均不像深度学习优化器那样运作。它们缺乏步长控制、保留验证集,以及任何对失败修订的记忆。结果,技能往往随每次重写变得更长并发生漂移,而看似完全合理的修订却可能悄悄降低实际任务性能。这种不受控制的技能演变已成为从智能体原型迈向可靠、生产级部署的主要障碍。

查看原文