MagenticLite:为小型模型优化的代理体验
MagenticLite:为小型模型优化的代理体验

概览
- MagenticLite 是一款代理应用,可在单个工作流中同时操作浏览器和本地文件系统。作为 Magentic-UI 的下一代版本,它结合了重新设计的应用和为小型模型优化的运行时框架。
- MagenticBrain 和 Fara1.5 分别是为编排任务和计算机使用任务设计的小型模型。Fara1.5 是 Fara 的下一代迭代版本,在真实浏览器任务上带来了可衡量的性能提升。
- 这些发布共同探索了通过小型模型、协同设计的工具和优化的执行框架,能将代理性能推到何种程度。
今天,微软研究院 AI Frontiers 实验室 发布了 MagenticLite,这是一个专为小型模型设计的实验性代理应用。作为 Magentic-UI 的下一代产品,它可在单个工作流中同时操作浏览器和本地文件系统。
MagenticLite 由两个专用模型驱动:MagenticBrain(负责推理、委派和终端操作)和 Fara1.5(一个用于浏览器任务的计算机使用模型系列)。这三个组件被设计成一个整体系统协同工作。最终成果是一个运行高效、数据保留在用户设备上,并能支持广泛代理任务的智能体。这也指向了一个更宏大的目标:在用户硬件上直接运行的高能力智能体。
该项目围绕一个关键研究假设展开:代理能力取决于工具编排和行动,而非仅仅依赖知识。这一洞察使得使用小型模型成为可能,同时以更低的成本支持广泛的代理任务。
MagenticLite 也反映了我们端到端地应对代理 AI 的方式——从训练数据和模型设计到编排、交互设计,以及整个体验中的人类监督。

本次发布包含的内容
MagenticLite
作为我们实验性代理体验 Magentic-UI 的下一代版本,其代理运行时框架针对小型模型进行了重建,并根据社区反馈更新了用户界面。它可在单个工作流中同时操作用户的浏览器和本地文件系统。
MagenticBrain
MagenticBrain 是 MagenticLite 的规划器、编码器和委派器的三位一体。它能够将模糊的请求转化为具体计划,为每一步选择正确的工具或子代理,在需要时编写代码,并在任务中途出现故障时进行恢复。
Fara1.5
我们计算机使用模型系列的下一代版本。Fara1.5 提供三种规格,其中旗舰版为 90 亿参数模型,适用于大多数用例。Fara1.5 在小型计算机使用模型中创下了新的最优结果,使 Fara-7B 在网页导航上的性能几乎翻倍,对表单、需要凭证的网站以及长时间运行的任务处理更加精准。
每个组件单独使用都很有价值,但组合在一起效果最佳。协同设计应用、模型和运行时框架,使得在这种规模下实现高能力且可靠的代理性能成为可能。
我们的研究方法:以少胜多
我们从一个问题出发:要让一个小型模型真正擅长代理任务,需要什么?答案贯穿了整个生命周期——数据生成、训练目标、模型设计和编排必须重新设计,而且不能孤立进行。
我们从真实用例中识别需求,例如填写表单、进行浏览器研究以及在本地管理文件,并围绕这些需求构建了评估数据集。标准基准测试能反映部分情况,但并非总能直接衡量真实世界的有用性。基于场景的评估补充了这些基准测试,并成为模型和运行时框架迭代改进的关键信号,如图 2 所示。

在用户体验方面,我们保留了 Magentic-UI 的关键元素,包括智能体推理和行动的可视化、用户直接控制的能力,以及在关键节点进行显式批准。根据近期的用户研究,我们还通过更新浏览器视图和聊天视图使 MagenticLite 更易于学习和协作,让用户更容易理解智能体的行动并在需要时进行干预,如图 3 所示。

系统组件
Fara1.5:超越自身量级的计算机使用模型
Fara1.5 是我们计算机使用模型系列的下一代版本,提供三种规格,推荐使用旗舰版 9B 模型满足大多数用例。Fara1.5 在小型计算机使用模型中取得了新的最优性能,使 Fara-7B 在网页导航上的性能几乎翻倍,对表单、需要凭证的网站和长时间运行任务的处理更加出色。
去年 11 月,我们发布了 Fara-7B,这是一个专为在浏览器中完成任务而设计的小型代理模型。它采用了一种新颖的合成数据生成引擎进行训练,实现了同类最佳性能。Fara1.5 是该假设的下一步:基于 Qwen 3.5 的三个模型系列(4B、9B、27B),旨在弥补我们在之前发布版本中发现的差距。
新特性
最优结果。在流行的 Online-Mind2Web 基准测试(包含 300 个广泛使用的网页域任务)上,Fara1.5 在其尺寸类别中创下了新的最优结果。Fara1.5 超越了所有同等大小的模型,并使 Fara-7B 的性能几乎翻倍。更大的 Fara1.5-27B 变体在同一基准测试上达到了超过 90% 的性能。

改善的用户体验。除了基准测试上的改进,我们还改善了 Fara1.5 的用户体验。用户应能观察到日常任务(如填写表单、登录需要凭证的网站、预约)上有更强的性能。这些改进得益于我们 FaraGen 数据生成管线的下一次进化。除了在真实网站上进行训练,我们也在高度逼真的合成环境上训练模型,这些环境旨在模拟登录和不可逆操作等场景。
为长时间运行任务调优的原生动作空间。除了点击和键盘动作,Fara1.5 内置了工具,可以在数百个步骤中存储关键信息到上下文中,并在需要时向用户请求权限或偏好,帮助它在持续数分钟真实工作的任务中保持连贯性。
重新校准的关键节点。Fara-7B 被训练用于检测关键节点,例如交易、登录流程或不可逆提交等活动的节点,并进行标记。在 Fara1.5 中,我们对其进行了精细化调整...(原文可能被截断,但根据要求保持原文结构,我们按现有内容翻译)
(注:原文在"我们对其进行了精细化调整"处中断。但按要求输出翻译后的文章,不再添加额外内容。如果需要,后续部分应原文照翻,但此处按现有内容处理。)
(原文末尾被截断,但根据指令,我们只输出翻译后的中文文章。因此,翻译到此处即可。)