AI 技术自研还是外购:面向定制 SLM 与通用 LLM 的协调差距框架

Dev.to ML 2026-07-29T16:50:05.190388

原文发布于 twarx.com —— 可前往阅读完整交互版本。最后更新:2026 年 7 月 29 日

当下大多数 AI 技术部署,都搞错了真正的问题。

自研(定制小语言模型 SLM)还是外购(现成的 GPT-5 或 Claude Sonnet 4.5 这类通用大语言模型 LLM)——这场争论本身,反而掩盖了真正让专业服务类 AI 技术项目失败的根源:协调(coordination)

以下案例中,某会计事务所仅通过调整架构,就把每月 AI 支出从 9000 美元砍到了 2100 美元,模型一个都没换。

瓶颈很少出在模型上。问题出在模型之间、系统之间、人与机器之间的衔接(handoffs)上。

为什么这很重要?因为企业买家现在正积极评估针对特定领域的 AI 技术——搜索“GPT-5 vs Microsoft Copilot Studio vs Claude Sonnet 4.5”的热度在飙升,各大机构、咨询公司和电商运营团队都在权衡:是该微调、采用检索增强,还是直接买现成的?

工具已经成熟了,但决策框架还没跟上。

你的模型准确率几乎无关紧要,衔接的可靠性才是全部。

$2,100

——某公司重构 AI 技术栈后的月度 AI 支出(从 9000 美元降至,模型不变)

部署数据,2026

78%

——一个 6 步流程链在单步准确率 96% 时的端到端可靠性

arXiv, 2025

42%

——声称集成/协调是生成式 AI 最大障碍的企业比例

AI 技术自研 vs 采购:面向自定义 SLM 与 LLM 的「协调差距」框架

McKinsey, 2025 读到最后,你会清楚知道:什么时候自定义 SLM 胜过前沿 LLM,各自成本是多少,以及真正决定成败的那一层该如何搭建。真正的决策不是模型大小——而是协调逻辑放在哪。这就是「AI 协调差距」框架的核心。
来源:为什么 AI 技术的「自研 vs 采购」之争是个陷阱?

找十位运维负责人问「是微调一个小模型,还是调用 GPT-5 API」,你会得到十个自信的答案,但没有人真的把系统交付过。原因很简单:模型极少是瓶颈。一个前沿 LLM 在单任务上准确率达 96% 听起来很棒,可一旦把六个这样的步骤串起来,端到端可靠性就会掉到 78%。我亲眼见过这种事:团队花几个月给模型打榜,却几乎没花任何时间去思考模型之间怎么连接。

一个六步流水线,每一步可靠性 97%,端到端也只有 83%。专业服务公司——律所、会计师事务所、营销机构、咨询公司,以及精简运营团队的电商企业——面临这个问题的特定版本。它们的价值在于把判断力应用到结构化、重复、高风险的工作上:合同审查、财务对账、营销活动质检、订单异常处理。这类工作是协调型的,不是单一型。它涉及系统、人和知识库之间的交接,任何一次模型调用都看不到全貌。这是现代企业 AI 技术的一个基础事实。

所以框定方式必须改变。问题不是「自定义 SLM 还是现成 LLM?」,而是「协调逻辑放在哪?每个协调任务最适合用哪个模型?」

正式框架——定义

AI 协调差距

AI 协调差距是指在 AI 步骤、系统和人类之间的交接处(而非任何单一模型内部)累积的可靠性、成本和可问责性损失。其成因是单个准确组件之间隐式且未经验证的过渡。其后果是:尽管单步基准测试表现优秀,生产环境却端到端失败。

AI技术自研还是采购:针对定制SLM与大语言模型的协调差距框架

一旦你理解了协调差距,模型选择就成了下游决策。你会为每个协调任务挑选最便宜、最快且能达到准确率要求的模型——然后把真正的工程投入放在连接这些模型的编排层。有时是本地运行一个30亿参数的微调SLM,每次调用成本仅0.0001美元;有时是为了某个推理密集的步骤使用Claude Sonnet 4.5。通常两者都会用上,成本差距可达10到40倍。

通过微调SLM在窄任务上降低成本的对比(前沿LLM vs 微调SLM)

arXiv, 2025

60%

围绕协同重新架构后,对账时间下降

Deloitte, 2025

96% → 78%

六步链中,单步准确率 vs 端到端可靠性

arXiv, 2025

特斯拉前AI总监Andrej Karpathy反复提到:生产环境机器学习的难点在于数据和系统管道,而不是模型本身。这其实就是“协同差距”的精简概括。Gartner与《哈佛商业评论》的研究也印证了同样模式:价值流失的根源在于集成,而非智能。本文为你提供一个命名框架来填补这一差距,以及一张具体的决策矩阵,帮你判断何时自建定制SLM、何时采购现成LLM。

一家中型咨询公司的解决方案架构师Priya Venkataraman在审阅了本框架初稿后直言不讳:“我们第一个季度都在争论该授权哪个模型。可一旦我们把交接流程画出来,模型选择问题就自己有了答案——可靠性数据也不再让我们在客户面前丢脸。”这种视角转换,就是整个框架的核心所在。

什么是AI技术协同栈的六个层次?

该框架将任何专业服务领域的AI部署拆解为六个层次。每一层都有其对应的模型选择、故障模式以及在自建与采购决策中的位置。把层次理清了,模型选择几乎就是顺手的事。层次搞错了,再多的提示工程也救不了你。

专业服务AI的六层协同栈

1

接入与路由层(SLM)
一个经过微调的小型分类模型(例如3B参数的Llama或Phi-4 SLM),能在50毫秒内、以几分钱成本标记输入的请求——合同类型、工单类别、订单异常。现成的LLM在这里是大材小用,而且慢20倍。

2

检索层(RAG + 向量数据库)
通过Pinecone或pgvector拉取企业专属上下文——历史合同、标准操作流程、客户档案。领域知识就存放在这里,无需重新训练模型。延迟预算:100–300毫秒。

3

查看原文