你还停留在提示工程阶段吗?

Dev.to ML 2026-07-15T21:24:29.198603

曾几何时,提示工程(prompt engineering)就像在寻找一句完美的咒语:给模型设定一个角色,加几个示例,要求结构化输出,不断调整措辞直到回复变好。这些技巧现在依然管用。但当 AI 从实验阶段走向生产环境,提示词就只是整个大系统中的一个环节而已。更有价值的问题不再是「如何写出更好的提示词?」,而是「模型需要什么样的系统支撑,才能做到好用、可信、可量化?」

提示工程 vs. AI 系统设计

提示工程关注的是给模型下达的指令。AI 系统设计关注的则是模型周围的完整环境,包括:它接收的上下文、它检索到的信息、它能使用的工具、用来评估它的测试、控制其行为的规则、以及工作流中内置的人工审核环节。一个写得再好的提示词,也不可能自动知道公司政策有没有更新、没法判断某个来源是否已经过时、更不会决定高风险回复是否需要人工批准——这些全都是系统设计要解决的问题。

为什么聪明的提示词还不够

想象一下,客服团队用 AI 来起草退款回复。提示词驱动的做法可能是这样:先写一句「你是一位客服专家,请撰写一封礼貌的退款回复」,然后不断往里加「要共情」「语气专业」「回复要简短」之类的指令。这能改善措辞,但解决不了生产环境里的根本问题。面向系统的做法会额外做到:检索最新的退款政策、获取相关的客户和订单信息、检查拟好的回复是否符合业务规则、识别异常或不被支持的主张、把风险较高的案例转给人工审核。提示词依然重要,但它是运行在一个为准确性、安全性和业务适配而设计的工作流之中。

提示思维 vs. 系统思维

提示思维关心的是:我该写什么才能拿到更好的回答?系统思维关心的是:用户到底想完成什么任务?要安全地让AI帮上忙,需要哪些信息、检查点和流程步骤?举个例子:分析师让AI总结销售趋势时,提示思维只盯着怎么把问题写清楚。系统思维则会追问:模型能访问到最新数据吗?数据集完整吗?答案里要不要注明假设条件?输出结果是放仪表盘、写报告还是开会用?结果怎么核查?这一转变把目标从“生成让人印象深刻的回答”变成了“产出可靠的结果”。

AI系统的五个基本层

1. 上下文

模型只能根据它拿到的信息来做推理。如果一个AI系统缺少最新的政策、产品文档、客户历史、业务规则或具体任务指引,光靠优化提示词是解决不了问题的。很多看似模型出错的情况,本质上都是上下文缺失。

2. 检索

检索增强生成(RAG)把“找信息”和“生成答案”分成了两步。生产系统可以先去经过审核的数据源里搜索,对最相关的段落排序,最后只把必要的上下文喂给模型。一个健壮的检索层还得能处理不确定性——当找不到可靠来源时,系统应该直说“没有找到”,而不是让模型去瞎猜。

3. 评估

看起来“不错”的回答,不一定准确、安全或可靠。团队需要构建可重复的测试用例,覆盖这些场景:正常请求、模糊问题、上下文缺失、文档矛盾、对抗性指令、策略例外。然后对输出进行评估,检查准确性、引用质量、策略合规性、安全性以及升级处理能力。

4. 治理(Governance)

生产级的 AI 系统必须要有清晰的边界。治理要明确这些事:模型能做什么、不能做什么、可以访问哪些数据、什么时候必须注明信息来源、什么时候该向上级汇报、哪些结果需要人工审批。安全、隐私、访问控制以及提示注入防护(prompt injection resistance)属于应用层面的职责,不能只靠提示词来兜底。

5. 工作流匹配(Workflow Fit)

就算技术上回答得再漂亮,如果不符合用户的实际工作流程,照样会失败。用户需要的是三行字的工单摘要,你给出一份完美的三页报告——那就完全没用。当真实需求是分类、推荐或者审批决策时,一份冗长的分析反而成了累赘。

查看原文