在上一节中,我们学习了如何根据 AI 的实际输出,一轮一轮地给提示词打补丁。但新的问题也跟着来了:旧版本和新版本都摆在面前,我们怎么证明新版真的更好?
很多小伙伴在评判提示词时,主要依靠一种非常玄学的方法——盯着答案看几眼,然后一拍大腿:“嗯,感觉这版更专业!”
“感觉不错” 当然可以作为参考,但如果这条提示词要反复使用、交给团队协作,甚至放进正式业务里,只靠感觉就不够了。毕竟,今天你觉得顺眼,明天换个人看,可能又是另一套标准了。
这时候,我们就需要给 AI 的结果准备一把尺子——提示词评测。
什么是提示词评测?
提示词评测(Prompt Evaluation),简单来说就是:先定好一套清晰的评价标准,然后再去检查 AI 的输出是不是真的完成了任务。

小伙伴们要搞清楚,我们评测的并不是提示词写得漂不漂亮,而是这条提示词运行之后,产出的结果好不好。
比如,一条提示词写了 300 字,看起来结构特别豪华,但生成的会议总结总是漏掉负责人,那它就不是一条好提示词。反过来,一条提示词只有五十字,却能稳定提取出正确的信息,那它反而更有价值。
这就像评价一份菜谱,我们不能只看纸上的文字写得多么优雅,最后还得尝一口锅里的菜。菜谱只是方法,端上桌的结果才是真正要验收的东西。
提示词评测与提示词优化不一样。简单来说,它们的分工是这样的:
- 提示词优化:负责修改 Prompt。
- 提示词评测:负责判断修改以后有没有真的变好。
评测之前,先定义什么叫 “好”
做提示词评测,最怕的一件事就是:标准还没统一,大家就急着去打分。
比如,你让 AI 写一篇产品介绍,运营可能觉得越有煽动性越好,法务觉得必须克制客观,而销售可能只关心有没有写对价格和参数。如果大家心里的 “好” 根本不是一回事,那么最后打分肯定吵成一锅粥。

因此,在做评测之前,我们先要搞清楚下面几个问题:
- 这项任务最核心的目标是什么?
- 哪些内容必须出现?
- 哪些错误绝对不能出现?
- 输出要给谁使用?
- 结果是给人阅读,还是要交给程序处理?
- 速度、成本和篇幅是否有要求?
目标不同,评测标准也会不同。例如,对于营销文案来说,我们可以多看重吸引力。但如果做的是合同信息提取,那么准确性和不编造就必须排在第一位。
我们不能拿评选广告词的尺子,去检查财务报表——那把尺子再精致,也量错了地方。
提示词评测的常用指标
一条提示词好不好,不能只看一个方面。对于大多数业务任务,我们可以重点关注下面这些通用指标。

1. 准确性
这是底线,指的是 AI 给出的事实、数字和结论必须是对的。
例如,让 AI 从会议记录中提取截止时间,原文写的是 8 月 15 日,它却写成 8 月 25 日。哪怕格式再漂亮,也属于准确性不合格。
对于计算、代码、资料问答和信息提取等任务,准确性通常应该占比较高。
2. 完整性
完整性,指的是该回答的内容有没有漏掉。
例如,一份会议记录中明确写了三项决策,AI 只提取出两项。它写出来的内容可能都对,但仍然不完整。
准确性关心 “写出来的对不对”,完整性关心 “该写的是不是都写了”。这两个概念看起来比较相似,但干活时却不能混为一谈。
3. 指令遵循
指令遵循,指的是 AI 有没有按照你的要求来完成任务。
例如,你要求它只总结结论,不要提出建议,它却在最后热情地补上了十条改进方案。内容可能有道理,但它没有听话。
其中,常见的检查点包括:字数限制、指定语言、必须包含的模块,以及避开禁止内容等。
4. 格式遵循
在工程化开发中,如果要求输出 JSON 或表格,那字段必须齐全、顺序必须对、而且 JSON 必须能被代码正常解析。
需要注意的是,格式正确不代表内容正确。一份完全合法的 JSON,也可能把金额写错。它只是穿得整整齐齐,并不代表肚子里没有装错东西。
5. 相关性与简洁度
相关性,指的是输出是否围绕当前任务,没有跑题;简洁度则关注有没有大量重复、套话和无关解释。
不过,简洁并不等于越短越好。该解释清楚的内容不能为了省字硬砍掉。真正理想的状态是:需要的都在,不需要的别来凑热闹。
6. 稳定性
同一条提示词,在多次运行或者换了相似输入后,质量是不是还一样稳。第一次完美,第二次漏字段,第三次换格式,这就是不及格的。
稳定性不能只靠一次运行判断。在下一节 “提示词测试” 中,我们会进一步学习如何使用测试集、回归测试和 A/B 测试来检查。
7. 任务专属指标
除了上面的通用指标,不同任务还需要增加自己的专属标准。
- 代码任务:能否运行、是否处理异常、有没有安全问题。
- 翻译任务:术语是否一致、语气是否自然、有没有漏译。
- 客服任务:是否符合业务政策、有没有越权承诺。
- 内容审核:是否漏掉高风险内容、是否误伤正常内容。
- 程序调用:响应时间、Token 成本和工具调用次数是否可接受。
评测指标不需要贪多。通常选择 3~6 个真正影响结果的指标,比列出 20 项看着专业但没人认真打分的标准更有用。
如何设计一份能落地的评分标准?
光有指标不够,我们还得把它变成能执行的规则。一个实用的评分标准,至少应该说明 3 件事:评什么、占多少分、什么情况能拿到这个分数。

1. 设立 “硬性淘汰条件”
有些错是致命的,不能靠别的优点拉平均分。比如退款审核写错用户、代码有明显漏洞、总结编造了不存在的合同条款。
像下面这种情况,只要占一条,直接判定不合格。
- 出现关键事实错误。
- 泄露隐私或敏感信息。
- 违反核心业务规则。
- 缺少必须返回的关键字段。
- 生成了无法解析或无法执行的结果。
2. 分配权重
不同指标的重要程度并不一样,我们可以根据业务目标分配不同权重。例如,一项 “会议纪要提取” 任务,可以使用下面这份评分卡。
示例:
# 会议纪要提取评分标准(总分 100 分)
1. 准确性:40 分
- 决策、负责人、日期和金额必须与原文一致。
2. 完整性:25 分
- 不得漏掉原文中已经明确确定的重要事项。
3. 格式遵循:15 分
- 必须按照 “决策、负责人、截止时间” 三个字段输出。
4. 不编造:15 分
- 原文没有的信息必须标记为 “未提及”。
5. 简洁度:5 分
- 不重复会议讨论过程,不输出无关建议。
硬性淘汰条件:
- 编造负责人、日期或金额。
- 把尚未确定的讨论内容写成最终决策。这样一来,“这版看起来不错” 就变成了一个可以检查、可以解释、也可以重复使用的标准了。
3. 把 “模糊标准” 写成 “可观察行为”
尽量不要写 “内容专业” 、 “表达高级” 、 “质量优秀” 这种看完以后,仍然不知道怎么打分的标准。更好的写法是:
- 不要写 “内容完整”,改成 “必须覆盖背景、问题、方案和下一步行动”。
- 不要写 “格式规范”,改成 “必须返回包含 title、summary 和 risk_level 的 JSON”。
- 不要写 “语气自然”,改成 “避免夸张口号、机械套话和连续三个以上感叹号”。
常见的提示词评测方法
评分标准准备好了,接下来由谁来打分呢?主要有下面几种常见方法。
1. 人工评测
人工评测,就是让真正的用户、业务人员或专家阅读 AI 输出,再按照标准打分。
- 优点:灵活,能理解语气、逻辑、实际可用性等复杂问题。
- 缺点:速度慢、成本高,而且不同的人可能会有不同偏好。
像法律、医疗、财务、品牌内容等高风险或强专业任务,人工评测通常不能完全省掉。

2. 规则和程序检查
能用代码验的,就别费人工。比如:
- JSON 能否正常解析。
- 必填字段是否齐全。
- 字数是否超出限制。
- 分类标签是否来自允许列表。
- 数字是否与参考答案一致。
- 输出中是否出现禁止泄露的敏感字段。
像这种规则检查速度快、结果稳定,非常适合对付格式和有明确答案的任务。

3. 让 AI 当裁判
我们也可以把输出、任务目标和评分标准交给另一个大模型,让它帮助打分。这种方式常被称为 “让大模型当裁判(LLM-as-a-Judge)” 。
这种方式比纯人工更快,也能处理一些无法用简单代码判断的内容,例如逻辑是否完整、语气是否合适、回答是否跑题。
不过,AI 裁判也有看走眼的时候,还可能会偏爱更长、更会包装的答案。 所以,别只丢一句 “这个回答好不好” 给它,而是要给它明确的评分标准,并要求它说明扣分的依据。

示例:
# 评测任务
请根据下面的评分标准,评估候选回答。
# 原始任务
[粘贴用户任务和必要资料]
# 评分标准
[粘贴各项指标、分值和硬性淘汰条件]
# 候选回答
[粘贴需要评测的 AI 输出]
# 要求
1. 逐项给出分数。
2. 引用候选回答中的具体内容说明扣分原因。
3. 不要因为文章更长、语气更自信就自动给高分。
4. 如果缺少判断依据,请明确说明。
5. 最后列出最需要改进的 3 个问题。注意,对于关键结果,最好还是要加上人工抽样复核。
4. 两两比较
有时候,让你直接决定一篇回答是 83 分还是 86 分挺难的,但让你比较 A 和 B 哪个更好,反而更容易。这种方法叫作 “两两比较(Pairwise Comparison)” 。
两两比较,特别适合比较旧提示词和新提示词的输出。比较时应尽量隐藏提示词版本,避免评测者因为知道 “B 是新版” 就下意识偏向 B。还可以交换 A、B 的展示顺序,减少顺序带来的影响。

完整实战:比较两条会议纪要提示词
接下来,我们通过一个简单案例,把前面的评测方法串起来。
假设我们有一段会议记录,其中明确写了 3 项内容:
- 会员功能计划在 8 月 15 日上线。
- 阿莫负责页面设计,7 月 28 日前完成。
- 阿兰负责接口开发,8 月 2 日前完成。
1. 版本 A(模糊版)
请总结这段会议记录。这个版本生成的结果通常比较自由:有时候会跑去总结讨论过程,有时候漏掉负责人,还可能热心地自己补个 “建议预算”。
2. 版本 B(清晰版)
请从会议记录中提取已经确定的事项。
按照下面的字段输出:
1. 决策事项
2. 负责人
3. 截止时间
要求:
- 只提取已经明确确定的内容。
- 不总结讨论过程。
- 原文没有的信息请写 “未提及”,不要猜测。为了公平比较,两个版本应该使用同一段会议记录、同一个模型和相同的运行条件,再按照同一份评分标准打分。
准确性:40 分
完整性:25 分
格式遵循:15 分
不编造:15 分
简洁度:5 分
硬性淘汰条件:编造负责人、日期或预算。假设版本 A 漏掉了一名负责人,并且自己脑补了 5000 元的预算,那么它不仅会在完整性上扣分,还会直接触发 “不编造” 的淘汰条件。
而版本 B 如果完整提取了三项信息,并把预算老老实实写成 “未提及”,就会得到更高的评价
通过评测,我们的目的不是为了争论 A 到底是 58 分还是 60 分,而是为了能清晰地说出:新版到底强在哪儿。
提示词评测的常见误区
小伙伴们在做提示词评测时,尽量避开下面这几个坑:
- 把偶然当必然:只看到一条漂亮的输出,就觉得提示词完美了,这其实可能是运气好。
- 先看结果,再临时修改评分标准:看到结果后才去改标准,这就等于是给答案定做奖状,毫无意义。
- 所有指标都平均分配:真实业务里重点是不一样的,别所有指标都给一样的权重。
- 只看平均分,忽略致命错误:只要泄露了隐私或者算错了金额,其他部分得满分也没用,绝对不能拿来平均及格。
- 完全相信 AI 裁判:AI 可能偏爱长篇大论,所以高风险任务务必要搭配人工抽查。

提示词评测检查清单
在开始评测前,我们可以快速对照下面这些问题查一遍:
- 任务目标讲清楚了吗?
- 评测指标真的对业务有用吗?
- 每个指标都有可观察的打分标准吗?
- 硬性淘汰条件设置了吗?
- 不同版本是在同样的输入和模型下比较的吗?
- AI 裁判的结果有人工抽查吗?
- 各个版本的评分和对应提示词都妥善保存了吗?
评测的目的,并不是要把每条提示词都包装成一张满分的成绩单,而是帮咱们更快地发现问题,并做出有依据的选择
常见问题
1. 提示词评测一定需要标准答案吗?
不一定。像提取、计算这类任务确实有标准答案,但对于写文章、给方案这种开放式的任务,往往没有唯一解。这时候咱们就更需要依赖明确的评分标准、两两比较和人工判断了。
2. 可以完全让 AI 去评测 AI 吗?
不建议。AI 当裁判能帮你挡掉很多初级的脏活累活,但它也有误判的时候。对于核心任务,最好是做到 “程序规则 + AI 辅助 + 人工抽查” 三管齐下。
3. 评测指标是不是越多越专业?
不是。指标太多不但增加成本,还可能让真正重要的目标被稀释。挑出 3 到 6 个最核心的指标,再加上硬性淘汰条件,就已经非常实用了。
