提示词不是玄学:一套可复现的评测清单
「感觉更好了」无法上线。把提示词变更当成产品变更:有基线、有样本、有回归。
提示词工程常被误解为炼丹。真正可维护的做法,是把输入输出契约写清楚,并用固定样本集衡量每次改动。
最小评测清单
- 黄金集:50–200 条真实或拟真问题,覆盖主路径与刁钻边界。
- 期望锚点:每条注明必含要点、禁止事项、格式约束(JSON schema 等)。
- 自动检查:能规则化的先规则化(字段齐全、枚举合法、长度上限)。
- 人工抽检:对开放生成题保留分级评分(正确 / 部分 / 错误)。
- 失败归档:每次线上事故沉淀回黄金集,防止回归。
对比实验的纪律
- 一次只改一个因素:系统提示、少样本、温度、模型版本。
- 固定随机种子或多次取样看稳定性,而不是只看单次「神回答」。
- 记录模型名、温度、日期;提示词用版本号或 git 管理。
常见反模式
堆砌形容词(「你是世界顶级专家」)却不给输出契约;用个别聊天截图证明全面提升;线上 prompt 与评测 prompt 两套漂移。
好的提示词像好的 API 文档:输入是什么、输出必须怎样、失败时如何表现。
小结
先建黄金集,再谈措辞润色。可复现的评测,能把「玄学优化」拉回工程迭代的节奏。