提示词不是玄学:一套可复现的评测清单

「感觉更好了」无法上线。把提示词变更当成产品变更:有基线、有样本、有回归。

提示词工程常被误解为炼丹。真正可维护的做法,是把输入输出契约写清楚,并用固定样本集衡量每次改动。

最小评测清单

  1. 黄金集:50–200 条真实或拟真问题,覆盖主路径与刁钻边界。
  2. 期望锚点:每条注明必含要点、禁止事项、格式约束(JSON schema 等)。
  3. 自动检查:能规则化的先规则化(字段齐全、枚举合法、长度上限)。
  4. 人工抽检:对开放生成题保留分级评分(正确 / 部分 / 错误)。
  5. 失败归档:每次线上事故沉淀回黄金集,防止回归。

对比实验的纪律

  • 一次只改一个因素:系统提示、少样本、温度、模型版本。
  • 固定随机种子或多次取样看稳定性,而不是只看单次「神回答」。
  • 记录模型名、温度、日期;提示词用版本号或 git 管理。

常见反模式

堆砌形容词(「你是世界顶级专家」)却不给输出契约;用个别聊天截图证明全面提升;线上 prompt 与评测 prompt 两套漂移。

好的提示词像好的 API 文档:输入是什么、输出必须怎样、失败时如何表现。

小结

先建黄金集,再谈措辞润色。可复现的评测,能把「玄学优化」拉回工程迭代的节奏。