直接回答:Prompt 是代码的一部分,要用代码的方式管理:模板入库(Git)版本化,变量用模板语法显式声明,禁止把 prompt 散落在字符串拼接里;每次修改带 changelog 说明意图;配套回归评测集,改动前后各跑一遍对比指标;线上按版本灰度,可快速回滚到上一版本。
展开解析:具体落地分几块。存储上 prompt 模板独立成文件(如 Jinja/YAML),与应用代码同库,review 流程一致;模板里把系统指令、few-shot 示例、用户输入槽位分结构组织,便于 diff 定位改动。测试上分三层:单元级(模板渲染是否正确、变量缺失是否报错)、行为级(固定输入集跑模型,断言输出格式、关键字段、禁忌词)、指标级(评测集打分的总体分布)。发布上用配置中心或特性开关按版本路由流量,新版本先 5% 观察再全量。协作上的常见坑:多人改同一 prompt 互相覆盖、线上热改不入库导致无法复现,解法就是强制“入库 + 评测 + 灰度”三步,任何绕过流程的热改都视为事故。LangSmith、PromptLayer 等平台可做托管,但核心纪律与工具无关。
追问方向:多模型并存时 prompt 如何适配?few-shot 示例的选择如何评测?
(约 450 字)