跳到索引

GLOSSARY

评测套件

AI 产品的测试套件:黄金数据集、评分器,以及质量回退时拦住构建的门禁。

评测套件是模型行为的 CI。你保留一套冻结的输入,定义何为“好”——精确匹配、量表、模型裁判、人工复核——并在用户看到之前,用这把尺子跑过每一次提示词或模型改动。Braintrust 和 LangSmith 把这个闭环产品化了;很多团队仍是一份 pytest 加一张表。

没有套件,“模型变差了”只是轶事。有了它,就是一份 diff。纪律在于维护能代表生产而非演示的数据集,并抵制把评测刷绿、产品却没绿的冲动。从不失败的评测是装饰。

相关术语

使用该技术的工具

相关分类