跳到索引

GLOSSARY

评测(Evals)

对 AI 行为的系统化测试:固定的任务集与评分器,告诉你模型或提示词的改动是否真的变好了。

公开基准(MMLU、HumanEval、SWE-bench)让买家能在漂亮的图表数字上比较模型——也因此被“应试”,凡是公开的题目最终都会泄漏进训练数据。严肃团队因此构建私有评测:几百条真实任务样例,自动评分(精确匹配、或以模型为裁判)或人工评分,每次改动前后都跑一遍。

“评测就是 AI 的单元测试”是正确的思维模型:没有评测,提示词与模型升级全凭感觉;有了评测,迭代变得可度量——这正是“发布了 LLM 功能的团队”与“发布了能用的 LLM 功能的团队”之间的差别。

相关术语

使用该技术的工具

相关分类