GLOSSARY
評価(Evals)
AI の振る舞いに対する体系的なテスト。固定タスクセットと採点器により、モデルやプロンプトの変更が実際に良くなったかを示します。
公開ベンチマーク(MMLU、HumanEval、SWE-bench)は、グラフに映える数字でモデルを比較可能にします — そのため「試験対策」もされます。公開された問題は最終的に学習データへ漏れるからです。本気のチームはプライベート eval を作ります。自社の実タスクの数百例を用意し、自動採点(完全一致、モデル as ジャッジ)または人手で採点し、変更の前後で毎回実行します。
「eval は AI のユニットテスト」が正しいメンタルモデルです。なければプロンプトとモデルの改善は雰囲気であり、あれば反復は測定可能になります — LLM 機能を「出した」チームと「動く状態で出した」チームの違いです。