GLOSSARY
評価ハーネス
AI 製品のテストスイート。ゴールデンデータセット、スコアラー、品質が退帰したときにビルドを落とすゲート。
評価ハーネスはモデル行動の CI です。凍結した入力セットを保ち、「良い」の定義 — 完全一致、ルーブリック、モデル as ジャッジ、人間レビュー — を置き、ユーザーが見る前にその物差しでプロンプトやモデルの変更を回します。Braintrust と LangSmith がこのループを製品化し、多くのチームはまだ pytest と表を保っています。
ハーネスが無いと「モデルが悪くなった」は逸話です。あれば diff です。規律は、デモではなく本番を代表するデータセットを手入れすることと、製品は緑でないのに eval が緑になるまでチューニングする衝動に抗うことです。失敗しない eval は飾りです。