GLOSSARY
データキュレーション
学習に何を入れるかを選ぶこと — フィルタリング、重複除去、重み付け — が、品質の競争でモデルアーキテクチャと同じほど重要になっています。
スケーリング時代の教訓は反転しました。ある点を超えると、より多いデータより良いデータが勝ちます。フロンティアラブは現在、アーキテクチャと同じだけキュレーションパイプライン — 品質分類器、重複除去、パープレキシティフィルタ、ドメイン別の混合重み — に投資します。キュレーションされたデータで学んだ小規模モデル(Phi シリーズ、現代の SLM)が、生のスクレイプで学んだより大きなモデルを恥じさせ、決定的に証明しました。
キュレーションは学習を超えて広がります。eval セットのキュレーションが何を測れるかを決め、RAG コーパスのキュレーションが根拠つきアシスタントが何を知りうるかを決めます。皮肉なことに、キュレーションはデータサイエンス最古の技法の新装です — しかし基盤モデルの規模では、前処理の雑務ではなく中核的な競争の堀になりました。