跳到索引

GLOSSARY

指令微调

用数千条“指令-回答”对微调基础模型,让它学会听懂要求——介于原始预测器与可用助手之间的那一步。

基础模型只会续写文本,不会服从。指令微调以示例教会服从:把精心策划的任务写成指令并配上好回答,覆盖各种格式(列表、表格、代码)、风格与领域。经过这一步,模型不再像输入法联想那样接你的话,而是像助手那样回答你的问题。

它位于预训练与偏好调优(RLHF/DPO)之间:先学会“有帮助的形式”,再由 RLHF 打磨“人们偏好的答案”。开源指令数据集与社区指令微调模型,正是“在 Ollama 里运行任何开源模型都开箱即对话”的原因。

相关术语

使用该技术的工具

相关分类