←
指令微调编辑历史
提交《指令微调》修改,状态:approved
查看这次修改
# 指令微调 ## 1 基本概念 ### 1.1 定义与原理 指令微调(Instruction Fine-tuning)是一种针对大型语言模型(LLM)的迁移学习技术,通过在包含自然语言指令及其对应期望输出的数据集上对预训练模型进行进一步训练,使模型学会理解并遵循人类指令完成各种任务。该技术最早由Google的FLAN、OpenAI的InstructGPT等工作推广,显著提升了模型在零样本和少样本场景下的泛化能力,成为现代对话式AI(如ChatGPT)的核心训练环节之一。 #### 1.1.1 预训练与微调的区别 预训练阶段,模型在大规模无标注文本上通过自监督学习(如预测下一个词)掌握语言的基本语法、知识和模式——这好比让一个学生读遍图书馆的所有书籍,但从未教过他如何回答具体问题。微调阶段则是在特定任务数据上对模型进行有监督训练,使其输出符合任务要求。指令微调的区别在于:它使用“指令-回答”配对数据,而非简单的分类标签或翻译对,将模型从“被动地续写文本”转变为“主动地回应指令”。 #### 1.1.2 指令格式与任务描述 每条指令数据通常包含三个要素:**指令**(如“请翻译下面这句话”)、**输入**(如“Hello”)、**输出**(如“你好”)。有些数据将输入直接嵌入指令,形成类似“将‘Hello’翻译成中文”的格式。任务描述可以是简短的自然语言,也可以是带有占位符的模板。核心在于让模型理解“用户想要什么”,而不是仅仅机械地匹配模式。 ### 1.2 历史沿革 #### 1.2.1 FLAN与T0的探索 2021年,Google的FLAN(Finetuned Language Net)首次系统性地将预训练语言模型在多个自然语言指令数据集上进行微调,验证了“统一任务格式”的巨大潜力——模型在未见过的任务上也能表现出色。随后,由BigScience团队推出的T0模型进一步
Ciallo~(∠・ω< )⌒★