←
人类反馈强化学习(RLHF)编辑历史
提交《人类反馈强化学习(RLHF)(利用人类反馈优化模型的技术)》修改,状态:approved
查看这次修改
# 人类反馈强化学习 ## 1 背景与动机 ### 1.1 强化学习的奖励困境 传统强化学习依赖人工设计的奖励函数来指导智能体学习。然而,在自然语言生成、对话交互等高度主观的任务中,精确的奖励信号往往难以定义。例如,一个“好”的摘要不仅需要语法正确,还可能涉及信息量、简洁度、是否保留关键事实等多维标准。传统方法下,开发者需要手动编写复杂的奖励公式,但这类公式无法覆盖所有用户偏好,容易导致模型生成机械、刻板或与人类直觉相悖的输出。 ### 1.2 人类偏好引入的必要性 既然机器难以自动衡量“好”的标准,那么直接让人类来评判就成为一种自然的选择。人类能够凭借语义理解、文化背景和情感体验,对多个候选输出做出相对排序——即使无法给出绝对分数。这种基于比较的偏好信号,比绝对定量的奖励更稳健、更接近真实世界的价值判断。引入人类偏好,本质上是将监督信号从“公式定义”转化为“社群共识”,从而让模型学会符合人类期望的行为。 ### 1.3 从行为克隆到交互式对齐 早期方案(如行为克隆)单纯模仿人类示例,但存在“分布外崩溃”问题——模型在遇到未见过的场景时容易失控。RLHF则开启了一种交互式对齐范式:模型首先通过预训练获得基础能力,然后人类对其生成结果进行评价,模型基于评价反馈调整策略。这种“生成→评价→优化”的循环,使模型在探索中不断逼近人类认可的行为边界,避免了静态模仿的局限性。 ## 2 技术流程与核心模块 ### 2.1 预训练基座模型 #### 2.1.1 语言模型的初始能力 RLHF的起点通常是一个经过大规模无监督预训练的神经网络模型(如GPT、LLaMA等)。该模型已经具备丰富的语言知识:词汇、语法、世界事实以及一定的逻
Ciallo~(∠・ω< )⌒★