Topic Note
LLM 后训练学习笔记
这篇笔记整理大语言模型在预训练之后如何通过监督微调、偏好优化、奖励模型和评测闭环完成任务适配。重点不是堆术语,而是记录每个阶段解决的问题、依赖的数据和需要复盘的风险。
Pipeline
后训练流程示意
明确模型需要稳定完成的场景、输入边界和输出格式。
用高质量指令和参考答案建立基础回答风格。
让模型在多个可行答案中学习更合适的选择。
用固定样例和人工抽检确认能力没有明显倒退。
Concepts
核心概念
SFT 监督微调
SFT 关注“应该怎样回答”。它用人工整理或筛选出的指令数据训练模型,使模型学会遵循任务要求、控制输出格式、补全必要步骤。这里最容易被低质量数据拖垮:重复样例、含混指令和表面正确但逻辑松散的答案,都会让模型学到不稳定模式。
偏好优化
偏好优化关注“哪个回答更好”。常见数据形态包括成对比较、排序和打分。RLHF、DPO、IPO、KTO 等路线都试图把人类偏好或任务偏好转化为训练信号,但需要警惕模型过度迎合单一偏好,变得模板化、啰嗦或拒答过度。
奖励模型与规则评测
奖励模型适合表达复杂、难以硬编码的偏好;规则评测适合检查格式、关键词、边界条件和可复现指标。两者最好配合使用:奖励模型用于排序和方向判断,规则评测用于发现明确违规和回归问题。
Data
数据处理笔记
指令数据清洗
先去重,再过滤空泛、错答、格式混乱和明显泄露隐私的样例。之后按任务类型标注:问答、摘要、改写、推理、结构化输出、多轮对话、工具调用等。保留失败样例和边界样例,方便后续建立回归集。
样例配比
不同类型数据的比例会影响模型性格。格式类样例太多,模型可能变得机械;开放问答太多,模型可能忽略约束。需要按目标场景设计配比,并在每次训练后对比输出变化。
训练记录
记录学习率、batch size、训练轮数、上下文长度、LoRA 配置、有效 token 数和数据版本。每轮实验只改少量变量,否则结果变好也难以判断原因。
Evaluation
评测与复盘
格式稳定性
检查模型是否按要求输出 JSON、表格、步骤列表或固定字段。
事实与边界
观察模型是否在不确定时说明限制,是否编造不存在的事实。
推理过程
检查多约束任务中是否遗漏条件,是否只给结论不解释依据。
能力保留
确认目标任务提升时,通用问答、摘要和长文本理解没有明显退步。