东南大学&D⁴Lab社区最新LLM后训练方案LoPT:无需“全模型反传”,更便宜,更快,也更克制

LoPT 训练 模型 梯度 显存
发布于 2026-06-11
139

我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。

扫码阅读
手机扫码阅读

文章主旨:

提出 LoPT(Local-Learning Post-Training)方法,在后训练时通过截断任务梯度传播路径(在 Transformer 中点插入 stop-gradient boundary),让后半模型负责任务适配、前半模型保持表示稳定,从而在降低训练成本的同时缓解能力退化。

关键要点:

  • LoPT 的核心是重新设计后训练时任务梯度的传播路径:任务梯度不再默认穿过整个模型,而是在中点被截断,后半模型接收任务损失,前半模型通过局部特征重建目标保持可训练。
  • LoPT 在 SFT 和 GRPO 任务上均能降低显存占用(如 SFT 显存 ↓36%)、保持或提升主任务性能,并缓解窄任务数据导致的能力退化。
  • LoPT 可与 LoRA、DeepSpeed-ZeRO3、gradient checkpointing、pipeline parallelism 等现有系统级优化叠加使用,进一步节省资源。
  • LoPT 不是另一个 PEFT 方法,而是一种梯度路由策略:显式设计任务梯度的传播范围,与参数化方式、系统优化正交。
  • 适用场景:后训练数据较窄、训练显存敏感、希望保留 held-out 能力、已在使用 LoRA/ZeRO/checkpointing/pipeline parallelism 的系统。

内容结构:

一、为什么需要重新思考 LLM 后训练?

当前后训练(SFT、DPO、RLHF 等)默认将任务损失端到端反传穿过整个 Transformer,但后训练数据通常比预训练数据窄,可能导致三个问题:显存更高、反向依赖更长、容易扰动预训练表示。LoPT 提出的问题是:任务梯度到底应该走多远?

二、方法:在中点插入一个梯度边界

将 Transformer 划分为前半部分 k₁ 和后半部分 k₂;k₂ 接收标准任务损失;k₁ 不接收任务梯度(通过 detach() 截断);k₁ 通过 lightweight feature reconstruction objective 保持可训练;辅助头训练后移除,推理路径与标准 causal LM 一致。LoPT 不是简单 freeze 前半模型,而是通过局部目标维护稳定接口。

三、实验结果

  • SFT 场景(Alpaca-52K + Llama-3.1-8B-Instruct):LoPT 在 GSM8K 提升 +25.48 pp、IFEval 提升 +15.53 pp,显存 ↓36%,速度 ↑3%。
  • GRPO 场景(GSM8K + Qwen2.5-7B-Instruct):主任务 GSM8K 保持接近(+0.39 pp),IFEval 提升 +3.69 pp,policy-update 显存 ↓21%,step time ↓9%。
  • LoRA 叠加(Qwen2.5-7B + MetaMathQA 100K):LoPT+LoRA 在 7 项评测中全胜,平均 +0.67 pp,显存 ↓36%,吞吐 ↑6%。
  • DeepSpeed-ZeRO3 叠加(Qwen2.5-7B + 8×A100 + bs=4 + ZeRO3):显存 ↓19%,吞吐 ↑6%。
  • 测试覆盖多个模型(Qwen3-4B、Qwen2.5-7B/32B、Llama-3.1-8B)、后训练任务(SFT、GRPO)、数据集(Alpaca、Tulu、Magpie、MetaMath、NuminaMath)和系统栈组合。

四、LoPT 的定位

不是另一个 PEFT,而是梯度路由策略。它补充了后训练优化中一个新的维度:任务梯度该走多远本身就是一个可设计的变量。可与 LoRA(参数维度)、ZeRO/checkpointing(系统维度)正交叠加。

五、适用场景

  • 后训练数据较窄,容易扰动预训练能力;
  • 训练显存敏感;
  • 希望保留 held-out 能力(如 instruction following、commonsense、truthfulness、held-out reasoning);
  • 已在使用 LoRA/ZeRO/checkpointing/pipeline parallelism 的系统。

六、总结

LoPT 通过在中点截断任务梯度,将模型分为表示保留和任务适配两部分。在多个实验设置中均能降低训练成本、缓解能力退化,可与现有优化技术叠加。

文章总结:

LoPT 提出一个简单但重要的后训练视角:任务梯度不一定必须穿过整个模型,显式设计其传播范围可以在降低成本的同时提升稳定性,值得在后训练流程中考虑。

AI生成未来