如何拯救LoRA初始化?LoRA-GA:性能显著提升+收敛速度更快!
发布于 2024-10-25
1433
版权声明
我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。
AI生成未来
扫码关注公众号
扫码阅读
手机扫码阅读
亮点直击
- 提出了 LoRA-GA,一种新颖的 LoRA 初始化方法,通过近似低秩矩阵的梯度与全权重矩阵的梯度来加速收敛。
- 确定了在非零初始化下的缩放因子,确保适配器输出的方差不受适配器的秩和输入维度的影响。
- LoRA-GA 在多个数据集上比原版 LoRA 性能有显著提升,同时实现了高达 2-4 倍的收敛速度提升。
方法
介绍了 LoRA-GA,包括两个关键组件:近似全微调的梯度方向和确保初始化过程中的秩和 Scale 稳定性。LoRA-GA 结合梯度近似和 Scale 稳定性,提出了一种新颖的初始化方法,显著加快了 LoRA 的收敛速度并提升了性能。
实验
LoRA-GA 在 T5-Base 模型的 GLUE 数据集子集以及 Llama 2-7B 模型的对话、数学和代码任务上的性能得到了验证。结果显示 LoRA-GA 与完全微调相当,且在某些数据集上性能更优。此外,消融研究证明了 LoRA-GA 中的非零初始化、稳定输出和梯度近似的有效性。
结论
LoRA-GA 作为 LoRA 的新初始化方案,能够在不改变架构或训练算法的情况下,提供高效的收敛加速。实验证明其可以与完全微调相媲美,甚至在某些情况下超越全微调的性能,为未来的研究提供了新的方向。
AI生成未来
AI生成未来
扫码关注公众号
还在用多套工具管项目?
一个平台搞定产品、项目、质量与效能,告别整合之苦,实现全流程闭环。
查看方案
AI生成未来的其他文章
华佗来了,首个具备复杂推理能力的医学大语言模型!港中文等发布HuatuoGPT-o1
点击下方卡片,关注“AI生成未来”后台回复“GAI”??
即插即用!CVD:第一个生成具有相机控制的多视图一致视频方案!(斯坦福&港中文)
点击下方卡片,关注“AI生成未来”>>后台回复“
风格控制水平创新高!南理工&InstantX&小红书发布CSGO:简单高效的端到端风格迁移框架
点击下方卡片,关注“AI生成未来”作者:Peng Xing等
系统回顾生成式AI的发展:GANs、GPT、自编码器、扩散模型和Transformer系列
点击下方卡片,关注“AI生成未来”
ChatGPT的推出引起
超燃!纯AI生成《泰坦尼克号》大片!浙大&阿里发布MovieDreamer:超长电影生成"梦工厂"
点击下方卡片,关注“AI生成未来”>>后台回复??
加入社区微信群
与行业大咖零距离交流学习
PMO实践白皮书
白皮书上线
白皮书上线