Liger-Kernel项目中的Z Loss优化技术解析

2025-06-10 12:28:22作者：尤辰城Agatha

Efficient Triton Kernels for LLM Training

项目地址：https://gitcode.com/gh_mirrors/li/Liger-Kernel

在大型语言模型(LM)的预训练过程中，损失函数的优化一直是研究者关注的重点。Liger-Kernel项目近期针对Z Loss优化技术展开了深入讨论和实现工作，这项技术在Chameleon和PaLM等知名模型中已被证明能有效提升训练稳定性。

Z Loss技术背景

Z Loss是一种在交叉熵损失函数基础上增加的辅助损失项，主要用于解决语言模型预训练过程中可能出现的数值不稳定问题。其核心思想是通过约束logits的L2范数来防止数值爆炸，从而提升训练过程的稳定性。

技术实现要点

Liger-Kernel团队在实现Z Loss时考虑了以下几个关键技术点：

与线性头的融合：相比现有实现，Liger-Kernel特别注重将Z Loss与线性头(linear head)的计算进行融合优化，这种设计可以显著减少内存访问开销，提升计算效率。
数值稳定性处理：在实现过程中，团队特别注意处理极端值情况，避免因数值不稳定导致的训练崩溃问题。
梯度计算优化：Z Loss的梯度计算需要特殊处理，团队通过精心设计的反向传播路径确保梯度计算的准确性和效率。

与标签平滑的关系

值得注意的是，Z Loss常与标签平滑(label smoothing)技术配合使用。Liger-Kernel项目已经单独跟踪了标签平滑的实现，并将Z Loss作为独立功能进行开发，以避免功能重复。这种模块化设计使得开发者可以灵活选择使用Z Loss、标签平滑或两者结合。

应用价值

在实际应用中，Z Loss技术带来了以下优势：

显著提升大规模语言模型训练的稳定性
减少训练过程中的数值异常情况
与现有优化器良好兼容，无需额外调整
计算开销小，几乎不影响整体训练速度

Liger-Kernel团队通过精心设计和实现，使得这一技术可以无缝集成到现有的训练流程中，为开发者提供更稳定、高效的模型训练体验。这项工作的完成标志着Liger-Kernel在深度学习基础设施领域又迈出了重要一步。

Efficient Triton Kernels for LLM Training

项目地址：https://gitcode.com/gh_mirrors/li/Liger-Kernel

登录后查看全文

项目优选

收起

deepin linux kernel

OpenHarmony documentation | OpenHarmony开发者文档

Ascend Extension for PyTorch

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

flutter_flutter

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

昇腾LLM分布式训练框架

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统