GLM-4模型加载中的浮点精度问题解析与解决方案

2025-06-03 04:54:50作者：裴麒琰

在深度学习模型的实际应用中，浮点精度的选择对模型性能和硬件资源消耗有着重要影响。本文将以THUDM/GLM-4项目中的模型加载过程为例，深入分析浮点精度设置的关键问题。

问题现象

当开发者尝试使用transformers库加载GLM-4-9B模型时，发现即使显式指定了torch.float16精度，模型最终仍会以bfloat16精度加载。这与同期的Llama-3模型表现不同，后者能正确保持float16精度。

技术背景

现代深度学习框架通常支持多种浮点精度：

float16 (FP16)：16位浮点数，节省显存但数值范围较小
bfloat16 (BF16)：16位浮点数，保留与float32相同的指数位，训练稳定性更好
float32 (FP32)：32位标准浮点数

GLM-4系列模型在config.json中默认指定了bfloat16精度，这是出于模型稳定性的考虑。

问题根源

通过分析transformers库的模型加载机制，我们发现：

模型配置(config)中的torch_dtype参数具有最高优先级
AutoModelForCausalLM.from_pretrained()方法的config参数会覆盖直接传入的torch_dtype参数
GLM-4的config.json中明确设置了"torch_dtype": "bfloat16"

解决方案

开发者可以通过以下方式确保模型以指定精度加载：

修改配置法（推荐）：

config = AutoConfig.from_pretrained(path, torch_dtype=torch.float16, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(path, config=config, trust_remote_code=True)

强制转换法：

model = AutoModelForCausalLM.from_pretrained(path, torch_dtype=torch.float16, trust_remote_code=True)
model = model.to(torch.float16)

技术建议

对于GLM-4系列模型，建议保持使用bfloat16精度，这是经过验证的最佳实践
精度转换可能影响模型输出质量，转换后应进行充分测试
不同硬件对浮点精度的支持程度不同，需结合具体硬件选择

总结

模型精度选择需要平衡计算效率、内存占用和数值稳定性。GLM-4默认使用bfloat16是经过充分验证的配置，开发者如需修改应了解潜在影响。通过合理配置transformers加载参数，可以灵活控制模型精度以满足不同场景需求。

GLM-4

GLM-4 series: Open Multilingual Multimodal Chat LMs | 开源多语言多模态对话模型

项目地址：https://gitcode.com/gh_mirrors/gl/GLM-4

登录后查看全文

项目优选

收起

kernel

deepin linux kernel

docs

OpenHarmony documentation | OpenHarmony开发者文档

Ascend Extension for PyTorch

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

176

ops-math

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

Java

RuoYi-Vue3

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统

openJiuwen agent-studio提供零码、低码可视化开发和工作流编排，模型、知识库、插件等各资源管理能力

TSX

411

130