CogVLM模型权重转换:从SAT格式到HuggingFace格式的技术指南
2025-06-02 12:06:24作者:曹令琨Iris
概述
本文将详细介绍如何将CogVLM模型的权重从SAT格式转换为HuggingFace格式。CogVLM是由THUDM团队开发的多模态大语言模型,支持视觉和语言联合理解。在实际应用中,开发者可能需要将模型权重转换为HuggingFace格式以便于使用Transformers库进行推理和部署。
转换前的准备工作
在进行权重转换前,需要确保已完成以下步骤:
- 模型合并:如果使用了模型并行训练,需要先运行merge_model.py脚本将分片模型合并为完整模型
- LoRA权重合并:如果使用了LoRA微调,需要先将LoRA权重合并到基础模型中
转换脚本解析
以下是完整的SAT到HuggingFace格式转换脚本的核心逻辑:
def vlm(hf_dir: str, sat_dir: str = '~/.sat_models/cogvlm-chat'):
import os
import json
import torch
from pathlib import Path
# 创建输出目录
Path(hf_dir).mkdir(exist_ok=True)
# 加载SAT格式模型权重
state_dict = torch.load(os.path.expanduser(os.path.join(sat_dir, '1', 'mp_rank_00_model_states.pt')), map_location='cpu')
state_dict = state_dict['module']
# 权重映射转换
new_state_dict = {}
for k, v in state_dict.items():
# 处理视觉部分权重
if k.startswith('mixins.eva.vit_model.mixins.patch_embedding'):
new_state_dict[k.replace('mixins.eva.vit_model.mixins.', '', 1)] = v
elif k.startswith('mixins.eva.vit_model.transformer.position_embeddings'):
new_state_dict[k.replace('mixins.eva.vit_model.transformer.position_embeddings', 'patch_embedding.position_embedding', 1)] = v
# 处理MLP层权重
elif k.startswith('mixins.mlp.vision_dense_h_to_4h_list.'):
idx = str(k).replace('mixins.mlp.vision_dense_h_to_4h_list.', '').replace('.weight', '')
new_state_dict[f"model.layers.{idx}.mlp.vision_mlp.up_proj.weight"] = v
# 处理注意力层权重
elif k.startswith('transformer.layers.') and str(k).endswith('.attention.query_key_value.weight'):
idx = str(k).replace('transformer.layers.', '').replace('.attention.query_key_value.weight', '')
new_state_dict[f"model.layers.{idx}.self_attn.language_expert_query_key_value.weight"] = v
# 其他权重处理...
# 保存转换后的权重
torch.save(new_state_dict, os.path.join(hf_dir, 'pytorch_model.bin'))
# 生成配置文件
config = json.load(open(os.path.expanduser(os.path.join(sat_dir, 'model_config.json'))))
vision_config = {
'dropout_prob': 0.0,
'hidden_act': 'gelu',
'in_channels': config['eva_args']['in_channels'],
'num_hidden_layers': config['eva_args']['num_layers'],
# 其他配置参数...
}
final_config = {
'vision_config': vision_config,
'hidden_size': config['hidden_size'],
'intermediate_size': config['inner_hidden_size'],
# 其他模型配置...
}
with open(os.path.join(hf_dir, 'config.json'), 'w') as f:
json.dump(final_config, f, indent=2)
关键转换逻辑
-
视觉模型权重转换:
- 处理patch embedding层权重
- 转换位置编码权重
- 映射视觉Transformer层权重
-
语言模型权重转换:
- 处理MLP层权重映射
- 转换注意力层权重
- 处理LayerNorm层权重
-
特殊标记处理:
- 转换BOI(图像开始)和EOI(图像结束)标记
- 处理CLS标记嵌入
配置文件生成
转换脚本会自动从原始SAT配置生成HuggingFace格式的配置文件,包括:
- 视觉模型配置:包含图像尺寸、patch大小、层数等参数
- 语言模型配置:包含隐藏层大小、注意力头数、词汇表大小等
- 联合模型配置:整合视觉和语言模型的配置参数
常见问题解决
-
权重转换失败:
- 确保已完成模型合并和LoRA权重合并
- 检查输入模型路径是否正确
- 验证模型版本是否匹配
-
配置参数不匹配:
- 检查原始模型配置中的关键参数
- 确保转换后的配置与模型结构一致
-
性能差异:
- 转换后应进行推理测试验证结果一致性
- 检查是否有权重映射错误
总结
通过本文介绍的转换方法,开发者可以方便地将CogVLM模型从SAT格式转换为HuggingFace格式,便于后续的推理部署和应用开发。转换过程主要涉及权重名称映射和配置文件生成两个关键步骤,需要特别注意模型合并和LoRA权重合并等预处理工作。
登录后查看全文
热门项目推荐
相关项目推荐
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust073- DDeepSeek-V4-ProDeepSeek-V4-Pro(总参数 1.6 万亿,激活 49B)面向复杂推理和高级编程任务,在代码竞赛、数学推理、Agent 工作流等场景表现优异,性能接近国际前沿闭源模型。Python00
MiniMax-M2.7MiniMax-M2.7 是我们首个深度参与自身进化过程的模型。M2.7 具备构建复杂智能体应用框架的能力,能够借助智能体团队、复杂技能以及动态工具搜索,完成高度精细的生产力任务。Python00
GLM-5.1GLM-5.1是智谱迄今最智能的旗舰模型,也是目前全球最强的开源模型。GLM-5.1大大提高了代码能力,在完成长程任务方面提升尤为显著。和此前分钟级交互的模型不同,它能够在一次任务中独立、持续工作超过8小时,期间自主规划、执行、自我进化,最终交付完整的工程级成果。Jinja00
Kimi-K2.6Kimi K2.6 是一款开源的原生多模态智能体模型,在长程编码、编码驱动设计、主动自主执行以及群体任务编排等实用能力方面实现了显著提升。Python00
Hy3-previewHy3 preview 是由腾讯混元团队研发的2950亿参数混合专家(Mixture-of-Experts, MoE)模型,包含210亿激活参数和38亿MTP层参数。Hy3 preview是在我们重构的基础设施上训练的首款模型,也是目前发布的性能最强的模型。该模型在复杂推理、指令遵循、上下文学习、代码生成及智能体任务等方面均实现了显著提升。Python00
热门内容推荐
最新内容推荐
从配置混乱到智能管理:DsHidMini设备个性化配置系统的进化之路如何用G-Helper优化华硕笔记本性能?8MB轻量化工具的实战指南打破音乐枷锁:用Unlock Music解放你的加密音频文件网盘加速工具配置指南:从网络诊断到高效下载的完整方案UI-TARS-desktop环境搭建全攻略:从零基础到成功运行的5个关键步骤突破Windows界面限制:ExplorerPatcher让系统交互回归高效本质突破Arduino ESP32安装困境:从根本解决下载失败的实战指南Notion数据管理高效工作流:从整理到关联的完整指南设计资源解锁:探索Fluent Emoji的创意应用与设计升级路径StarRocks Stream Load数据导入实战指南:从问题解决到性能优化
项目优选
收起
暂无描述
Dockerfile
689
4.46 K
Ascend Extension for PyTorch
Python
543
668
Claude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed.
Get Started
Rust
403
73
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
955
928
本项目是CANN开源社区的核心管理仓库,包含社区的治理章程、治理组织、通用操作指引及流程规范等基础信息
648
230
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
407
323
Oohos_react_native
React Native鸿蒙化仓库
C++
336
386
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
1.59 K
924
昇腾LLM分布式训练框架
Python
146
172
暂无简介
Dart
935
234