OpenBMB/OmniLMM项目中MiniCPM-o-2.6-Int4模型加载问题解析

2025-05-11 11:32:42作者：鲍丁臣Ursa

项目地址：https://gitcode.com/gh_mirrors/om/OmniLMM

问题背景

在OpenBMB/OmniLMM项目的使用过程中，部分开发者在尝试加载MiniCPM-o-2.6-Int4量化模型时遇到了加载错误。错误表现为当运行web_demos/minicpm-o_2.6/model_server.py脚本时，系统抛出"AttributeError: 'NoneType' object has no attribute 'get'"异常。

错误分析

该错误发生在模型加载阶段，具体是在transformers库尝试读取模型元数据时。错误表明系统无法正确解析模型的元数据文件，这通常与量化模型的特殊加载方式有关。MiniCPM-o-2.6-Int4作为一款4位量化的语言模型，需要特定的加载器才能正确初始化。

解决方案

针对这一问题，项目团队提供了专门的解决方案：

安装定制版AutoGPTQ：需要从项目指定的分支安装修改版的AutoGPTQ量化工具。这包括克隆特定版本仓库并安装：

git clone https://github.com/OpenBMB/AutoGPTQ.git
cd AutoGPTQ
git checkout minicpmo
pip install -vvv --no-build-isolation -e .

修改模型加载代码：不能直接使用标准的from_pretrained方法，而需要使用AutoGPTQForCausalLM.from_quantized方法进行加载。关键参数包括指定设备为CUDA、禁用exllama优化等。
完整加载示例：

import torch
from transformers import AutoTokenizer
from auto_gptq import AutoGPTQForCausalLM

model = AutoGPTQForCausalLM.from_quantized(
    'openbmb/MiniCPM-o-2_6-int4',
    torch_dtype=torch.bfloat16,
    device="cuda:0",
    trust_remote_code=True,
    disable_exllama=True,
    disable_exllamav2=True
)
tokenizer = AutoTokenizer.from_pretrained(
    'openbmb/MiniCPM-o-2_6-int4',
    trust_remote_code=True
)
model.init_tts()

技术原理

这一问题的本质在于4位量化模型需要特殊的加载处理。标准transformers库的加载机制无法正确处理这类模型的元数据格式。AutoGPTQ提供了专门的量化模型加载器，能够正确解析模型结构并初始化量化参数。

其中disable_exllama参数的设置尤为关键，因为MiniCPM-o-2.6-Int4使用了特定的量化方案，与标准exllama优化不兼容。通过禁用这些优化，可以确保模型正确加载。

最佳实践

对于使用量化模型的开发者，建议：

始终参考模型发布页面的官方加载指南
注意量化模型通常需要特定版本的依赖库
在加载失败时，检查CUDA版本与量化工具的兼容性
对于内存有限的设备，可以考虑分批加载大模型

总结

MiniCPM-o-2.6-Int4作为一款高效的量化语言模型，虽然加载过程需要特别注意，但一旦正确配置，能够为资源受限的环境提供强大的语言处理能力。理解量化模型的加载机制对于有效使用这类先进AI模型至关重要。

项目地址：https://gitcode.com/gh_mirrors/om/OmniLMM

登录后查看全文

项目优选

收起

deepin linux kernel

OpenHarmony documentation | OpenHarmony开发者文档

Ascend Extension for PyTorch

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

flutter_flutter

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

昇腾LLM分布式训练框架

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统