VLMEvalKit项目中的TextVQA_VAL数据集解码问题分析

2025-07-03 15:28:21作者：谭伦延

Open-source evaluation toolkit of large multi-modality models (LMMs), support 220+ LMMs, 80+ benchmarks

项目地址：https://gitcode.com/gh_mirrors/vl/VLMEvalKit

在VLMEvalKit项目中使用cogvlm2-llama3-chat-19B模型评估TextVQA_VAL数据集时，开发者遇到了一个典型的Base64解码错误。这个错误的核心在于数据集中的某些图像数据不符合Base64编码规范，导致解码过程失败。

错误信息显示："Invalid base64-encoded string: number of data characters (5) cannot be 1 more than a multiple of 4"。这是一个标准的Base64编码格式错误，表明数据中存在长度不符合规范的字符串。Base64编码要求数据长度必须是4的倍数，而实际数据长度比这个要求多出了1个字符。

从技术实现来看，错误发生在vlmeval/smp/vlm.py文件中的decode_base64_to_image函数。该函数负责将Base64编码的字符串解码为图像数据，但在处理TextVQA_VAL数据集时遇到了格式问题。这种问题通常源于以下几种情况：

数据集中的某些图像数据可能被截断或损坏
数据预处理阶段可能存在编码错误
数据存储或传输过程中可能发生了意外修改

项目维护者已经确认修复了这个问题。对于开发者而言，这类问题的解决通常需要：

检查数据集的完整性，确保所有图像数据都经过正确编码
在解码前添加数据验证逻辑，过滤或修复不符合规范的Base64字符串
实现更健壮的异常处理机制，避免因单个数据错误导致整个评估过程中断

这个案例展示了在大型视觉语言模型评估中数据预处理的重要性。即使是成熟的开源项目，也可能因为数据集的特异性问题而需要调整。开发者在集成新模型或新数据集时，应当特别注意数据格式的兼容性，并准备好相应的错误处理策略。

Open-source evaluation toolkit of large multi-modality models (LMMs), support 220+ LMMs, 80+ benchmarks

项目地址：https://gitcode.com/gh_mirrors/vl/VLMEvalKit

登录后查看全文

项目优选

收起

ops-transformer

本项目是CANN提供的transformer类大模型算子库，实现网络在NPU上加速计算。

本项目是CANN提供的神经网络类计算算子库，实现网络在NPU上加速计算。

Ascend Extension for PyTorch

deepin linux kernel

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

华为昇腾面向大规模分布式训练的多模态大模型套件，支撑多模态生成、多模态理解。

cann-learning-hub

CANN 学习中心仓，支持在线互动运行、边学边练，提供教程、示例与优化方案，一站式助力昇腾开发者快速上手。

Jupyter Notebook

昇腾LLM分布式训练框架