MiniGemini项目中LLaVA预训练图像的使用说明

2025-06-25 12:05:47作者：吴年前Myrtle

Official implementation for Mini-Gemini

项目地址：https://gitcode.com/GitHub_Trending/mi/MiniGemini

在MiniGemini项目的微调数据集中，研究人员发现了一个值得注意的技术细节：minigemini_instruction.json文件中包含了大量来自LLaVA-Pretrain数据集的图像路径引用，但项目文档中并未明确提及这部分数据的使用情况。

技术背景

MiniGemini是一个多模态大模型项目，它需要同时处理文本和图像数据来进行训练和微调。在构建训练数据集时，项目团队采用了ShareGPT4V-100K数据集，而该数据集本身又引用了LLaVA-Pretrain中的图像资源用于生成图像描述。

数据组织方式

项目中的图像数据按照以下目录结构组织：

data/MiniGemini-Finetune/llava/LLaVA-Pretrain/images

用户需要将LLaVA-Pretrain数据集中的图像文件放置在上述路径下，才能确保训练脚本能够正确找到并加载这些图像资源。

实现细节

数据引用关系：MiniGemini的微调数据集间接依赖于LLaVA-Pretrain的图像资源，这种设计是为了复用已有的高质量标注数据，减少重复标注工作。
路径处理：项目代码中已经预设了LLaVA图像的相对路径处理逻辑，确保在训练过程中能够正确加载这些图像。
数据兼容性：这种设计保持了与LLaVA项目的数据兼容性，便于研究人员在不同项目间迁移和比较模型性能。

最佳实践建议

对于使用MiniGemini项目的研究人员和开发者，建议：

完整下载LLaVA-Pretrain数据集，并按照指定目录结构放置图像文件
在开始训练前，检查图像路径是否正确配置
了解这种数据组织方式的设计意图，以便更好地理解模型的训练过程

这种数据组织方式体现了深度学习项目中常见的数据复用策略，既节省了存储空间，又保证了数据质量的一致性。项目团队后续也更新了文档，明确了这部分数据的使用说明。

Official implementation for Mini-Gemini

项目地址：https://gitcode.com/GitHub_Trending/mi/MiniGemini

登录后查看全文

项目优选

收起

deepin linux kernel

OpenHarmony documentation | OpenHarmony开发者文档

Ascend Extension for PyTorch

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

flutter_flutter

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

昇腾LLM分布式训练框架

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统