LL3DA 项目使用教程
2024-09-26 01:39:18作者:温艾琴Wonderful
1. 项目介绍
LL3DA 是一个大型语言 3D 助手,能够响应复杂 3D 环境中的视觉和文本交互。该项目在 CVPR 2024 中被接受,旨在通过点云作为直接输入,帮助大型多模态模型(LMM)更好地理解人类交互,并消除 3D 场景中的模糊性。LL3DA 在 3D 密集标注和 3D 问答任务中表现出色,超越了多种 3D 视觉语言模型。
2. 项目快速启动
环境设置
首先,确保你的环境满足以下要求:
- CUDA 11.6
- Python 3.8.16
安装必要的依赖包:
pip install h5py scipy cython plyfile 'trimesh>=2.35.39,<2.35.40' 'networkx>=2.2,<2.3' 'torch==1.13.1+cu116' 'transformers>=4.37.0'
然后,从源码构建 pointnet2 和加速的 giou:
cd third_party/pointnet2
python setup.py install
cd utils
python cython_compile.py build_ext --inplace
下载预训练嵌入
从 Hugging Face 下载预处理的 BERT 嵌入权重,并存储在 /bert-base-embedding 文件夹中。
数据准备
下载和准备 ScanNet 3D 数据
按照以下步骤下载 ScanNetV2 数据集:
cd data/scannet/
python batch_load_scannet_data.py
准备语言标注
下载并预处理 ScanRefer、Nr3D、ScanQA 和 3D-LLM 数据集,并组织文件结构如下:
/data/
ScanRefer/
ScanRefer_filtered_train.json
ScanRefer_filtered_train.txt
ScanRefer_filtered_val.json
ScanRefer_filtered_val.txt
Nr3D/
nr3d_train.json
nr3d_train.txt
nr3d_val.json
nr3d_val.txt
ScanQA/
ScanQA_v1.0_test_w_obj.json
ScanQA_v1.0_test_wo_obj.json
ScanQA_v1.0_train.json
ScanQA_v1.0_val.json
3D_LLM/
3d_llm_embodied_dialogue_filtered_train.json
3d_llm_embodied_dialogue_filtered_val.json
3d_llm_embodied_planning_filtered_train.json
3d_llm_embodied_planning_filtered_val.json
3d_llm_scene_description_train.json
3d_llm_scene_description_val.json
训练模型
使用以下命令训练 3D 通用模型:
bash scripts/opt-1.3b/train_generalist.sh
3. 应用案例和最佳实践
3D 密集标注
在 ScanRefer 和 Nr3D 数据集上进行微调:
bash scripts/opt-1.3b/tuning_scanrefer.sh
bash scripts/opt-1.3b/tuning_nr3d.sh
3D 问答
在 ScanQA 数据集上进行微调:
bash scripts/opt-1.3b/tuning_scanqa.sh
开放词汇对象检测
微调模型以预测边界框:
bash scripts/opt-1.3b/tuning_ovdet.sh
4. 典型生态项目
相关项目
- ScanNet: 一个大规模的 3D 室内场景数据集,用于训练和评估 3D 视觉模型。
- Hugging Face Transformers: 提供预训练的语言模型,如 BERT,用于文本处理。
- PointNet++: 一个用于处理点云数据的深度学习框架。
通过这些生态项目,LL3DA 能够更好地理解和处理复杂的 3D 环境,提供更强大的视觉和文本交互能力。
登录后查看全文
热门项目推荐
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0152- DDeepSeek-V4-ProDeepSeek-V4-Pro(总参数 1.6 万亿,激活 49B)面向复杂推理和高级编程任务,在代码竞赛、数学推理、Agent 工作流等场景表现优异,性能接近国际前沿闭源模型。Python00
LongCat-Video-Avatar-1.5最新开源LongCat-Video-Avatar 1.5 版本,这是一款经过升级的开源框架,专注于音频驱动人物视频生成的极致实证优化与生产级就绪能力。该版本在 LongCat-Video 基础模型之上构建,可生成高度稳定的商用级虚拟人视频,支持音频-文本转视频(AT2V)、音频-文本-图像转视频(ATI2V)以及视频续播等原生任务,并能无缝兼容单流与多流音频输入。00
auto-devAutoDev 是一个 AI 驱动的辅助编程插件。AutoDev 支持一键生成测试、代码、提交信息等,还能够与您的需求管理系统(例如Jira、Trello、Github Issue 等)直接对接。 在IDE 中,您只需简单点击,AutoDev 会根据您的需求自动为您生成代码。Kotlin03
Intern-S2-PreviewIntern-S2-Preview,这是一款高效的350亿参数科学多模态基础模型。除了常规的参数与数据规模扩展外,Intern-S2-Preview探索了任务扩展:通过提升科学任务的难度、多样性与覆盖范围,进一步释放模型能力。Python00
skillhubopenJiuwen 生态的 Skill 托管与分发开源方案,支持自建与可选 ClawHub 兼容。Python0112
项目优选
收起
暂无描述
Dockerfile
733
4.75 K
Ascend Extension for PyTorch
Python
618
795
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
433
395
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.01 K
1.01 K
Claude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed.
Get Started
Rust
1.18 K
152
deepin linux kernel
C
29
16
华为昇腾面向大规模分布式训练的多模态大模型套件,支撑多模态生成、多模态理解。
Python
145
237
暂无简介
Dart
983
252
昇腾LLM分布式训练框架
Python
166
198
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
1.68 K
989