FreeMask 项目使用教程
1. 项目介绍
FreeMask 是一个开源项目,旨在通过生成带有密集注释的合成图像来增强语义分割模型的性能。该项目在 NeurIPS 2023 上发表,提供了官方的 PyTorch 实现。FreeMask 通过从语义掩码生成多样化的合成图像,并使用这些合成图像对来提升全监督语义分割的性能。
主要特点
- 合成图像生成:从语义掩码生成多样化的合成图像。
- 密集注释:合成图像带有密集的注释,有助于提升分割模型的性能。
- 增强分割模型:通过使用合成图像对,显著提升语义分割模型的性能。
2. 项目快速启动
安装依赖
首先,确保你已经安装了以下依赖:
pip install -U openmim
mim install mmengine
mim install "mmcv>=2.0.0"
pip install "mmsegmentation>=1.0.0"
pip install "mmdet>=3.0.0rc4"
下载数据集
下载 ADE20K 和 COCO-Stuff-164K 真实数据集,并按照说明进行预处理。
下载合成数据集
FreeMask 提供了已经处理好的合成 ADE20K 和 COCO-Stuff-164K 数据集,你可以直接下载使用:
训练模型
使用以下命令启动训练:
bash dist_train.sh <config> 8
生成和预处理合成图像(可选)
如果你需要生成额外的合成图像,可以按照以下步骤进行:
-
生成合成图像:
# 参考 FreestyleNet 的生成步骤 -
预处理合成图像:
python preprocess/filter.py <config> <checkpoint> --real-img-path <> --real-mask-path <> --syn-img-path <> --syn-mask-path <> --filtered-mask-path <>
3. 应用案例和最佳实践
应用案例
FreeMask 可以广泛应用于需要高精度语义分割的场景,如自动驾驶、医学图像分析、遥感图像处理等。通过使用合成图像对,可以显著提升分割模型的鲁棒性和准确性。
最佳实践
- 数据增强:在训练过程中,使用合成图像对进行数据增强,可以有效提升模型的泛化能力。
- 模型微调:在特定任务上,使用合成图像对进行模型微调,可以进一步提升模型的性能。
4. 典型生态项目
MMSegmentation
MMSegmentation 是一个基于 PyTorch 的语义分割工具箱,提供了丰富的分割模型和工具。FreeMask 与 MMSegmentation 兼容,可以直接使用 MMSegmentation 提供的模型和工具进行训练和评估。
MMDetection
MMDetection 是一个基于 PyTorch 的目标检测工具箱,提供了多种检测模型和工具。虽然 FreeMask 主要关注语义分割,但与 MMDetection 结合使用,可以进一步提升多任务学习的性能。
FreestyleNet
FreestyleNet 是一个用于从语义掩码生成合成图像的项目。FreeMask 在生成合成图像时严格遵循 FreestyleNet 的方法,因此可以与 FreestyleNet 结合使用,进一步提升合成图像的质量。
通过以上模块的介绍和实践,你可以快速上手 FreeMask 项目,并将其应用于实际的语义分割任务中。
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust089- DDeepSeek-V4-ProDeepSeek-V4-Pro(总参数 1.6 万亿,激活 49B)面向复杂推理和高级编程任务,在代码竞赛、数学推理、Agent 工作流等场景表现优异,性能接近国际前沿闭源模型。Python00
MiniMax-M2.7MiniMax-M2.7 是我们首个深度参与自身进化过程的模型。M2.7 具备构建复杂智能体应用框架的能力,能够借助智能体团队、复杂技能以及动态工具搜索,完成高度精细的生产力任务。Python00
GLM-5.1GLM-5.1是智谱迄今最智能的旗舰模型,也是目前全球最强的开源模型。GLM-5.1大大提高了代码能力,在完成长程任务方面提升尤为显著。和此前分钟级交互的模型不同,它能够在一次任务中独立、持续工作超过8小时,期间自主规划、执行、自我进化,最终交付完整的工程级成果。Jinja00
Kimi-K2.6Kimi K2.6 是一款开源的原生多模态智能体模型,在长程编码、编码驱动设计、主动自主执行以及群体任务编排等实用能力方面实现了显著提升。Python00
Hy3-previewHy3 preview 是由腾讯混元团队研发的2950亿参数混合专家(Mixture-of-Experts, MoE)模型,包含210亿激活参数和38亿MTP层参数。Hy3 preview是在我们重构的基础设施上训练的首款模型,也是目前发布的性能最强的模型。该模型在复杂推理、指令遵循、上下文学习、代码生成及智能体任务等方面均实现了显著提升。Python00