优化kohya-ss/sd-scripts项目中LoRA提取的内存使用问题

2025-06-05 09:33:09作者：殷蕙予

在kohya-ss/sd-scripts项目中，用户报告了一个关于LoRA提取过程中内存占用过高的问题。特别是在使用SDXL DreamBooth模型进行128x128 rank常规LoRA提取时，即使在拥有29GB RAM和15GB VRAM的Kaggle环境中也会失败。

问题分析

LoRA提取过程需要同时加载原始模型和经过微调的模型，这导致了较高的内存需求。当处理较大模型如SDXL时，内存需求会显著增加，使得在资源有限的环境中难以完成提取任务。

项目维护者kohya-ss在dev分支中实现了以下优化方案：

设备分配优化：通过--load_original_model_to cuda参数，可以将原始模型加载到GPU显存中，而微调模型保留在系统内存中。这种分离加载策略有效降低了单设备的内存压力。
精度控制优化：新增了--load_precision参数，允许用户指定模型加载时的精度。例如：
- 对于fp16模型，使用--load_precision fp16
- 对于bf16模型，使用--load_precision bf16

这种精度控制不仅减少了内存使用量，还能保持模型的精度不受损失。

内存优化原理：通过将模型分散到不同设备(GPU和CPU)上，避免了单设备内存的峰值压力。同时，降低加载精度可以直接减少模型在内存中的占用空间。
精度选择建议：
- 当原始模型是fp16格式时，建议使用fp16精度加载
- 当原始模型是bf16格式时，建议使用bf16精度加载
- 这样可以确保在减少内存使用的同时不损失模型精度