ChatGLM3微调实践：PTuning_v2与LoRA效果对比及参数解析

2025-05-16 22:30:02作者：傅爽业Veleda

微调过程中的参数设置问题

在ChatGLM3项目中进行PTuning_v2微调后，使用inference_hf.py进行推理时会出现一个关于max_new_tokens和max_length参数的警告信息。这个警告表明在文本生成过程中同时设置了max_new_tokens(默认512)和max_length(默认8192)两个参数，系统会优先采用max_new_tokens的设置。

实际上，这个警告对生成结果没有实质性影响，它只是提醒开发者注意参数设置的优先级。在大多数情况下，512个token的生成长度已经足够满足需求，如果确实需要更长的生成结果，可以显式地在推理脚本中调整max_new_tokens参数。

predict_with_generate参数详解

在微调配置文件中，predict_with_generate是一个关键参数，它决定了模型在预测时的行为模式：

当设置为true时，模型会使用生成模式进行预测，即像正常对话一样逐步生成文本输出，这种方式可以与微调数据集中的标签(label)进行对比评估。
当设置为false时，模型不会生成完整输出，而是直接计算预测结果与标签的差异。

这个参数主要影响评估阶段的行为，对于实际推理应用影响不大。在大多数微调场景下，建议保持默认设置(true)，这样可以更直观地观察模型的生成效果。

PTuning_v2与LoRA微调效果对比

实践表明，在相同训练步数的情况下，LoRA微调方法往往比PTuning_v2获得更好的效果。这种现象在实际应用中很常见，主要原因包括：

参数更新方式不同：LoRA通过低秩适配器更新模型参数，保留了原始模型的大部分知识；而PTuning_v2主要依靠提示调优。
计算资源需求：PTuning_v2通常需要更少的计算资源，但可能牺牲一些性能。
任务适应性：对于某些特定任务，LoRA可能更容易捕捉到关键特征。

对于初学者来说，如果计算资源允许，可以优先尝试LoRA微调方法，它通常能更快地获得较好的效果。PTuning_v2则更适合资源受限或对模型改动要求较小的场景。

ChatGLM3微调实践：PTuning_v2与LoRA效果对比及参数解析

微调过程中的参数设置问题

predict_with_generate参数详解

PTuning_v2与LoRA微调效果对比

微调实践建议

项目优选