首页
/ Agentless项目在SWE-bench lite测试中的性能复现问题分析

Agentless项目在SWE-bench lite测试中的性能复现问题分析

2025-07-10 23:55:50作者:庞眉杨Will

背景介绍

Agentless是一个开源代码修复工具,最新发布的1.5版本在SWE-bench lite测试集上声称达到了32%的修复通过率。然而,有用户在尝试复现这一结果时遇到了困难,仅能获得26%-29.67%的通过率,这表明在复现过程中可能存在一些关键步骤的误解。

问题核心

用户在复现Agentless 1.5版本的SWE-bench lite测试结果时,采用了合并40个样本输出文件的方法,这实际上是不正确的处理方式。正确的做法应该是保持样本文件的独立性,并通过rerank.py脚本的特定参数配置来处理多个样本文件夹。

正确使用方法

根据项目维护者的说明,正确的执行流程应该是:

  1. 保持四个修复样本文件夹(repair_sample_1到repair_sample_4)的独立性
  2. 使用rerank.py脚本时,通过逗号分隔的方式指定所有样本文件夹路径
  3. 设置num_samples参数为40(总样本数)
  4. 启用deduplicate(去重)、regression(回归)和reproduction(复现)标志

具体命令格式如下:

python agentless/repair/rerank.py \
    --patch_folder results/swe-bench-lite/repair_sample_1/,results/swe-bench-lite/repair_sample_2/,results/swe-bench-lite/repair_sample_3/,results/swe-bench-lite/repair_sample_4 \
    --num_samples 40 \
    --deduplicate \
    --regression \
    --reproduction

技术要点解析

  1. 样本独立性:每个样本文件夹中的输出文件应保持独立,不应手动合并。rerank.py脚本内部会处理多个样本的集成。

  2. 参数含义

    • deduplicate:去除重复的修复方案
    • regression:考虑回归测试结果
    • reproduction:确保修复方案的可复现性
  3. 性能差异原因:手动合并样本文件可能导致信息丢失或处理逻辑错误,从而影响最终的修复质量评估结果。

最佳实践建议

  1. 严格按照项目文档中的说明进行操作
  2. 保持原始样本文件夹结构不变
  3. 使用完整的参数配置调用rerank.py脚本
  4. 对于大型测试集,可以考虑使用分布式处理来提升效率

总结

正确使用Agentless工具链对于获得预期的性能结果至关重要。通过理解工具的设计原理和遵循正确的操作流程,开发者可以准确复现项目声称的性能指标,并在此基础上进行进一步的优化和定制开发。

登录后查看全文
热门项目推荐
相关项目推荐