Agentless项目在SWE-bench lite测试中的性能复现问题分析

2025-07-10 20:38:35作者：庞眉杨Will

背景介绍

Agentless是一个开源代码修复工具，最新发布的1.5版本在SWE-bench lite测试集上声称达到了32%的修复通过率。然而，有用户在尝试复现这一结果时遇到了困难，仅能获得26%-29.67%的通过率，这表明在复现过程中可能存在一些关键步骤的误解。

问题核心

用户在复现Agentless 1.5版本的SWE-bench lite测试结果时，采用了合并40个样本输出文件的方法，这实际上是不正确的处理方式。正确的做法应该是保持样本文件的独立性，并通过rerank.py脚本的特定参数配置来处理多个样本文件夹。

正确使用方法

根据项目维护者的说明，正确的执行流程应该是：

保持四个修复样本文件夹(repair_sample_1到repair_sample_4)的独立性
使用rerank.py脚本时，通过逗号分隔的方式指定所有样本文件夹路径
设置num_samples参数为40(总样本数)
启用deduplicate(去重)、regression(回归)和reproduction(复现)标志

具体命令格式如下：

python agentless/repair/rerank.py \
    --patch_folder results/swe-bench-lite/repair_sample_1/,results/swe-bench-lite/repair_sample_2/,results/swe-bench-lite/repair_sample_3/,results/swe-bench-lite/repair_sample_4 \
    --num_samples 40 \
    --deduplicate \
    --regression \
    --reproduction

技术要点解析

样本独立性：每个样本文件夹中的输出文件应保持独立，不应手动合并。rerank.py脚本内部会处理多个样本的集成。
参数含义：
- deduplicate：去除重复的修复方案
- regression：考虑回归测试结果
- reproduction：确保修复方案的可复现性
性能差异原因：手动合并样本文件可能导致信息丢失或处理逻辑错误，从而影响最终的修复质量评估结果。