EvalScope v0.13.0 发布：大模型评测能力全面升级

2025-07-06 13:36:24作者：史锋燃Gardner

EvalScope 是一个专注于大语言模型评测的开源框架，它提供了标准化的评测流程和丰富的评测基准，帮助开发者和研究人员客观评估各类大语言模型的性能表现。最新发布的 v0.13.0 版本带来了两项重要功能升级，进一步提升了评测的灵活性和覆盖范围。

大模型作为评判者的评测模式

本次更新的核心亮点是引入了大模型作为评判者的评测模式。这是一种创新的评测方法，利用大语言模型本身作为"评估者"来对其他模型的输出进行评分。这种评测方式特别适合那些难以用传统指标衡量的任务，如开放性问题回答、创意写作等。

在实现上，EvalScope 设计了灵活的接口，允许用户指定任意大语言模型作为评判模型。评判模型会根据预设的标准对被测模型的输出进行打分，这些标准可以包括相关性、创造性、事实准确性等多个维度。这种评测方式更接近人类评估的思维方式，能够捕捉到传统自动评测指标难以衡量的质量维度。

v0.13.0 版本新增了对三个重要评测基准的支持：

SimpleQA：一个专注于简单问题回答能力的评测基准，测试模型在基础事实性问题上的表现。由于这类评测需要理解回答的正确性，必须配合大模型作为评判者的模式使用。
Chinese SimpleQA：SimpleQA 的中文版本，专门针对中文语言环境设计，评估模型在中文问题回答中的表现。同样需要指定评判模型进行评测。
LiveCodeBench：一个关注代码生成和编程能力的评测基准。这个基准不需要依赖评判模型，使用传统的自动评测指标来评估代码的正确性和功能性。

这三个基准的加入，使 EvalScope 能够覆盖从基础问答到专业编程的更广泛评测场景，特别是增强了在中文环境下的评测能力。

在技术实现上，大模型作为评判者的模式通过精心设计的提示词工程来确保评判的客观性和一致性。评判模型会收到详细的评分标准和示例，以最大程度减少主观偏差。对于 SimpleQA 和 Chinese SimpleQA，建议使用具有较强理解能力的大模型作为评判模型，如 GPT-4 或 Claude 等。

在实际使用中，开发者可以根据评测目标灵活选择评测模式。对于事实性问题，可以结合传统指标和大模型评判来获得更全面的评估；对于创意性任务，则主要依赖大模型评判的质量维度分析。

EvalScope v0.13.0 的这些升级，标志着大模型评测方法的重要进步，为开发者提供了更丰富、更接近人类判断的评估工具，将有助于推动大语言模型技术的进一步发展。

登录后查看全文