Ragas项目v0.2.12版本发布：增强评估指标与修复关键问题

2025-06-06 14:14:03作者：廉彬冶Miranda

Ragas是一个开源的RAG（检索增强生成）评估框架，专注于为检索增强生成系统提供全面的评估指标和方法。该项目旨在帮助开发者和研究人员更好地衡量和优化他们的RAG系统性能。

核心改进

本次更新为AWS Bedrock服务添加了专门的令牌解析器，使Ragas能够更准确地处理来自Bedrock模型的令牌计数。同时修复了Anthropic相关代码中的拼写错误，提升了代码的准确性和一致性。

开发团队修复了在评估过程中真阳性(TP)和假阳性(FP)计算的一个关键错误。这一修复确保了评估结果的准确性，特别是在处理分类任务时，指标计算将更加可靠。

为BLEU评分算法新增了use_effective_order可选参数。这个改进允许用户根据需要选择是否使用有效n-gram顺序进行计算，为文本相似度评估提供了更大的灵活性。

团队对文档进行了全面检查，修复了多处损坏的链接，并确保文档中关于evaluator_embeddings变量的命名保持一致。这些改进显著提升了文档的可读性和用户体验。

修正了文档中关于NonLLMContextPrecisionWithReference指标的描述，消除了对LLM的错误引用。这一修正确保了文档的准确性，帮助用户正确理解和使用该评估指标。

修复了输出解析器中的一个关键bug，该bug可能导致在某些情况下解析结果不准确。这一修复增强了框架的稳定性和可靠性。

增加了对规范化URL(canonical_url)的处理支持，这有助于在文档生成和链接处理时保持一致性。

Ragas v0.2.12版本虽然是一个小版本更新，但包含了多项重要的功能改进和错误修复。这些改进不仅增强了框架的功能性，也提升了用户体验和文档质量。特别是对评估指标计算的修正和BLEU评分参数的扩展，将直接提高RAG系统评估的准确性和灵活性。

对于使用Ragas框架的开发者和研究人员来说，升级到这个版本将获得更稳定、更准确的评估体验。项目团队也通过这次更新展示了他们对代码质量和用户体验的持续关注。

登录后查看全文