首页
/ Ragas项目测试集生成模块的异步执行问题分析与修复

Ragas项目测试集生成模块的异步执行问题分析与修复

2025-05-26 04:19:07作者:殷蕙予

问题背景

在Ragas项目的测试集生成功能中,用户在使用最新开发版本时遇到了三个关键问题,这些问题影响了测试集的正常生成流程。本文将详细分析这些问题及其解决方案。

问题一:MultiHop查询合成器属性缺失

第一个问题出现在MultiHopSpecificQuerySynthesizer类中,该类的实例缺少get_node_clusters方法。这个问题源于测试集生成流程中默认查询分布函数的调用,该函数尝试访问一个不存在的方法。

技术分析

  • 在测试集生成过程中,系统会构建知识图谱(KG)并尝试对节点进行聚类
  • 默认查询分布函数default_query_distribution假设所有查询合成器都实现了get_node_clusters方法
  • MultiHopSpecificQuerySynthesizer类实际上并不需要这个方法,因为它采用不同的查询生成策略

解决方案: 暂时从默认查询分布中移除了MultiHopSpecificQuerySynthesizer,待后续重构时统一处理查询合成器的接口规范。

问题二:异步执行中的事件循环管理

第二个问题更为复杂,涉及Python异步编程模型中的事件循环管理。当在脚本环境中运行测试生成时,出现了"Event loop is closed"错误,导致OpenAI API连接失败。

技术分析

  • Ragas使用异步执行器(Executor)来并行处理多个生成任务
  • 当前实现中,当没有运行中的事件循环时会创建新循环,但未能正确处理循环的生命周期
  • 在脚本环境中,事件循环可能在异步操作完成前就被关闭,导致资源访问异常

解决方案: 通过引入nest_asyncio库来解决这个问题,该库允许在已有事件循环上重新运行异步代码。同时改进了Executor.results()方法的实现,使其能够更健壮地处理事件循环状态:

def results(self) -> t.List[t.Any]:
    if is_event_loop_running():
        loop = asyncio.get_event_loop()
        results = loop.run_until_complete(self._process_jobs())
    else:
        results = asyncio.run(self._process_jobs())
    sorted_results = sorted(results, key=lambda x: x[0])
    return [r[1] for r in sorted_results]

问题三:PersonaThemesMapping属性拼写错误

第三个问题是简单的拼写错误,PersonaThemesMapping类中的mapping属性被错误地引用为mappping。

技术分析

  • 这个拼写错误出现在多跳抽象查询合成器的场景生成逻辑中
  • 虽然是小问题,但会导致整个生成流程中断
  • 反映了代码审查过程中对属性命名一致性的忽视

解决方案: 修正属性引用,确保使用正确的mapping属性名。

总结与最佳实践

通过这三个问题的分析,我们可以得出以下开发经验:

  1. 接口设计:对于插件式架构中的各类合成器,应明确定义接口规范,避免假设方法存在。

  2. 异步编程:在库开发中要特别注意异步代码的执行环境差异,特别是在既可能用于脚本又可能用于Jupyter notebook的场景下。

  3. 代码审查:建立严格的命名规范检查机制,避免因拼写错误导致的运行时问题。

  4. 测试覆盖:增加针对不同执行环境(脚本、notebook等)的测试用例,确保异步代码在各种场景下都能稳定运行。

这些修复已经合并到Ragas项目的主分支,显著提高了测试集生成功能的稳定性和可靠性。开发者在使用时应注意使用最新版本,并确保正确配置异步执行环境。

登录后查看全文
热门项目推荐
相关项目推荐

项目优选

收起
kernelkernel
deepin linux kernel
C
23
6
docsdocs
OpenHarmony documentation | OpenHarmony开发者文档
Dockerfile
226
2.27 K
nop-entropynop-entropy
Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台,包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分,采用java语言实现,可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用
Java
9
1
flutter_flutterflutter_flutter
暂无简介
Dart
526
116
RuoYi-Vue3RuoYi-Vue3
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
988
586
Cangjie-ExamplesCangjie-Examples
本仓将收集和展示高质量的仓颉示例代码,欢迎大家投稿,让全世界看到您的妙趣设计,也让更多人通过您的编码理解和喜爱仓颉语言。
Cangjie
351
1.43 K
leetcodeleetcode
🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer(第 2 版)》、《程序员面试金典(第 6 版)》题解
Java
61
17
GLM-4.6GLM-4.6
GLM-4.6在GLM-4.5基础上全面升级:200K超长上下文窗口支持复杂任务,代码性能大幅提升,前端页面生成更优。推理能力增强且支持工具调用,智能体表现更出色,写作风格更贴合人类偏好。八项公开基准测试显示其全面超越GLM-4.5,比肩DeepSeek-V3.1-Terminus等国内外领先模型。【此简介由AI生成】
Jinja
47
0
giteagitea
喝着茶写代码!最易用的自托管一站式代码托管平台,包含Git托管,代码审查,团队协作,软件包和CI/CD。
Go
17
0
ohos_react_nativeohos_react_native
React Native鸿蒙化仓库
JavaScript
212
288