Toil 8.0.0版本发布：分布式任务编排系统的重大升级

2025-07-09 14:44:03作者：宣海椒Queenly

项目简介

Toil是一个开源的分布式任务编排系统，由UCSC基因组研究所开发，主要用于科学计算和大规模数据处理工作流的管理。它支持多种工作流语言（如CWL和WDL），能够在各种计算环境（包括本地集群、云平台和HPC系统）上高效运行复杂的工作流。

核心特性更新

调试功能增强

8.0.0版本显著增强了调试功能，新增了toil debug-job命令的--retrieveTaskDirectory选项，允许用户下载作业文件到指定目录并尝试停止作业。作业可以通过调用self.files_downloaded_hook()方法为此调试模式提供停止点。此外，该版本还支持为CWL和WDL任务重建容器内部环境，大大简化了容器化任务的调试过程。

调度器支持改进

在HPC调度器支持方面，新版本增加了对Slurm等HPC调度器的缓存支持，并实现了自动将作业发送到GPU分区的功能。Slurm用户现在可以通过--slurmTime参数设置作业时间限制，使用--slurmPE指定并行作业分区，以及通过--slurmArgs添加额外的Slurm提交参数。

存储与文件管理优化

文件管理方面有多项改进：新增--symlinkJobStoreReads=False选项允许强制本地节点复制（可能使用缓存），即使可以直接从FileJobStore读取，这有助于减少共享文件系统的IO负载。同时，Ceph输入/输出错误现在会被容忍处理，并且使用flock实现了更可靠的目录锁定机制。

工作流语言支持增强

对于CWL工作流，8.0.0版本修复了动态需求作业的输入类型检查问题，解决了LoadListing错误，并改进了容器预处理逻辑。对于WDL工作流，新增了对任务级WDL文件的支持，完善了GPU字段处理，改进了条件语句和散射(scatter)功能的支持，并优化了输出文件组织结构。

架构与性能改进

并行文件导入

新版本引入了并行文件导入功能，通过--importWorkersThreshold参数控制文件导入批处理的阈值，小文件将被批量导入到同一个作业中直到达到该阈值。默认情况下，--importWorkersDisk设置为1MiB，当工作节点无法进行下载流式传输时应增加此值。

AWS与依赖项更新

所有AWS相关代码已从boto2迁移到boto3，同时新增了对Python 3.12和3.13的支持。依赖项方面，现在支持connexion 4，并使用htcondor 23.6或24版本。

用户体验改进

调试与监控

除了增强的调试功能外，新版本还改进了作业监控机制：Toil现在会等待--jobStoreTimeout秒（默认30秒）来观察作业的更新/删除，确保作业确实在取得进展后才允许其成功完成。

配置与日志

生成默认配置的逻辑得到修复，统计和日志文件现在被组织到stats/inbox和stats/archive目录中，避免了循环重命名问题。此外，toil --version命令现在会显示源代码安装时的提交哈希值，便于版本追踪。

向后兼容性说明

虽然8.0.0版本包含许多改进，但也引入了一些破坏性变更：--dont_allocate_mem和--allocate_mem选项已被弃用，取而代之的是--slurmAllocateMem参数，接受True或False值。CWL运行器新增了--no-cwl-default-ram选项来控制是否应用CWL规范的默认ramMin值。