dstack项目0.19.12版本发布:增强分布式计算与MPI支持
dstack是一个开源的分布式计算平台,它简化了在多节点环境中运行机器学习工作负载的复杂性。该项目通过声明式配置和自动化管理,让研究人员和工程师能够专注于算法开发,而不必担心底层基础设施的部署细节。
集群管理功能增强
简化的MPI使用体验
在0.19.12版本中,dstack针对MPI(Message Passing Interface)工作负载进行了多项优化,显著提升了分布式计算的易用性。
启动顺序与停止条件控制
新版本引入了两个关键配置参数:
-
startup_order:定义主节点和工作节点的启动顺序
any
:默认值,不指定特定顺序master-first
:主节点优先启动workers-first
:工作节点优先启动
-
stop_criteria:确定多节点运行何时被视为完成
all-done
:所有节点都完成后才视为运行结束master-done
:主节点完成后即视为运行结束
这些参数特别适合MPI工作负载。例如,MPI要求在工作节点启动后才能执行mpirun
命令,此时可配置startup_order: workers-first
。同时,MPI工作负载通常在主节点完成后即可视为完成,因此配置stop_criteria: master-done
可以避免不必要地等待工作节点退出。
自动化的MPI主机文件管理
dstack现在会自动创建MPI主机文件,并通过DSTACK_MPI_HOSTFILE
环境变量暴露其路径。这使得MPI命令可以直接使用该文件,如mpirun --hostfile $DSTACK_MPI_HOSTFILE
,大大简化了MPI集群的配置过程。
命令行界面改进
新版本对CLI的显示逻辑进行了优化,使其更加用户友好。原先显示的是内部状态码,对用户不够直观。现在,dstack ps
和dstack apply
命令的STATUS
列会显示易于理解的状态信息,用户可以清楚地了解运行或作业终止的原因。
新增分布式训练示例
TRL分布式微调
新版本提供了使用TRL(Transformer Reinforcement Learning)、Accelerate和Deepspeed进行分布式微调的完整示例。这个示例展示了如何利用dstack简化分布式训练流程,特别适合大规模语言模型的微调场景。
Axolotl分布式训练
另一个新增示例展示了如何使用Axolotl框架在dstack上进行分布式训练。Axolotl是一个专注于高效微调大型语言模型的工具,这个示例为NLP研究人员提供了开箱即用的分布式训练解决方案。
技术细节优化
除了上述主要功能外,0.19.12版本还包含多项技术改进:
- 改进了
.gitignore
逻辑,能够处理更多特殊情况 - 增加了
upload_code
客户端的超时时间,提升大代码库上传的稳定性 - 修复了缺少
apt-get update
的问题,确保软件包安装的正确性 - 优化了相对路径处理,使
dstack apply --repo
命令更加可靠 - 更新了后端模板,统一代码格式化风格
这些改进共同提升了dstack平台的稳定性和用户体验,使其成为分布式机器学习工作负载的理想选择。
Hunyuan3D-Part
腾讯混元3D-Part00Hunyuan3D-Omni
腾讯混元3D-Omni:3D版ControlNet突破多模态控制,实现高精度3D资产生成00GitCode-文心大模型-智源研究院AI应用开发大赛
GitCode&文心大模型&智源研究院强强联合,发起的AI应用开发大赛;总奖池8W,单人最高可得价值3W奖励。快来参加吧~0274community
本项目是CANN开源社区的核心管理仓库,包含社区的治理章程、治理组织、通用操作指引及流程规范等基础信息011Hunyuan3D-2
Hunyuan3D 2.0:高分辨率三维生成系统,支持精准形状建模与生动纹理合成,简化资产再创作流程。Python00Spark-Chemistry-X1-13B
科大讯飞星火化学-X1-13B (iFLYTEK Spark Chemistry-X1-13B) 是一款专为化学领域优化的大语言模型。它由星火-X1 (Spark-X1) 基础模型微调而来,在化学知识问答、分子性质预测、化学名称转换和科学推理方面展现出强大的能力,同时保持了强大的通用语言理解与生成能力。Python00GOT-OCR-2.0-hf
阶跃星辰StepFun推出的GOT-OCR-2.0-hf是一款强大的多语言OCR开源模型,支持从普通文档到复杂场景的文字识别。它能精准处理表格、图表、数学公式、几何图形甚至乐谱等特殊内容,输出结果可通过第三方工具渲染成多种格式。模型支持1024×1024高分辨率输入,具备多页批量处理、动态分块识别和交互式区域选择等创新功能,用户可通过坐标或颜色指定识别区域。基于Apache 2.0协议开源,提供Hugging Face演示和完整代码,适用于学术研究到工业应用的广泛场景,为OCR领域带来突破性解决方案。00- HHowToCook程序员在家做饭方法指南。Programmer's guide about how to cook at home (Chinese only).Dockerfile09
- PpathwayPathway is an open framework for high-throughput and low-latency real-time data processing.Python00
热门内容推荐
最新内容推荐
项目优选









