verl-agent 的安装和配置教程

2025-05-22 07:34:13作者：温玫谨Lighthearted

verl-agent is an extension of veRL, designed for training LLM/VLM agents via RL. verl-agent is also the official code for paper "Group-in-Group Policy Optimization for LLM Agent Training"

项目地址：https://gitcode.com/gh_mirrors/ve/verl-agent

项目基础介绍

verl-agent 是一个开源项目，它是 veRL 的扩展，专门设计用于通过强化学习（RL）训练大型语言模型（LLM）的智能体。它能够支持多步骤的智能体-环境交互，并且适用于非常长的多步骤优化任务。

主要编程语言

该项目主要使用 Python 编程语言。

项目使用的关键技术和框架

verl-agent 使用了以下关键技术：

强化学习：用于训练智能体的核心算法。
深度学习框架：如 PyTorch，用于构建和训练神经网络。
gym-style 接口：提供环境交互的标准化接口。
多模态处理：支持视觉和语言理解的智能体训练。

以下是一些关键框架和库：

PyTorch：强大的深度学习框架。
gym：一个用于开发和管理 Reinforcement Learning 环境的工具包。
stable-baselines3：一个用于强化学习的算法库。

准备工作和安装步骤

准备工作

在开始安装之前，请确保您的系统中已安装以下软件：

Python（建议版本 3.12）
conda（用于环境管理）
Git（用于克隆项目）

安装步骤

步骤 1：创建虚拟环境

创建一个新的 conda 虚拟环境来避免依赖冲突：

conda create -n verl-agent python==3.12 -y
conda activate verl-agent

步骤 2：安装 PyTorch

安装与 CUDA 12.4 兼容的 PyTorch 版本：

pip3 install torch==2.6.0 --index-url https://download.pytorch.org/whl/cu124

步骤 3：安装 FlashAttention

安装 FlashAttention，一个用于注意力机制的优化库：

pip3 install flash-attn --no-build-isolation

步骤 4：安装 verl-agent

从源代码安装 verl-agent：

pip3 install -e .

步骤 5：安装兼容的 vLLM

安装与 verl-agent 兼容的 vLLM：

pip3 install vllm==0.8.2

步骤 6：安装支持的环境（以 ALFWorld 为例）

安装 ALFWorld 环境：

pip3 install gymnasium==0.29.1
pip3 install stable-baselines3==2.6.0
pip install alfworld
pip install thinc==8.3.4
pip install vllm==0.8.2
alfworld-download -f

以上步骤是 ALFWorld 环境的安装方法，其他环境的安装步骤在项目文档中有详细说明。

完成以上步骤后，verl-agent 和相关环境就已经安装完毕，您可以开始进行项目开发或运行示例代码了。

verl-agent

verl-agent is an extension of veRL, designed for training LLM/VLM agents via RL. verl-agent is also the official code for paper "Group-in-Group Policy Optimization for LLM Agent Training"

项目地址：https://gitcode.com/gh_mirrors/ve/verl-agent

登录后查看全文

项目优选

收起

kernel

deepin linux kernel

docs

OpenHarmony documentation | OpenHarmony开发者文档

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解

Java

nop-entropy

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统

喝着茶写代码！最易用的自托管一站式代码托管平台，包含Git托管，代码审查，团队协作，软件包和CI/CD。

kernel

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

349

200

pytorch

Ascend Extension for PyTorch

无需学习 Kubernetes 的容器平台，在 Kubernetes 上构建、部署、组装和管理应用，无需 K8s 专业知识，全流程图形化管理

verl-agent 的安装和配置教程

项目基础介绍

主要编程语言

项目使用的关键技术和框架

准备工作和安装步骤

准备工作

安装步骤

步骤 1：创建虚拟环境

步骤 2：安装 PyTorch

步骤 3：安装 FlashAttention

步骤 4：安装 verl-agent

步骤 5：安装兼容的 vLLM

步骤 6：安装支持的环境（以 ALFWorld 为例）

热门内容推荐

最新内容推荐

项目优选

verl-agent 的安装和配置教程

项目基础介绍

主要编程语言

项目使用的关键技术和框架

准备工作和安装步骤

准备工作

安装步骤

步骤 1：创建虚拟环境

步骤 2：安装 PyTorch

步骤 3：安装 FlashAttention

步骤 4：安装 verl-agent

步骤 5：安装兼容的 vLLM

步骤 6：安装支持的环境（以 ALFWorld 为例）

相关内容推荐

热门内容推荐

最新内容推荐

项目优选