Transformer-Deploy 项目教程
1. 项目介绍
Transformer-Deploy 是一个用于优化和部署 Hugging Face Transformer 模型的开源工具。它能够在生产环境中通过单个命令行实现模型的优化和部署,提供高达 10 倍的推理加速。该项目支持 CPU 和 GPU 推理,适用于各种 Transformer 模型,包括文档分类、命名实体识别(NER)、特征提取和文本生成等任务。
2. 项目快速启动
2.1 安装
首先,克隆项目仓库并进入项目目录:
git clone https://github.com/ELS-RD/transformer-deploy.git
cd transformer-deploy
2.2 使用 Docker 快速启动
使用 Docker 可以快速启动并优化模型。以下是一个示例命令,用于优化一个分类模型:
docker run -it --rm --gpus all \
-v $PWD:/project ghcr.io/els-rd/transformer-deploy:0.6.0 \
bash -c "cd /project && \
convert_model -m \"philschmid/MiniLM-L6-H384-uncased-sst2\" \
--backend tensorrt onnx \
--seq-len 16 128 128"
2.3 启动 Triton 推理服务器
优化完成后,可以启动 Nvidia Triton 推理服务器:
docker run -it --rm --gpus all -p8000:8000 -p8001:8001 -p8002:8002 --shm-size 256m \
-v $PWD/triton_models:/models nvcr.io/nvidia/tritonserver:22.07-py3 \
bash -c "pip install transformers && tritonserver --model-repository=/models"
3. 应用案例和最佳实践
3.1 文本分类
以下是一个文本分类的示例,使用 philschmid/MiniLM-L6-H384-uncased-sst2 模型:
docker run -it --rm --gpus all \
-v $PWD:/project ghcr.io/els-rd/transformer-deploy:0.6.0 \
bash -c "cd /project && \
convert_model -m \"philschmid/MiniLM-L6-H384-uncased-sst2\" \
--backend tensorrt onnx \
--seq-len 16 128 128"
3.2 命名实体识别(NER)
以下是一个命名实体识别的示例,使用 kamalkraj/bert-base-cased-ner-conll2003 模型:
docker run -it --rm --gpus all \
-v $PWD:/project ghcr.io/els-rd/transformer-deploy:0.6.0 \
bash -c "cd /project && \
convert_model -m \"kamalkraj/bert-base-cased-ner-conll2003\" \
--backend tensorrt onnx \
--seq-len 16 128 128 \
--task token-classification"
3.3 文本生成
以下是一个文本生成的示例,使用 gpt2 模型:
docker run -it --rm --gpus all \
-v $PWD:/project ghcr.io/els-rd/transformer-deploy:0.6.0 \
bash -c "cd /project && \
convert_model -m gpt2 \
--backend tensorrt onnx \
--seq-len 6 256 256 \
--task text-generation"
4. 典型生态项目
4.1 Hugging Face Transformers
Hugging Face Transformers 是一个广泛使用的开源库,提供了大量的预训练 Transformer 模型。Transformer-Deploy 与 Hugging Face Transformers 无缝集成,支持从 Hugging Face 模型库中直接下载和优化模型。
4.2 Nvidia Triton 推理服务器
Nvidia Triton 推理服务器 是一个高性能的推理服务器,支持多种深度学习框架。Transformer-Deploy 通过优化模型并生成 Triton 配置文件,使得模型可以轻松部署到 Triton 推理服务器上,实现高效的推理服务。
4.3 ONNX Runtime
ONNX Runtime 是一个跨平台的推理引擎,支持多种硬件加速。Transformer-Deploy 支持将模型转换为 ONNX 格式,并使用 ONNX Runtime 进行推理,提供高性能的推理加速。
通过以上模块的介绍和示例,您可以快速上手并使用 Transformer-Deploy 进行模型的优化和部署。
GLM-5智谱 AI 正式发布 GLM-5,旨在应对复杂系统工程和长时域智能体任务。Jinja00
GLM-5-w4a8GLM-5-w4a8基于混合专家架构,专为复杂系统工程与长周期智能体任务设计。支持单/多节点部署,适配Atlas 800T A3,采用w4a8量化技术,结合vLLM推理优化,高效平衡性能与精度,助力智能应用开发Jinja00
jiuwenclawJiuwenClaw 是一款基于openJiuwen开发的智能AI Agent,它能够将大语言模型的强大能力,通过你日常使用的各类通讯应用,直接延伸至你的指尖。Python0193- QQwen3.5-397B-A17BQwen3.5 实现了重大飞跃,整合了多模态学习、架构效率、强化学习规模以及全球可访问性等方面的突破性进展,旨在为开发者和企业赋予前所未有的能力与效率。Jinja00
AtomGit城市坐标计划AtomGit 城市坐标计划开启!让开源有坐标,让城市有星火。致力于与城市合伙人共同构建并长期运营一个健康、活跃的本地开发者生态。01
awesome-zig一个关于 Zig 优秀库及资源的协作列表。Makefile00