Transformer-Deploy 项目教程
1. 项目介绍
Transformer-Deploy 是一个用于优化和部署 Hugging Face Transformer 模型的开源工具。它能够在生产环境中通过单个命令行实现模型的优化和部署,提供高达 10 倍的推理加速。该项目支持 CPU 和 GPU 推理,适用于各种 Transformer 模型,包括文档分类、命名实体识别(NER)、特征提取和文本生成等任务。
2. 项目快速启动
2.1 安装
首先,克隆项目仓库并进入项目目录:
git clone https://github.com/ELS-RD/transformer-deploy.git
cd transformer-deploy
2.2 使用 Docker 快速启动
使用 Docker 可以快速启动并优化模型。以下是一个示例命令,用于优化一个分类模型:
docker run -it --rm --gpus all \
-v $PWD:/project ghcr.io/els-rd/transformer-deploy:0.6.0 \
bash -c "cd /project && \
convert_model -m \"philschmid/MiniLM-L6-H384-uncased-sst2\" \
--backend tensorrt onnx \
--seq-len 16 128 128"
2.3 启动 Triton 推理服务器
优化完成后,可以启动 Nvidia Triton 推理服务器:
docker run -it --rm --gpus all -p8000:8000 -p8001:8001 -p8002:8002 --shm-size 256m \
-v $PWD/triton_models:/models nvcr.io/nvidia/tritonserver:22.07-py3 \
bash -c "pip install transformers && tritonserver --model-repository=/models"
3. 应用案例和最佳实践
3.1 文本分类
以下是一个文本分类的示例,使用 philschmid/MiniLM-L6-H384-uncased-sst2
模型:
docker run -it --rm --gpus all \
-v $PWD:/project ghcr.io/els-rd/transformer-deploy:0.6.0 \
bash -c "cd /project && \
convert_model -m \"philschmid/MiniLM-L6-H384-uncased-sst2\" \
--backend tensorrt onnx \
--seq-len 16 128 128"
3.2 命名实体识别(NER)
以下是一个命名实体识别的示例,使用 kamalkraj/bert-base-cased-ner-conll2003
模型:
docker run -it --rm --gpus all \
-v $PWD:/project ghcr.io/els-rd/transformer-deploy:0.6.0 \
bash -c "cd /project && \
convert_model -m \"kamalkraj/bert-base-cased-ner-conll2003\" \
--backend tensorrt onnx \
--seq-len 16 128 128 \
--task token-classification"
3.3 文本生成
以下是一个文本生成的示例,使用 gpt2
模型:
docker run -it --rm --gpus all \
-v $PWD:/project ghcr.io/els-rd/transformer-deploy:0.6.0 \
bash -c "cd /project && \
convert_model -m gpt2 \
--backend tensorrt onnx \
--seq-len 6 256 256 \
--task text-generation"
4. 典型生态项目
4.1 Hugging Face Transformers
Hugging Face Transformers 是一个广泛使用的开源库,提供了大量的预训练 Transformer 模型。Transformer-Deploy 与 Hugging Face Transformers 无缝集成,支持从 Hugging Face 模型库中直接下载和优化模型。
4.2 Nvidia Triton 推理服务器
Nvidia Triton 推理服务器 是一个高性能的推理服务器,支持多种深度学习框架。Transformer-Deploy 通过优化模型并生成 Triton 配置文件,使得模型可以轻松部署到 Triton 推理服务器上,实现高效的推理服务。
4.3 ONNX Runtime
ONNX Runtime 是一个跨平台的推理引擎,支持多种硬件加速。Transformer-Deploy 支持将模型转换为 ONNX 格式,并使用 ONNX Runtime 进行推理,提供高性能的推理加速。
通过以上模块的介绍和示例,您可以快速上手并使用 Transformer-Deploy 进行模型的优化和部署。
HunyuanImage-3.0
HunyuanImage-3.0 统一多模态理解与生成,基于自回归框架,实现文本生成图像,性能媲美或超越领先闭源模型00- DDeepSeek-V3.2-ExpDeepSeek-V3.2-Exp是DeepSeek推出的实验性模型,基于V3.1-Terminus架构,创新引入DeepSeek Sparse Attention稀疏注意力机制,在保持模型输出质量的同时,大幅提升长文本场景下的训练与推理效率。该模型在MMLU-Pro、GPQA-Diamond等多领域公开基准测试中表现与V3.1-Terminus相当,支持HuggingFace、SGLang、vLLM等多种本地运行方式,开源内核设计便于研究,采用MIT许可证。【此简介由AI生成】Python00
GitCode-文心大模型-智源研究院AI应用开发大赛
GitCode&文心大模型&智源研究院强强联合,发起的AI应用开发大赛;总奖池8W,单人最高可得价值3W奖励。快来参加吧~0370Hunyuan3D-Part
腾讯混元3D-Part00ops-transformer
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。C++0102AI内容魔方
AI内容专区,汇集全球AI开源项目,集结模块、可组合的内容,致力于分享、交流。02Spark-Chemistry-X1-13B
科大讯飞星火化学-X1-13B (iFLYTEK Spark Chemistry-X1-13B) 是一款专为化学领域优化的大语言模型。它由星火-X1 (Spark-X1) 基础模型微调而来,在化学知识问答、分子性质预测、化学名称转换和科学推理方面展现出强大的能力,同时保持了强大的通用语言理解与生成能力。Python00GOT-OCR-2.0-hf
阶跃星辰StepFun推出的GOT-OCR-2.0-hf是一款强大的多语言OCR开源模型,支持从普通文档到复杂场景的文字识别。它能精准处理表格、图表、数学公式、几何图形甚至乐谱等特殊内容,输出结果可通过第三方工具渲染成多种格式。模型支持1024×1024高分辨率输入,具备多页批量处理、动态分块识别和交互式区域选择等创新功能,用户可通过坐标或颜色指定识别区域。基于Apache 2.0协议开源,提供Hugging Face演示和完整代码,适用于学术研究到工业应用的广泛场景,为OCR领域带来突破性解决方案。00- HHowToCook程序员在家做饭方法指南。Programmer's guide about how to cook at home (Chinese only).Dockerfile09
- PpathwayPathway is an open framework for high-throughput and low-latency real-time data processing.Python00
项目优选









