Transformers 法语文档入口:模型目录、三大框架兼容性矩阵与文档体系全景解析
本文围绕 docs/source/fr/index.md 展开,完整梳理 Transformers 法语文档的入口页面:库的定位与四种模态覆盖、文档五段式组织结构、受支持模型目录,以及 PyTorch / TensorFlow / Flax 三框架的完整兼容矩阵。读完后,你将掌握该入口文档的信息骨架、其背后的文档构建与自动同步机制(make fix-copies),以及如何从入口页正确导航到 快速上手、安装说明 等下游文档。
入口文档的定位:法语站点的着陆页
docs/source/fr/index.md 是 Transformers 官方文档法语站点(docs/source/fr/)的首页(H1 标题为 "🤗 Transformers")。它对外的核心声明是:
🤗 Transformers 提供 API 与工具,用于便捷地下载和训练最先进的预训练模型,适用于 PyTorch、TensorFlow 和 JAX。使用预训练模型可以降低计算成本、减少碳足迹,并省去从零训练模型所需的时间与资源。
作为着陆页,它承担三件事:
- 能力总览:按模态列出库覆盖的任务(NLP、视觉、音频、多模态);
- 文档导航:说明整个文档站分为哪几部分、每部分的定位;
- 事实索引:以"受支持模型"清单和"框架兼容矩阵"两张大表,给出库支持范围的可验证依据。
从目录结构看,法语站点的页面清单由 docs/source/fr/_toctree.yml 定义,共包含:index(本页)、quicktour(Visite rapide)、installation(Installation)、tutoriel_pipeline、autoclass_tutorial、run_scripts_fr、task_summary、tasks_explained 等页面,其中多篇教程条目(数据准备、微调、分布式训练、PEFT、模型分享、LLM 生成)仍指向占位文档 in_translation.md,表明法语文档是部分翻译、持续补全中的状态。这一点与 docs/TRANSLATING.md 中描述的多语言文档协作机制一致。
库能力总览:四种模态与跨框架互操作
入口文档将 🤗 Transformers 的任务覆盖面归纳为四类(原文法语表述的中文对照):
| 模态 | 覆盖任务 |
|---|---|
| 自然语言处理(NLP) | 文本分类、命名实体识别、问答、语言建模、摘要生成、翻译、多选任务、文本生成 |
| 计算机视觉 | 图像分类、目标检测、分割 |
| 音频 | 自动语音识别(ASR)、音频分类 |
| 多模态 | 表格/图像问答(VQA)、OCR、从扫描文档中提取信息、视频分类 |
文档同时强调一个关键设计哲学——PyTorch / TensorFlow / JAX 互操作:允许在模型生命周期的不同阶段使用不同框架,例如"用某个框架三行代码训练一个模型,再用另一个框架加载它做推理";模型还可以导出为 ONNX、TorchScript 等格式以部署到生产环境。
这一"多框架一等公民"的设计在仓库中是结构性事实:src/transformers/models/ 下每个模型目录通常同时包含 PyTorch 实现(modeling_<name>.py)、TensorFlow 实现(tf_*.py)与 Flax 实现(flax_*.py),是否具备某一框架的实现在下方兼容矩阵中逐模型标注。
文档的五段式组织结构
入口文档("Contenu" 一节)声明整个文档站组织为 5 大部分:
- DEMARRER(快速开始):库的速览与安装说明,帮助读者快速上手;
- TUTORIELS(教程):初学者的起点,帮助获得开始使用库所需的基础技能;
- GUIDES D'UTILISATION(使用指南):面向具体任务,例如微调预训练模型做文本分类、创建并分享自己的模型;
- GUIDES CONCEPTUELS(概念指南):对模型、任务与 🤗 Transformers 设计哲学背后的概念做更深入的解释;
- API:描述全部类与函数,细分为三类:
- 主要类(CLASSES PRINCIPALES):配置(configuration)、模型(model)、分词器(tokenizer)、管道(pipeline)等最核心的类;
- 模型(MODELES):库中每个模型各自的类与函数;
- 内部工具(UTILITAIRES INTERNES):内部使用的工具类与函数。
对照当前仓库 docs/source/fr/_toctree.yml 的实际编排,法语站目前落地了前三段的框架:
- Démarrer:
index→quicktour→installation; - Tutoriels:
tutoriel_pipeline(Pipelines pour l'inférence)、autoclass_tutorial(用 AutoClass 加载预训练实例)、run_scripts_fr(用脚本训练),其余条目以in_translation占位; - Guides conceptuels:
task_summary(Transformers 能做什么)、tasks_explained(Transformers 如何求解这些任务)。
API 部分的 model_doc 与 main_classes 等页面由文档构建器基于 src/transformers/ 源码自动渲染(入口文档中的模型清单条目以 model_doc/<模型名> 的相对路径链接到这些自动生成的 API 页),因此不需要手工维护,这也是下一节两张大表"禁止手动更新"注释存在的原因。
受支持模型目录:从入口清单看生态规模
入口文档的 "Modèles supportés" 一节列出了约 180 个模型,每个条目包含模型名(链接到对应 API 页)、开发机构、配套论文与作者。文档中带有明确注释:
<!--This list is updated automatically from the README with _make fix-copies_. Do not update manually!-->
即该清单通过 make fix-copies 从根目录 README 自动生成同步,严禁手工修改——这解释了为什么清单条目格式高度统一。
从仓库当前实际代码看,src/transformers/models/ 目录下的模型子目录已达到 516 个(如 bert、gpt2、llama、qwen3_vl、whisper、sam3 等),远多于法语入口页所载的约 180 条。可以推断:法语入口页的模型清单是翻译文档随主仓库滚动更新时的某次同步快照,新模型(如 DeepSeek 系列、Qwen 系列、Gemma 系列等)会先出现在英文文档与源码中,法语清单依赖后续同步。
为保留原文档的信息结构,下面按模态将入口清单中的代表模型完整归类(机构与论文归属信息见 docs/source/fr/index.md 原文):
- 语言模型 / 文本生成与理解:ALBERT、BART、BERT(及 Bert Generation、CamemBERT、FlauBERT、BARThez、BERTweet、BioGPT、CANINE、ConvBERT、CPM、CTRL、ELECTRA、ERNIE、FNet、Funnel Transformer、GPT / GPT-2 / GPT Neo / GPT NeoX / GPT NeoX Japanese / GPT-J / GPT-Sw3 / XGLM / Megatron-BERT / Megatron-GPT2)、DistilBERT、LED / Longformer、LXMERT、LUKE / mLUKE、M2M100、mBART / mBART-50、MarianMT(基于 OPUS 数据训练的机器翻译模型)、MarkupLM、MPNet、MT5 / T5 / T5v1.1 / LongT5 / Pegasus / PEGASUS-X / UL2 / ByT5、MobileBERT、Nezha、OPT、PLBart、ProphetNet、QDQBert、REALM、Reformer、RemBERT、RoBERTa / RoBERTa-PreLayerNorm、RoFormer、RoCBert、RAG / DPR / Splinter、SqueezeBERT、SwitchTransformers、TAPAS / TAPEX / Table Transformer、Transformer-XL、XLNet / XLM / XLM-ProphetNet / XLM-RoBERTa / XLM-RoBERTa-XL、YOSO 等;
- 视觉模型:ALIGN、AltCLIP、BEiT、BiT、BLIP、BridgeTower、Chinese-CLIP、CLIP / CLIPSeg / X-CLIP / OWL-ViT、Conditional DETR / Deformable DETR / DETR / DETA / YOLOS、ConvNeXT / ConvNeXTV2、CvT、Decision Transformer、DeiT、DiT、Donut、DPT、EfficientFormer、GLPN、GIT、GroupViT、ImageGPT、LeViT、LeViT 系、Mask2Former / MaskFormer、MobileNetV1 / MobileNetV2 / MobileViT、Nyströmformer / OneFormer、NAT / DiNAT、Perceiver IO、PoolFormer、RegNet、ResNet、SegFormer、Swin Transformer / Swin Transformer V2 / Swin2SR、TimeSformer、Trajectory Transformer、Timm 无关的 VAN、ViT / ViT Hybrid / ViTMAE / ViTMSN / VideoMAE / ViLT / VisualBERT、UPerNet、Graphormer 等;
- 音频模型:Audio Spectrogram Transformer、Data2Vec(Audio/Text/Vision)、FastSpeech2Conformer、Hubert、Jukebox、M-CTC-T、SEW / SEW-D、Speech Encoder Decoder、SpeechToTextTransformer / SpeechToTextTransformer2、SpeechT5、UniSpeech / UniSpeechSat、Wav2Vec2 / Wav2Vec2-Conformer / Wav2Vec2Phoneme、WavLM、Whisper、XLS-R / XLSR-Wav2Vec2 等;
- 文档理解与多模态:LayoutLM / LayoutLMv2 / LayoutLMv3、LayoutXLM、TrOCR、BLOOM(BigScience Workshop 发布)等。
框架兼容矩阵:slow/fast Tokenizer 与 PyTorch / TensorFlow / Flax 支持
入口文档的 "Frameworks compatibles" 一节给出了一张逐模型标注支持情况的表格,列为:
- Tokenizer slow:纯 Python 实现的慢速分词器;
- Tokenizer fast:由 🤗 Tokenizers 库支撑的 Rust 加速分词器(fast 不一定要求 slow 同时存在,例如 BLOOM、GPT NeoX 仅支持 fast);
- PyTorch support / TensorFlow support / Flax Support:三个深度学习框架的模型实现是否可用。
该表同样标注为自动生成(<!--This table is updated automatically from the auto modules with _make fix-copies_. Do not update manually!-->),其数据源是 src/transformers/models/auto/ 等 auto 模块中对各模型框架实现的注册情况。完整矩阵共 160 余行,收录于 docs/source/fr/index.md;以下为覆盖各框架组合特征的代表性行(完整数据以该文件为准):
| 模型 | Tokenizer slow | Tokenizer fast | PyTorch | TensorFlow | Flax |
|---|---|---|---|---|---|
| ALBERT | ✅ | ✅ | ✅ | ✅ | ✅ |
| BART | ✅ | ✅ | ✅ | ✅ | ✅ |
| BERT | ✅ | ✅ | ✅ | ✅ | ✅ |
| DistilBERT | ✅ | ✅ | ✅ | ✅ | ✅ |
| RoBERTa | ✅ | ✅ | ✅ | ✅ | ✅ |
| T5 | ✅ | ✅ | ✅ | ✅ | ✅ |
| XLM-RoBERTa | ✅ | ✅ | ✅ | ✅ | ✅ |
| Wav2Vec2 | ✅ | ❌ | ✅ | ✅ | ✅ |
| BLOOM | ❌ | ✅ | ✅ | ❌ | ❌ |
| GPT NeoX | ❌ | ✅ | ✅ | ❌ | ❌ |
| GPT Neo | ❌ | ❌ | ✅ | ❌ | ✅ |
| BEiT | ❌ | ❌ | ✅ | ❌ | ✅ |
| OPT | ❌ | ❌ | ✅ | ✅ | ✅ |
| CLIP | ✅ | ✅ | ✅ | ✅ | ✅ |
| AltCLIP | ❌ | ❌ | ✅ | ❌ | ❌ |
| Whisper | ✅ | ❌ | ✅ | ✅ | ❌ |
| DETR | ❌ | ❌ | ✅ | ❌ | ❌ |
| Swin Transformer | ❌ | ❌ | ✅ | ✅ | ❌ |
从矩阵中可以读出几条实用结论(均以表中数据为准):
- 三框架全支持的"全家桶"模型集中在经典语言模型(BERT 系、T5、RoBERTa、XLM-R、GPT-2 等)与少数视觉模型(CLIP、ViT、RegNet);
- 仅 PyTorch 支持的模型数量最多,多为较新或视觉/检测类架构(DETR、Swin 系、Whisper 仅 PyTorch+TF 等);
- 视觉/音频模型普遍没有 slow Python tokenizer(表中大量 "Tokenizer slow = ❌"),因为其输入经图像处理器/特征提取器而非分词器处理;
- 若你的工作流依赖 TensorFlow 或 Flax,选型时应以这张表为准——例如在 TF 下可用 BERT 系、T5、Whisper、Swin Transformer,但在 Flax 下可选面显著收窄。
构建与翻译机制:入口页背后的工程细节
入口文档虽为"着陆页",但它暴露了文档工程的两处可考证机制,均能在仓库中找到对应物:
make fix-copies自动同步。模型清单与兼容表两处注释均指向该 Make 目标,负责把根 README 中的模型列表与 auto 模块中的框架注册信息同步进各语言文档。该目标定义于仓库 Makefile,保证各语言入口页与源码事实一致,避免人工维护造成的漂移。- Notebook 注入配置。同目录的 docs/source/fr/_config.py 定义了
INSTALL_CONTENT(pip install transformers datasets evaluate accelerate的安装命令块)与notebook_first_cells,即文档构建为法语站点的交互式 Notebook 自动注入的首个代码单元格,还包含black_avoid_patterns用于代码示例中占位类名的格式化规避。这与 docs/source/fr/quicktour.md 开头要求安装的依赖(transformers datasets evaluate accelerate+torch)完全对应。
运行环境事实(以 setup.py 为准):当前开发版本为 5.17.0.dev0,支持 Python 3.10 ~ 3.14(SUPPORTED_PYTHON_VERSIONS = (10, 14));核心安装依赖包括 huggingface-hub、numpy、packaging、pyyaml、regex、tokenizers、typer、safetensors、tqdm。文档中提到的框架互操作(PyTorch / TF / JAX)属于可选扩展依赖,按需安装。
如何从入口页继续深入
基于入口文档给出的五段式结构,推荐的法语文档阅读路径为:
- 安装说明:安装命令与可选依赖;
- 快速上手:用
pipeline做推理、用 AutoClass 加载模型与预处理器、快速训练; - Pipelines 教程 与 AutoClass 教程:把入口页"能力总览"中的具体任务落地为可运行代码;
- 概念指南 与 任务解析:理解每个任务对应的模型家族与求解方式;
- 回到 入口页的模型目录与兼容矩阵 选型:先按任务锁定模型,再按团队实际使用的框架(以及是否需要 fast tokenizer)用矩阵过滤。
需要注意的适用前提:法语站点为部分翻译状态(多篇教程仍为 in_translation 占位),且模型清单/兼容表是自动同步的快照,可能与 src/transformers/ 当前代码存在版本差;涉及最新模型时,建议以英文文档与源码目录(src/transformers/models/)为准交叉核对。
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0631
MiniCPM5-2BMiniCPM5-2B 是一款面向端侧、本地部署和资源受限场景的 2B 稠密 Transformer,能够达到同尺寸开源模型 SOTA 水平。Markdown00
video-shotcraftAI宣传片skill,使用 Remotion 制作电影级产品视频:提供106 张镜头配方卡和可复用的视频魔板。适用于 Claude Code 与 Codex以及所有其他智能体Markdown00
HivisionIDPhotos⚡️HivisionIDPhotos: a lightweight and efficient AI ID photos tools. 一个轻量级的AI证件照制作算法。Python09
DragonOSDragonOS is an operating system developed from scratch using Rust, with Linux compatibility. It is designed for **Serverless** scenarios. 使用Rust从0自研内核,具有Linux兼容性的操作系统,面向云计算Serverless场景而设计。Rust00
Spark-X2.5-1.7BSpark-X2.5-1.7B 旨在让强大的 AI 更加实用、高效且易于获取。这些模型在广泛的日常任务中表现出色,涵盖对话、写作、翻译、推理、编程、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00