Transformers 日语文档入口全解:支持模型清单、五大文档板块与框架兼容矩阵
本文基于 Transformers 仓库的日语文档首页 docs/source/ja/index.md,系统梳理该库的定位与支持模态、日语文档的五大板块结构(对应 docs/source/ja/_toctree.yml 导航)、自动同步的支持模型清单,以及 slow/fast tokenizer 与 PyTorch、TensorFlow、Flax 的框架兼容矩阵,并结合 src/transformers 源码与 V5 迁移指南说明当前版本的实际状态。读完后,你将知道如何把这份日语文档作为入口导航到具体模型 API、任务指南和内部工具文档。
这份文档是什么
docs/source/ja/index.md 是 Transformers 日语文档的首页(Landing Page),与英文首页 docs/source/en/index.md 对应。它不是某一篇教程,而是整个日语文档站的"总目录 + 能力总览",由三部分构成:
- 库定位简介:Transformers 是什么、支持哪些模态、如何跨框架互操作;
- 目次(目次导航):说明整个文档站由哪 5 个板块组成;
- 支持模型列表 + 框架支持表:两个被注释标明"由
_make fix-copies_自动从 README 与 auto modules 更新,禁止手工修改"的数据区。
从源码结构看,该文件头部注释也提醒:它是 Markdown 但包含文档构建器(doc-builder)特有的 MDX 风格语法,在普通 Markdown 查看器中可能渲染异常。
库定位与支持的模态
文档开头将 Transformers 定位为"面向 PyTorch、TensorFlow、JAX 的先进机器学习库",并提供"下载先进预训练模型并对其进行训练"的 API 与工具。文档声称这些预训练模型可覆盖以下四类模态的常见任务:
- 自然语言处理:文本分类、命名实体识别、问答、语言建模、摘要、机器翻译、多选、文本生成;
- 计算机视觉:图像分类、目标检测、分割;
- 音频:自动语音识别(ASR)、音频分类;
- 多模态:表格问答、OCR、扫描件信息抽取、视频分类、视觉问答(VQA)。
文档同时强调框架互操作性:模型可以在 PyTorch、TensorFlow、JAX 之间迁移——用一个框架 3 行代码完成训练、用另一个框架加载推理,并支持导出为 ONNX、TorchScript 等格式用于生产部署。
这一设计在源码中有直接对应:每个模型目录遵循 configuration / modeling / tokenization 三件套约定,例如 BERT 目录下的 configuration_bert.py、modeling_bert.py、tokenization_bert.py,此外还有原始 checkpoint 转换脚本(如 convert_bert_original_tf2_checkpoint_to_pytorch.py),支撑"不同框架间迁移同一模型定义"的声明。至于 ONNX/导出路径,当前仓库在 src/transformers/exporters/ 下实现了 exporter_onnx.py、exporter_dynamo.py、exporter_executorch.py 等导出器。
版本注意:当前仓库
src/transformers/__init__.py中__version__ = "5.17.0.dev0",即 V5 开发版。MIGRATION_GUIDE_V5.md 明确宣布"移除库中的 TensorFlow 与 JAX 部分,未来完全聚焦 torch"。仓库中tf_*.py文件已为 0 个,仅剩 4 个历史 Flax checkpoint 转换脚本(如 convert_vivit_flax_to_pytorch.py)。因此本文后面兼容表中的 TensorFlow/Flax 列应理解为 V4 时期的历史数据。
日语文档的五大板块(目次)
index.md 的"目次"一节说明文档由 5 个板块构成。对照 docs/source/ja/_toctree.yml 的导航配置,各板块实际落位如下:
1. はじめに(入门)
提供库的速览与安装步骤,对应页面:
- quicktour.md:クイックツアー——
pipeline推理、AutoClass 加载、快速训练; - installation.md:インストール(安装)。
2. チュートリアル(教程)
面向初学者的基础技能链路,_toctree.yml 中收录 8 个页面:
| 页面 | 主题 |
|---|---|
| pipeline_tutorial.md | 用 pipeline 做推理 |
| autoclass_tutorial.md | 用 AutoClass 写可移植代码 |
| preprocessing.md | 数据预处理 |
| training.md | 微调预训练模型 |
| run_scripts.md | 用脚本训练(对应 examples/pytorch/ 下的分类、生成等示例) |
| accelerate.md | 用 Accelerate 搭建分布式训练 |
| peft.md | 用 PEFT 加载并训练适配器 |
| llm_tutorial.md | LLM 生成 |
3. HOW-TOガイド(任务指南)
面向"达成特定目标"的操作手册。_toctree.yml 将其组织为 6 个分组、22+ 个任务页,全部位于 docs/source/ja/tasks/:
- 自然语言处理:token_classification、question_answering、language_modeling、masked_language_modeling、translation、summarization、multiple_choice;
- 音频:audio_classification、asr;
- 计算机视觉:image_classification、semantic_segmentation、video_classification、object_detection、zero_shot_object_detection、zero_shot_image_classification、monocular_depth_estimation、knowledge_distillation_for_image_classification;
- 多模态:image_captioning、document_question_answering、visual_question_answering、text-to-speech;
- 生成:generation_strategies.md(自定义解码策略);
- 提示工程:tasks/prompting.md、tasks/idefics.md。
4. コンセプトガイド(概念指南)
深入模型、任务与设计思想:philosophy.md(理念)、glossary.md(术语集)、task_summary.md(能力总览)、tasks_explained.md(任务实现方式)、model_summary.md、tokenizer_summary.md、attention.md(注意力机制)、pad_truncation.md、bertology.md、perplexity.md、pipeline_webserver.md、model_memory_anatomy.md。
5. API
index.md 原文将 API 板块细分为三层,仓库中均有对应目录:
- MAIN CLASSES(主要类):configuration、model、tokenizer、pipeline 等最核心类的参考文档,位于 docs/source/ja/main_classes/(共 17 个页面,含 configuration、model、tokenizer、trainer、pipelines、processors、quantization、deepspeed 等);
- MODELS(模型):每个模型相关类与函数的参考文档,位于 docs/source/ja/model_doc/(当前已翻译 53 个模型页,按"文章模型 / 视觉模型 / 音频模型 / 多模态模型 / 强化学习模型 / 时序列模型"分组,见 _toctree.yml 第 222–345 行);
- INTERNAL HELPERS(内部工具):内部 utility 类与函数,位于 docs/source/ja/internal/(modeling_utils、tokenization_utils、generation_utils、trainer_utils、pipelines_utils、image_processing_utils、audio_utils、file_utils、time_series_utils 共 9 页)。
支持模型清单:自动同步机制与全貌
index.md 的"サポートされているモデル(受支持的模型)"一节列出了约 170 个模型,每个条目格式为:模型名 + 所属机构 + 作者 + 原始论文标题。文件内注释明确写道:
"This list is updated automatically from the README with
_make fix-copies_. Do not update manually!"
对应的同步校验工具是 utils/check_copies.py 中的 check_copies()(该文件第 842 行定义),用于保证 README、各语言 index 页中的模型列表一致。
这份清单在当前仓库中仍有更充分的源码事实支撑:src/transformers/models/ 目录下实际存在 515 个模型子目录(比日语文档清单更多,因为日文清单是 V4 时期同步的快照,而仓库已持续新增 Qwen、GLM、DeepSeek、Gemma 等模型)。按 _toctree.yml 的分组逻辑,代表性模型可归为:
- 文章模型:BERT、RoBERTa、GPT-2、OPT、BLOOM、LLaMA、Mistral、Qwen 系列、DeBERTa、T5、mBART、CodeLlama 等——文档中如 BERT(Google)、GPT-2(OpenAI)、T5(Google AI)均附有原始论文出处;
- 视觉模型:ViT、Swin Transformer、DeiT、BEiT、ConvNeXT、DETR、Mask2Former、SegFormer 等;
- 音频模型:Wav2Vec2、Whisper、HuBERT、Bark 等;
- 多模态模型:CLIP、BLIP/BLIP-2、LLaVA 系(未在日文清单中的较新成员由仓库源码补充)、LayoutLM 文档理解系列、Pixtral 等。
从源码结构看,"每个模型 = configuration/modeling/tokenization 三件套 + 可选 conversion 脚本"的约定贯穿全部 515 个模型目录,这正是 index.md 声称"任何模型都能用 3 个主要类快速用于推理或训练"的底层原因。
框架支持矩阵(受支持のフレームワーク)
index.md 末尾的大表说明每个模型对 5 项能力的支持情况:Python slow tokenizer、🤗 Tokenizers 库的 fast tokenizer、PyTorch、TensorFlow、Flax。文件注释同样标注该表"由 auto modules 通过 _make fix-copies_ 自动更新"。下表摘录原文档中具有代表性的行(完整版以 docs/source/ja/index.md 第 238–397 行为准):
| 模型 | Tokenizer slow | Tokenizer fast | PyTorch | TensorFlow | Flax |
|---|---|---|---|---|---|
| BERT | ✅ | ✅ | ✅ | ✅ | ✅ |
| GPT-2 | ✅ | ✅ | ✅ | ✅ | ✅ |
| RoBERTa | ✅ | ✅ | ✅ | ✅ | ✅ |
| T5 | ✅ | ✅ | ✅ | ✅ | ✅ |
| XLM-RoBERTa | ✅ | ✅ | ✅ | ✅ | ✅ |
| CLIP | ✅ | ✅ | ✅ | ✅ | ✅ |
| DistilBERT | ✅ | ✅ | ✅ | ✅ | ✅ |
| OPT | ❌ | ❌ | ✅ | ✅ | ✅ |
| BLOOM | ❌ | ✅ | ✅ | ❌ | ❌ |
| Whisper | ✅ | ❌ | ✅ | ✅ | ❌ |
| Wav2Vec2 | ✅ | ❌ | ✅ | ✅ | ✅ |
| ALBERT | ✅ | ✅ | ✅ | ✅ | ✅ |
| DETR | ❌ | ❌ | ✅ | ❌ | ❌ |
| GPT NeoX | ❌ | ✅ | ✅ | ❌ | ❌ |
| BigBird-Pegasus | ❌ | ❌ | ✅ | ❌ | ❌ |
读表要点:
- slow/fast tokenizer 两列并不要求同时存在。如 GPT NeoX、BLOOM 只有 Rust 实现的 fast tokenizer,而 Whisper、Wav2Vec2 只有 slow 版——选型时应以表为准;
- PyTorch 是覆盖最广的后端:表内所有模型均支持 PyTorch;TensorFlow 与 Flax 仅在语言类/经典模型上提供;
- V5 现状:如前所述,当前仓库已按 MIGRATION_GUIDE_V5.md 移除 TensorFlow 后端(
tf_*.py文件数为 0),Flax 后端也仅余历史转换脚本。因此该表的 TensorFlow/Flax 列代表 V4 时期能力,在当前开发版上实际可用后端为 PyTorch;ONNX 等部署格式则通过 src/transformers/exporters/ 的导出器实现。
如何使用这份入口页
把 docs/source/ja/index.md 当作"能力索引"而非教程使用:
- 先通过"目次"确认你要解决的问题属于五大板块中的哪一个(入门 / 教程 / 任务 / 概念 / API);
- 模型类问题:在支持模型清单中定位模型名 → 跳转到 docs/source/ja/model_doc/ 下对应页查看已翻译的 API 参考;日文文档未覆盖的新模型(仓库
src/transformers/models/已包含 515 个模型目录)可参考英文文档目录 docs/source/en/model_doc/ 或源码本身; - 框架/后端问题:以框架支持矩阵为初筛,同时以
MIGRATION_GUIDE_V5.md确认当前版本的真实后端范围。
最后需强调两点边界:支持模型清单与框架表均由工具自动同步(utils/check_copies.py),不应手工编辑;且该日文首页的数据快照早于 V5 重构,凡涉及 TensorFlow/Flax 的结论都需叠加 V5 迁移指南的上下文来理解。
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0631
MiniCPM5-2BMiniCPM5-2B 是一款面向端侧、本地部署和资源受限场景的 2B 稠密 Transformer,能够达到同尺寸开源模型 SOTA 水平。Markdown00
video-shotcraftAI宣传片skill,使用 Remotion 制作电影级产品视频:提供106 张镜头配方卡和可复用的视频魔板。适用于 Claude Code 与 Codex以及所有其他智能体Markdown00
HivisionIDPhotos⚡️HivisionIDPhotos: a lightweight and efficient AI ID photos tools. 一个轻量级的AI证件照制作算法。Python09
DragonOSDragonOS is an operating system developed from scratch using Rust, with Linux compatibility. It is designed for **Serverless** scenarios. 使用Rust从0自研内核,具有Linux兼容性的操作系统,面向云计算Serverless场景而设计。Rust00
Spark-X2.5-1.7BSpark-X2.5-1.7B 旨在让强大的 AI 更加实用、高效且易于获取。这些模型在广泛的日常任务中表现出色,涵盖对话、写作、翻译、推理、编程、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00