首页
/ Transformers 日语文档入口全解:支持模型清单、五大文档板块与框架兼容矩阵

Transformers 日语文档入口全解:支持模型清单、五大文档板块与框架兼容矩阵

2026-09-09 16:05:57作者:侯霆垣

本文基于 Transformers 仓库的日语文档首页 docs/source/ja/index.md,系统梳理该库的定位与支持模态、日语文档的五大板块结构(对应 docs/source/ja/_toctree.yml 导航)、自动同步的支持模型清单,以及 slow/fast tokenizer 与 PyTorch、TensorFlow、Flax 的框架兼容矩阵,并结合 src/transformers 源码与 V5 迁移指南说明当前版本的实际状态。读完后,你将知道如何把这份日语文档作为入口导航到具体模型 API、任务指南和内部工具文档。

这份文档是什么

docs/source/ja/index.md 是 Transformers 日语文档的首页(Landing Page),与英文首页 docs/source/en/index.md 对应。它不是某一篇教程,而是整个日语文档站的"总目录 + 能力总览",由三部分构成:

  1. 库定位简介:Transformers 是什么、支持哪些模态、如何跨框架互操作;
  2. 目次(目次导航):说明整个文档站由哪 5 个板块组成;
  3. 支持模型列表 + 框架支持表:两个被注释标明"由 _make fix-copies_ 自动从 README 与 auto modules 更新,禁止手工修改"的数据区。

从源码结构看,该文件头部注释也提醒:它是 Markdown 但包含文档构建器(doc-builder)特有的 MDX 风格语法,在普通 Markdown 查看器中可能渲染异常。

库定位与支持的模态

文档开头将 Transformers 定位为"面向 PyTorch、TensorFlow、JAX 的先进机器学习库",并提供"下载先进预训练模型并对其进行训练"的 API 与工具。文档声称这些预训练模型可覆盖以下四类模态的常见任务:

  • 自然语言处理:文本分类、命名实体识别、问答、语言建模、摘要、机器翻译、多选、文本生成;
  • 计算机视觉:图像分类、目标检测、分割;
  • 音频:自动语音识别(ASR)、音频分类;
  • 多模态:表格问答、OCR、扫描件信息抽取、视频分类、视觉问答(VQA)。

文档同时强调框架互操作性:模型可以在 PyTorch、TensorFlow、JAX 之间迁移——用一个框架 3 行代码完成训练、用另一个框架加载推理,并支持导出为 ONNX、TorchScript 等格式用于生产部署。

这一设计在源码中有直接对应:每个模型目录遵循 configuration / modeling / tokenization 三件套约定,例如 BERT 目录下的 configuration_bert.pymodeling_bert.pytokenization_bert.py,此外还有原始 checkpoint 转换脚本(如 convert_bert_original_tf2_checkpoint_to_pytorch.py),支撑"不同框架间迁移同一模型定义"的声明。至于 ONNX/导出路径,当前仓库在 src/transformers/exporters/ 下实现了 exporter_onnx.pyexporter_dynamo.pyexporter_executorch.py 等导出器。

版本注意:当前仓库 src/transformers/__init__.py__version__ = "5.17.0.dev0",即 V5 开发版。MIGRATION_GUIDE_V5.md 明确宣布"移除库中的 TensorFlow 与 JAX 部分,未来完全聚焦 torch"。仓库中 tf_*.py 文件已为 0 个,仅剩 4 个历史 Flax checkpoint 转换脚本(如 convert_vivit_flax_to_pytorch.py)。因此本文后面兼容表中的 TensorFlow/Flax 列应理解为 V4 时期的历史数据。

日语文档的五大板块(目次)

index.md 的"目次"一节说明文档由 5 个板块构成。对照 docs/source/ja/_toctree.yml 的导航配置,各板块实际落位如下:

1. はじめに(入门)

提供库的速览与安装步骤,对应页面:

  • quicktour.md:クイックツアー——pipeline 推理、AutoClass 加载、快速训练;
  • installation.md:インストール(安装)。

2. チュートリアル(教程)

面向初学者的基础技能链路,_toctree.yml 中收录 8 个页面:

页面 主题
pipeline_tutorial.md 用 pipeline 做推理
autoclass_tutorial.md 用 AutoClass 写可移植代码
preprocessing.md 数据预处理
training.md 微调预训练模型
run_scripts.md 用脚本训练(对应 examples/pytorch/ 下的分类、生成等示例)
accelerate.md 用 Accelerate 搭建分布式训练
peft.md 用 PEFT 加载并训练适配器
llm_tutorial.md LLM 生成

3. HOW-TOガイド(任务指南)

面向"达成特定目标"的操作手册。_toctree.yml 将其组织为 6 个分组、22+ 个任务页,全部位于 docs/source/ja/tasks/

  • 自然语言处理:token_classification、question_answering、language_modeling、masked_language_modeling、translation、summarization、multiple_choice;
  • 音频:audio_classification、asr;
  • 计算机视觉:image_classification、semantic_segmentation、video_classification、object_detection、zero_shot_object_detection、zero_shot_image_classification、monocular_depth_estimation、knowledge_distillation_for_image_classification;
  • 多模态:image_captioning、document_question_answering、visual_question_answering、text-to-speech;
  • 生成generation_strategies.md(自定义解码策略);
  • 提示工程tasks/prompting.mdtasks/idefics.md

4. コンセプトガイド(概念指南)

深入模型、任务与设计思想:philosophy.md(理念)、glossary.md(术语集)、task_summary.md(能力总览)、tasks_explained.md(任务实现方式)、model_summary.mdtokenizer_summary.mdattention.md(注意力机制)、pad_truncation.mdbertology.mdperplexity.mdpipeline_webserver.mdmodel_memory_anatomy.md

5. API

index.md 原文将 API 板块细分为三层,仓库中均有对应目录:

  • MAIN CLASSES(主要类):configuration、model、tokenizer、pipeline 等最核心类的参考文档,位于 docs/source/ja/main_classes/(共 17 个页面,含 configuration、model、tokenizer、trainer、pipelines、processors、quantization、deepspeed 等);
  • MODELS(模型):每个模型相关类与函数的参考文档,位于 docs/source/ja/model_doc/(当前已翻译 53 个模型页,按"文章模型 / 视觉模型 / 音频模型 / 多模态模型 / 强化学习模型 / 时序列模型"分组,见 _toctree.yml 第 222–345 行);
  • INTERNAL HELPERS(内部工具):内部 utility 类与函数,位于 docs/source/ja/internal/(modeling_utils、tokenization_utils、generation_utils、trainer_utils、pipelines_utils、image_processing_utils、audio_utils、file_utils、time_series_utils 共 9 页)。

支持模型清单:自动同步机制与全貌

index.md 的"サポートされているモデル(受支持的模型)"一节列出了约 170 个模型,每个条目格式为:模型名 + 所属机构 + 作者 + 原始论文标题。文件内注释明确写道:

"This list is updated automatically from the README with _make fix-copies_. Do not update manually!"

对应的同步校验工具是 utils/check_copies.py 中的 check_copies()(该文件第 842 行定义),用于保证 README、各语言 index 页中的模型列表一致。

这份清单在当前仓库中仍有更充分的源码事实支撑:src/transformers/models/ 目录下实际存在 515 个模型子目录(比日语文档清单更多,因为日文清单是 V4 时期同步的快照,而仓库已持续新增 Qwen、GLM、DeepSeek、Gemma 等模型)。按 _toctree.yml 的分组逻辑,代表性模型可归为:

  • 文章模型:BERT、RoBERTa、GPT-2、OPT、BLOOM、LLaMA、Mistral、Qwen 系列、DeBERTa、T5、mBART、CodeLlama 等——文档中如 BERT(Google)、GPT-2(OpenAI)、T5(Google AI)均附有原始论文出处;
  • 视觉模型:ViT、Swin Transformer、DeiT、BEiT、ConvNeXT、DETR、Mask2Former、SegFormer 等;
  • 音频模型:Wav2Vec2、Whisper、HuBERT、Bark 等;
  • 多模态模型:CLIP、BLIP/BLIP-2、LLaVA 系(未在日文清单中的较新成员由仓库源码补充)、LayoutLM 文档理解系列、Pixtral 等。

从源码结构看,"每个模型 = configuration/modeling/tokenization 三件套 + 可选 conversion 脚本"的约定贯穿全部 515 个模型目录,这正是 index.md 声称"任何模型都能用 3 个主要类快速用于推理或训练"的底层原因。

框架支持矩阵(受支持のフレームワーク)

index.md 末尾的大表说明每个模型对 5 项能力的支持情况:Python slow tokenizer、🤗 Tokenizers 库的 fast tokenizer、PyTorch、TensorFlow、Flax。文件注释同样标注该表"由 auto modules 通过 _make fix-copies_ 自动更新"。下表摘录原文档中具有代表性的行(完整版以 docs/source/ja/index.md 第 238–397 行为准):

模型 Tokenizer slow Tokenizer fast PyTorch TensorFlow Flax
BERT
GPT-2
RoBERTa
T5
XLM-RoBERTa
CLIP
DistilBERT
OPT
BLOOM
Whisper
Wav2Vec2
ALBERT
DETR
GPT NeoX
BigBird-Pegasus

读表要点:

  1. slow/fast tokenizer 两列并不要求同时存在。如 GPT NeoX、BLOOM 只有 Rust 实现的 fast tokenizer,而 Whisper、Wav2Vec2 只有 slow 版——选型时应以表为准;
  2. PyTorch 是覆盖最广的后端:表内所有模型均支持 PyTorch;TensorFlow 与 Flax 仅在语言类/经典模型上提供;
  3. V5 现状:如前所述,当前仓库已按 MIGRATION_GUIDE_V5.md 移除 TensorFlow 后端(tf_*.py 文件数为 0),Flax 后端也仅余历史转换脚本。因此该表的 TensorFlow/Flax 列代表 V4 时期能力,在当前开发版上实际可用后端为 PyTorch;ONNX 等部署格式则通过 src/transformers/exporters/ 的导出器实现。

如何使用这份入口页

docs/source/ja/index.md 当作"能力索引"而非教程使用:

  1. 先通过"目次"确认你要解决的问题属于五大板块中的哪一个(入门 / 教程 / 任务 / 概念 / API);
  2. 模型类问题:在支持模型清单中定位模型名 → 跳转到 docs/source/ja/model_doc/ 下对应页查看已翻译的 API 参考;日文文档未覆盖的新模型(仓库 src/transformers/models/ 已包含 515 个模型目录)可参考英文文档目录 docs/source/en/model_doc/ 或源码本身;
  3. 框架/后端问题:以框架支持矩阵为初筛,同时以 MIGRATION_GUIDE_V5.md 确认当前版本的真实后端范围。

最后需强调两点边界:支持模型清单与框架表均由工具自动同步(utils/check_copies.py),不应手工编辑;且该日文首页的数据快照早于 V5 重构,凡涉及 TensorFlow/Flax 的结论都需叠加 V5 迁移指南的上下文来理解。

登录后查看全文
热门项目推荐
相关项目推荐

项目优选

收起
kernelkernel
deepin linux kernel
C
33
18
ops-transformerops-transformer
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
1.14 K
2.76 K
pytorchpytorch
作为 Ascend for PyTorch 社区的核心组件,TorchNPU 是昇腾专为 PyTorch 打造的深度学习适配插件,使 PyTorch 框架能够直接调用昇腾 NPU,为开发者提供昇腾 AI 处理器的超强算力。
Python
860
1.35 K
docsdocs
暂无描述
Markdown
899
5.83 K
ops-nnops-nn
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
925
1.85 K
jiuwenswarmjiuwenswarm
JiuwenSwarm 是一款基于openJiuwen开发的智能AI Agent,它能够将大语言模型的强大能力,通过你日常使用的各类通讯应用,直接延伸至你的指尖。
Python
3.84 K
1.02 K
kernelkernel
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
533
601
cann-learning-hubcann-learning-hub
CANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。
Jupyter Notebook
1.03 K
525
ops-mathops-math
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.37 K
1.46 K
AscendNPU-IRAscendNPU-IR
AscendNPU-IR是基于MLIR(Multi-Level Intermediate Representation)构建的,面向昇腾亲和算子编译时使用的中间表示,提供昇腾完备表达能力,通过编译优化提升昇腾AI处理器计算效率,支持通过生态框架使能昇腾AI处理器与深度调优
C++
548
395