GPT-SoVITS 中文指南:少样本 TTS 的环境搭建、数据集制作、微调训练与推理部署全实战
本文基于 GPT-SoVITS 仓库的简体中文 README(docs/cn/README.md)展开,并结合仓库源码(webui.py、install.sh、config.py、docker-compose.yaml 等)逐节印证。读完你将掌握:如何在 Windows/Linux/macOS/Docker 上正确搭建 GPT-SoVITS 运行环境、部署全部预训练模型、按官方格式制作多语种训练集、走通「切分→ASR→标注→格式化→SoVITS/GPT 双模型微调→推理」完整链路,以及 V1~V4/V2Pro 各版本的模型差异与迁移方法。
功能总览:四大核心能力
README 开篇即定义了本项目的四个功能支柱,这也正是整套 WebUI 工具链的组织逻辑:
- 零样本文本到语音(TTS):输入 5 秒声音样本,即刻体验文本到语音转换,无需任何训练;
- 少样本 TTS:仅需 1 分钟训练数据即可微调模型,提升声音相似度与真实感;
- 跨语言支持:支持与训练集不同语言的推理,目前覆盖英语、日语、韩语、粤语和中文;
- WebUI 工具集:集成声音/伴奏分离(UVR5)、自动训练集分割、基于 Fun-ASR-Nano / SenseVoice / 经典 FunASR 的多语种 ASR 以及文本标注工具(SubFix),帮助初学者从零创建训练数据集和 GPT/SoVITS 模型。
从源码结构看,这四项能力分别对应 webui.py 中主界面的「0-前置数据集获取工具」「1-GPT-SoVITS-TTS(1A 格式化 / 1B 微调 / 1C 推理)」等标签页,ASR 后端的可选项则集中在 tools/asr/config.py 的 asr_dict 中定义:
asr_dict = {
"Fun-ASR-Nano (31语种+方言, 推荐)": {"lang": ["zh", "en", "ja", "ko", "yue", "auto"], ...},
"SenseVoice (极速, 5语种)": {"lang": ["zh", "en", "ja", "ko", "yue", "auto"], ...},
"达摩 ASR (中文经典)": {"lang": ["zh", "yue"], ...},
"Faster Whisper (多语种)": {"lang": ["auto", "en", "ja", "ko"], ...},
}
其中 Fun-ASR-Nano 默认覆盖中/英/日/韩/粤及自动检测,粤语继续走经典 FunASR 后端,与 README 命令行章节的描述一致。
测试通过的环境
README 给出的官方验证环境矩阵如下,选型时可作为基线参考:
| Python Version | PyTorch Version | Device |
|---|---|---|
| Python 3.10 | PyTorch 2.5.1 | CUDA 12.4 |
| Python 3.11 | PyTorch 2.5.1 | CUDA 12.4 |
| Python 3.11 | PyTorch 2.7.0 | CUDA 12.8 |
| Python 3.9 | PyTorch 2.8.0dev | CUDA 12.8 |
| Python 3.9 | PyTorch 2.5.1 | Apple silicon |
| Python 3.11 | PyTorch 2.7.0 | Apple silicon |
| Python 3.9 | PyTorch 2.2.2 | CPU |
安装:Windows / Linux / macOS 三条路径
Windows
Windows 10 及以上用户可直接下载官方整合包,解压后双击 go-webui.bat 启动。从 go-webui.bat 源码看,整合包实际执行的是 runtime\python.exe -I webui.py zh_CN,即使用包内自带 Python 运行时并以简体中文启动 WebUI;go-webui.ps1 是等价的 PowerShell 版本。
若从源码安装,README 给出的命令为:
conda create -n GPTSoVits python=3.10
conda activate GPTSoVits
pwsh -F install.ps1 --Device <CU126|CU128|CPU> --Source <HF|HF-Mirror|ModelScope> [--DownloadUVR5]
Linux
conda create -n GPTSoVits python=3.10
conda activate GPTSoVits
bash install.sh --device <CU126|CU128|ROCM|CPU> --source <HF|HF-Mirror|ModelScope> [--download-uvr5]
install.sh 的参数解析与执行流程可以在源码中逐项确认:
--device接受CU126 | CU128 | ROCM | MPS | CPU;--source接受HF | HF-Mirror | ModelScope,三者均为必填,脚本会校验参数合法性并打印帮助信息;- 脚本先通过 conda-forge 安装 GCC/G++(gcc < 11 时)、ffmpeg、cmake、make、unzip 等基础工具;
- 随后按设备选择 PyTorch 的 pip index 源:CU126/CU128 对应 CUDA 12.6/12.8 的 wheel,ROCM 走 rocm6.2 源(并自动检测
/opt/rocm,检测不到则回退 CPU),CPU 走 cpu 源; - 模型权重分四步下载解压:主预训练包
pretrained_models.zip解压至GPT_SoVITS/pretrained_models(检测到sv子目录则跳过)、G2PWModel.zip解压至GPT_SoVITS/text(中文多音字 G2PW 模型)、可选的uvr5_weights.zip解压至tools/uvr5; - 最后安装
extra-req.txt --no-deps与requirements.txt,并下载 NLTK 数据(写入 Python 前缀目录)与 Open JTalk 日语词典(解压进 pyopenjtalk 包目录)。
值得注意的是,CUDA 设备上若检测不到 nvidia-smi,脚本会打印警告并自动回退为 CPU 安装,这一点在裸机/云主机环境排查安装问题时很实用。
macOS
README 特别注明:在 Mac 上使用 GPU(MPS)训练的模型效果显著低于其他设备,因此目前使用 CPU 训练。这与 install.sh 源码行为一致——--device MPS 分支内部实际上设置 USE_CPU=true,即 MPS 设备也安装 CPU 版 PyTorch。macOS 安装命令:
conda create -n GPTSoVits python=3.10
conda activate GPTSoVits
bash install.sh --device <MPS|CPU> --source <HF|HF-Mirror|ModelScope> [--download-uvr5]
手动安装
若希望完全掌控安装过程,可手动执行两步:
conda create -n GPTSoVits python=3.10
conda activate GPTSoVits
pip install -r extra-req.txt --no-deps
pip install -r requirements.txt
FFmpeg 是必需的音频处理依赖,各平台安装方式如下:
- Conda 用户:
conda install ffmpeg; - Ubuntu/Debian:
sudo apt install ffmpeg && sudo apt install libsox-dev; - Windows:将
ffmpeg.exe与ffprobe.exe放置在 GPT-SoVITS 根目录下,并安装 Visual C++ 运行库(2017/2019/2022 Redistributable); - macOS:
brew install ffmpeg。
从源码结构看,webui.py 启动时还会向 site-packages 写入 users.pth,把当前目录、GPT_SoVITS/BigVGAN、tools、tools/asr、tools/uvr5 等路径注入 Python 搜索路径——这解释了为何各入口脚本可以互相 import tools.*、slicer2、my_utils 等模块而不需要额外的包安装。此外,若启动时检测到 GPT_SoVITS/text/G2PWModel 缺失,webui.py 会自动拉起 GPT_SoVITS/download.py 补下载该模型。
使用 Docker 运行
README 提醒:代码库更新频繁而镜像发布周期较慢,使用前应先到 Docker Hub 查看最新可用 tag,并按运行环境选择标签。关键注意事项(均已在 docker-compose.yaml 中得到印证):
Lite镜像不包含 ASR 模型与 UVR5 模型,UVR5 模型需自行下载,ASR 模型会在需要时由程序自动下载。Lite 服务在 compose 文件中额外挂载了tools/asr/models与tools/uvr5/uvr5_weights到容器内的独立目录,即模型体积不随镜像走、而是跟随宿主机目录走;- 使用 Docker Compose 时会自动拉取适配架构(amd64/arm64)的镜像;
- Compose 会挂载当前目录的所有文件(
volumes: .:/workspace/GPT-SoVITS),因此务必先git pull更新代码再启动; - 可用 Dockerfile 在本地构建镜像以获得最新更改。
环境变量:is_half 控制是否启用半精度(fp16)。若 GPU 支持,设为 true 可减少显存占用。在 config.py 中可以看到其读取逻辑:
is_half_str = os.environ.get("is_half", "True")
is_half = True if is_half_str.lower() == "true" else False
并且 is_half 还会随主 WebUI 进程以环境变量形式传递给 UVR5、降噪、推理等全部子进程,一处配置全局生效。
共享内存:Windows (Docker Desktop) 默认共享内存较小,可能导致运行异常,请在 Compose 文件中按系统内存增大 shm_size(官方模板设为 16g,见 docker-compose.yaml)。
服务选择:docker-compose.yaml 定义了四个服务,端口映射均为 9871-9874 与 API 端口 9880:
| 服务名 | 镜像标签 | 说明 |
|---|---|---|
GPT-SoVITS-CU126 / GPT-SoVITS-CU128 |
xxxxrt666/gpt-sovits:latest-cu12x |
完整版,包含所有功能 |
GPT-SoVITS-CU126-Lite / GPT-SoVITS-CU128-Lite |
xxxxrt666/gpt-sovits:latest-cu12x-lite |
轻量版,依赖更少,功能略有删减 |
运行指定服务:
docker compose run --service-ports <GPT-SoVITS-CU126-Lite|GPT-SoVITS-CU128-Lite|GPT-SoVITS-CU126|GPT-SoVITS-CU128>
本地构建镜像:
bash docker_build.sh --cuda <12.6|12.8> [--lite]
docker_build.sh 会按本机架构自动选择 linux/amd64 或 linux/arm64 作为目标平台,--lite 决定基础镜像是 lite 还是 full 版本。
进入运行中的容器(Bash Shell):
docker exec -it <GPT-SoVITS-CU126-Lite|GPT-SoVITS-CU128-Lite|GPT-SoVITS-CU126|GPT-SoVITS-CU128> bash
预训练模型部署
成功运行 install.sh 的用户可跳过前 3 步(脚本已自动下载)。手动部署时,README 要求依次准备以下模型:
- 主预训练模型:从官方模型仓库下载,放置到
GPT_SoVITS/pretrained_models目录中; - G2PW 模型(仅中文 TTS):下载
G2PWModel.zip,解压并重命名为G2PWModel,放入GPT_SoVITS/text目录; - UVR5 模型(可选):人声/伴奏分离与混响移除用,放入
tools/uvr5/uvr5_weights。若使用bs_roformer或mel_band_roformer类模型,需将模型与配置文件成对放置,文件名除后缀外必须一一对应(如bs_roformer_ep_368_sdr_12.9628.ckpt+ 同名.yaml),且名称必须包含 "roformer" 才能被识别为 roformer 类模型;建议在名称中直接写明类型(如mel_mand_roformer),否则程序会解析配置文件比对特征来判定类型; - FunASR 模型(自动下载):首次使用自动拉取。WebUI 提供 Fun-ASR-Nano(多语种与方言)、SenseVoice(快速转写)与经典 Paraformer/UniASR 中文粤语模型。离线环境需手动将中文 ASR 模型、VAD 模型与标点模型下载到
tools/asr/models; - Faster Whisper(可选,英/日 ASR):下载 Large V3 模型至
tools/asr/models,同系列其他规格模型通常也能工作且更省磁盘空间。
从源码看,webui.py 的 check_pretrained_is_exist() 会在启动时按版本检查 GPT(s1)、SoVITS(s2G 与 s2D)权重及 chinese-roberta-wwm-ext-large、chinese-hubert-base 是否就位并打印缺失警告,可将其作为部署自检清单;config.py 中的 pretrained_sovits_name / pretrained_gpt_name 则给出了各版本底模的准确落盘路径(详见下文版本迁移章节)。
数据集格式
训练集标注文件(.list)的每行由竖线分隔为四段:
vocal_path|speaker_name|language|text
语言字典:
| 取值 | 语言 |
|---|---|
zh |
中文 |
ja |
日语 |
en |
英语 |
ko |
韩语 |
yue |
粤语 |
示例:
D:\GPT-SoVITS\xxx/xxx.wav|xxx|zh|我爱玩原神.
在 webui.py 的 1A 输入框提示中还有一个实用细节:「训练集音频文件目录」如果留空,则直接使用 .list 文件里的绝对全路径;填写该目录时,程序会用「该目录 + list 中的文件名」拼接出完整路径。
微调与推理:WebUI 全流程
打开主 WebUI
- 整合包用户:双击
go-webui.bat(或go-webui.ps1);使用 V1 则双击go-webui-v1.bat(或go-webui-v1.ps1); - 源码用户:
python webui.py <language(optional)> # 默认版本
python webui.py v1 <language(optional)> # 指定 V1
也可以在 WebUI 内的「训练模型的版本」下拉框中动态切换。config.py 定义了全部端口:主 WebUI 9874、UVR5 9873、TTS 推理 9872、标注工具(SubFix)9871、API 9880。
前置数据集工具(0 窗口)
README 概括的自动填充工作流为:填入训练音频路径 → 切割音频 → 降噪(可选)→ 执行 ASR → 校对标注 → 前往下一个窗口训练。对应源码实现是 webui.py 的「0-前置数据集获取工具」标签页,依次包含四个工具入口:
- 0a-UVR5:拉起
tools/uvr5/webui.py(9873 端口)做声伴分离/去混响/去延迟; - 0b-语音切分:拉起 tools/slice_audio.py。webui.py 给出的默认参数为:
threshold=-34(低于该 dB 视为静音备选切点)、min_length=4000(ms,段最短长度)、min_interval=300(最短切割间隔)、hop_size=10(音量曲线步长,越小越精细但计算量越大)、max_sil_kept=500(切完后保留静音上限)、归一化最大幅值_max=0.9、混入比例alpha_mix=0.25。tools/slice_audio.py 内部以 32kHz 采样率实例化 Slicer,输出原名_起始帧_结束帧.wav; - 0b-降噪:拉起 tools/cmd-denoise.py,按
is_half自动选择 float16/float32 精度; - 0c-语音识别:按 tools/asr/config.py 的模型定义执行对应 ASR 脚本,输出的
.list文件路径会自动回填到标注工具与 1A 窗口的输入框; - 0d-文本校对标注:拉起 tools/subfix_webui.py(9871 端口),基于 SubFix 对 ASR 结果逐条校对。
1A:训练集格式化工具
进入「1-GPT-SoVITS-TTS」标签页,填写实验名、.list 文本标注文件与音频目录后,1A 提供三个可独立运行(也可用「一键三连」串联)的步骤,且每步都支持多卡并行——webui.py 按「GPU 卡号以 - 分割」把数据切成 i_part/all_parts 份,每卡一个进程、通过 _CUDA_VISIBLE_DEVICES 隔离:
| 步骤 | 功能 | 入口脚本 | 依赖模型 |
|---|---|---|---|
| 1Aa | 文本分词与特征提取(生成 2-name2text.txt) |
GPT_SoVITS/prepare_datasets/1-get-text.py | chinese-roberta-wwm-ext-large |
| 1Ab | 语音自监督特征提取(32k wav 等) | GPT_SoVITS/prepare_datasets/2-get-hubert-wav32k.py | chinese-hubert-base;v2Pro/v2ProPlus 版本还会追加运行 2-get-sv.py 提取说话人向量(sv/pretrained_eres2netv2w24s4ep4.ckpt) |
| 1Ac | 语义 Token 提取(生成 6-name2semantic.tsv) |
GPT_SoVITS/prepare_datasets/3-get-semantic.py | 当前版本的预训练 SoVITS-G(s2G) |
从 webui.py 的 open1abc() 可见,一键三连按 1A→1B→1C 顺序等待各进程结束,多卡产物(2-name2text-0.txt 等分片)会被合并后删除分片,最终在 logs/<实验名> 下得到带 2/3/4/5/6 前缀的文件与目录,这正是进入 1B 训练的前提。
1B:微调训练
1Ba-SoVITS 训练(权重输出到 SoVITS_weights*/ 目录):
- 版本为 v1/v2/v2Pro/v2ProPlus 时执行 GPT_SoVITS/s2_train.py,v3/v4 时执行 GPT_SoVITS/s2_train_v3_lora.py(见 webui.py);
- 配置文件基线为 GPT_SoVITS/configs/s2.json,v2Pro/v2ProPlus 分别使用
s2v2Pro.json/s2v2ProPlus.json。webui.py 会把界面上的 batch_size、epochs、text_low_lr_rate、预训练 s2G/s2D 路径、保存策略、GPU 卡号、grad_ckpt、lora_rank 等写入临时 JSON 再传给训练进程; - 默认值(webui.py 的
set_default()):v1/v2 系列默认 8 epoch(上限 25)、每 4 epoch 存一次;v3/v4 默认 2 epoch(上限 16)、每 1 epoch 存一次;batch_size 按显存自动估算(v3/v4 用显存GB/8,其余用显存GB/2),关闭 fp16 时自动减半。v3/v4 专属参数为 LoRA 秩(16/32/64/128,默认 32)与「梯度检查点省显存」开关;v1/v2 专属参数为「文本模块学习率权重」(0.2~0.6,默认 0.4)。
1Bb-GPT 训练(权重输出到 GPT_weights*/ 目录):
- 执行 GPT_SoVITS/s1_train.py,配置基线为 GPT_SoVITS/configs/s1longer-v2.yaml(v1 用
s1longer.yaml);训练输入即 1A 产物2-name2text.txt(音素)与6-name2semantic.tsv(语义 token); - 界面默认:batch_size 按显存
显存GB/2估算(上限 40)、total_epoch 15(2~50)、保存频率每 5 epoch、可选实验性 DPO 训练开关(见 webui.py)。
训练结束后,change_choices() 会刷新 1C 推理页的 GPT/SoVITS 模型下拉列表,新权重即可被直接选中推理。
1C:推理
- 整合包用户:启动后在
1-GPT-SoVITS-TTS/1C-推理中打开推理 WebUI; - 源码用户:
python GPT_SoVITS/inference_webui.py <language(optional)>
或先 python webui.py 再进入 1C 窗口。1C 窗口从 config.py 的权重清单中加载下拉选项:底模(可直接体验 5 秒 Zero Shot TTS)与 SoVITS_weights* / GPT_weights* 目录下的自训 .pth / .ckpt 文件;勾选「启用并行推理版本」会改用 GPT_SoVITS/inference_webui_fast.py 启动(webui.py)。
模型版本演进与迁移指南
README 按 V2 → V3 → V4 → V2Pro 的顺序记录了四个里程碑,每个版本都需要更新依赖、拉取最新代码并补齐对应的预训练权重。config.py 的映射表给出了各版本底模的精确文件名:
| 版本 | 预训练 SoVITS(s2G/s2D) | 预训练 GPT(s1) |
|---|---|---|
| v1 | pretrained_models/s2G488k.pth |
s1bert25hz-2kh-longer-epoch=68e-step=50232.ckpt |
| v2 | pretrained_models/gsv-v2final-pretrained/s2G2333k.pth |
gsv-v2final-pretrained/s1bert25hz-5kh-longer-epoch=12-step=369668.ckpt |
| v3 | pretrained_models/s2Gv3.pth |
pretrained_models/s1v3.ckpt |
| v4 | pretrained_models/gsv-v4-pretrained/s2Gv4.pth |
与 v3 共用 s1v3.ckpt |
| v2Pro / v2ProPlus | pretrained_models/v2Pro/s2Gv2Pro.pth / s2Gv2ProPlus.pth |
与 v3 共用 s1v3.ckpt |
V2 新特性:支持韩语与粤语;更好的文本前端;底模由 2k 小时扩展至 5k 小时;对低音质参考音频(尤其是网络来源、高频严重缺失的闷声音频)合成音质更好。从 v1 迁移:pip install -r requirements.txt 更新环境 → 克隆最新代码 → 下载 v2 预训练包放到 GPT_SoVITS/pretrained_models/gsv-v2final-pretrained,中文还需按上文第 2 步部署 G2PWModel。
V3 新特点:音色相似度更高,用更少训练集即可逼近本人(不训练直接用底模时提升更大);GPT 合成更稳定、重复漏字更少,更容易合成丰富情感。从 v2 迁移:更新依赖 → 克隆最新代码 → 下载 s1v3.ckpt、s2Gv3.pth 以及 BigVGAN 的 models--nvidia--bigvgan_v2_24khz_100band_256x 目录放入 GPT_SoVITS/pretrained_models。若想用音频超分功能缓解 v3 输出 24k 音频偏闷的问题,需额外下载超分模型参数,说明见 tools/AP_BWE_main/24kto48k/readme.txt。
V4 新特性:修复了 V3 因非整数倍上采样导致的金属音问题,并原生输出 48kHz 音频(V3 仅原生输出 24kHz),作者认为 V4 是 V3 的直接替代。从 V1/V2/V3 迁移:pip install -r requirements.txt → 克隆最新代码 → 下载 gsv-v4-pretrained/s2v4.ckpt 与 gsv-v4-pretrained/vocoder.pth 放入 GPT_SoVITS/pretrained_models。
V2Pro 新特性:相比 V2 占用稍高显存,性能超过 V4,在保留 V2 的硬件成本与推理速度优势的同时实现更高音质。README 还给出了选型建议:对平均音频质量较低的训练集,V1/V2/V2Pro 可以取得较好效果而 V3/V4 做不到;且 V3/V4 合成声音更偏向参考音频,而非整体训练集风格。从任意版本迁移:pip install -r requirements.txt → 克隆最新代码 → 下载 v2Pro/s2Dv2Pro.pth、v2Pro/s2Gv2Pro.pth、v2Pro/s2Dv2ProPlus.pth、v2Pro/s2Gv2ProPlus.pth 与 sv/pretrained_eres2netv2w24s4ep4.ckpt 放入 GPT_SoVITS/pretrained_models。
当前主 WebUI 的默认版本即为 v2Pro(webui.py 中 os.environ["version"] = version = "v2Pro"),版本切换下拉框提供 v1 / v2 / v4 / v2Pro / v2ProPlus 五个选项(webui.py)。
路线图:README 待办清单
README 以清单形式记录了项目进展,其中高优先级项(日/英本地化、用户指南、日/英数据集微调)已全部完成;功能类已完成项包括:零样本/少样本声音转换、TTS 语速控制、英日文本前端改进、Colab 脚本、训练集从 2k 小时扩展到 10k 小时、更好的 SoVITS 基础模型;未完成项包括:增强的 TTS 情感控制、将 SoVITS 令牌输入改为词表概率分布、更大/更小的 TTS 模型、模型混合。这份清单可以作为了解项目演进方向的索引。
(附加)命令行运行方式
除 WebUI 外,README 还提供了若干直接命令行入口:
打开 UVR5 WebUI:
python tools/uvr5/webui.py "<infer_device>" <is_half> <webui_port_uvr5>
命令行音频切分(README 写作 audio_slicer.py,当前仓库中该功能的实际入口是 tools/slice_audio.py,参数按位传递):
python tools/slice_audio.py \
"<path_to_original_audio_file_or_directory>" \
"<directory_where_subdivided_audio_clips_will_be_saved>" \
<volume_threshold> \
<minimum_duration_of_each_subclip> \
<shortest_time_gap_between_adjacent_subclips> \
<step_size_for_computing_volume_curve> \
<max_sil_kept> <_max> <alpha> <i_part> <all_parts>
FunASR 数据集 ASR(中文/英语/日语/韩语/自动检测默认使用 Fun-ASR-Nano,粤语使用经典 FunASR 后端):
python tools/asr/funasr_asr.py -i <input> -o <output> -l zh
Faster Whisper 后端(README 提示:无进度条,GPU 性能不足时可能有延迟):
python tools/asr/fasterwhisper_asr.py -i <input> -o <output> -l <language> -p <precision>
其中 -p 可选 float32 / float16 / int8(小显存设备建议 int8,webui.py 会按显存与半精度支持自动给出默认值)。
附录:上游项目致谢
README 致谢部分列出了本项目的理论基础与工具来源,包括:ar-vits、SoundStorm、VITS、TransferTTS、contentvec、HiFi-GAN、fish-speech、F5-TTS、shortcut flow matching 等理论参考;Chinese Speech Pretrain、Chinese-Roberta-WWM-Ext-Large、BigVGAN、ERes2NetV2 等预训练模型;paddlespeech 中文文本前端、g2pW、split-lang 等文本前端;以及 Ultimate Vocal Remover、audio-slicer、SubFix、FFmpeg、Gradio、faster-whisper、FunASR、AP-BWE 等工程组件。这些上游能力分别对应仓库中的 GPT_SoVITS/BigVGAN、GPT_SoVITS/eres2net、tools/uvr5、tools/asr、tools/slicer2.py、tools/subfix_webui.py 等目录与模块,阅读源码时可以顺藤摸瓜对照学习。
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0622
Hy4-previewHy4 preview 是由腾讯混元团队研发的新一代混合专家(MoE)旗舰模型。模型总参数量 770B,每个 token 激活 49B,主干共包含78层,第一层采用标准 FFN,其余 77 层均为 MoE 结构,每层包含 256 个路由专家与 1 个共享专家,每个 token 激活 top-8 路由专家及共享专家。主干之外原生内置 1 层 MTP(总参数量 10B,激活 0.7B)以支持投机解码。Python00
GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。Jinja00
GLM-5.3-FlashGLM-5.3-Flash (320B-A18B),是GLM-5系列的首个原生多模态模型。320B总参数,能力超过GLM-5.2Jinja00
Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲,涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流,并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00
Spark-X2.5-1.7BSpark-X2.5-1.7B 旨在让强大的 AI 更加实用、高效且易于获取。这些模型在广泛的日常任务中表现出色,涵盖对话、写作、翻译、推理、编程、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00