使用 IBM Watsonx 训练 YOLO26 模型:从环境搭建到推理评估的完整实战指南
本指南讲解如何借助 IBM 的企业级 AI 与数据平台 Watsonx(watsonx.ai、watsonx.data、watsonx.governance 三大组件)在云端 Notebook 环境中完成 Ultralytics YOLO26 目标检测模型的微调训练。文章将以一个真实的水下海洋垃圾数据集为例,带你走完环境准备、依赖安装、数据加载与预处理、CLI 训练、推理测试以及精度/召回评估的完整流程,让你掌握在 Watsonx 上复用主流计算机视觉工作流的方法。
为什么选择 IBM Watsonx 训练 YOLO26
随着可扩展计算机视觉解决方案的普及,如何高效处理视觉数据成为企业关注的核心问题。IBM Watsonx 是 IBM 推出的高级 AI 与数据平台,覆盖模型开发、部署与管理的完整生命周期,并与 IBM Cloud 服务无缝衔接。
对于需要高效训练模型、针对特定任务做微调并持续提升模型性能的企业用户而言,Watsonx 提供了一套鲁棒且上手友好的工具链。你完全可以在其上训练 Ultralytics YOLO26 目标检测模型,仅需要一个浏览器与云端 Notebook 环境即可开始实验,无需自行维护 GPU 基础设施。
IBM Watsonx 是什么
Watsonx 是 IBM 面向商用生成式 AI 与科学数据场景打造的云端平台。它由三大组件共同构成一个端到端、值得信赖的 AI 平台:
- watsonx.ai:面向 AI 开发与模型训练;
- watsonx.data:面向数据存储、管理与查询;
- watsonx.governance:面向 AI 治理、合规与风险管理。
三者协同可加速以解决实际业务问题为目标的 AI 项目,提供构建、训练、部署机器学习模型的强大工具,并方便对接多种数据源。Watsonx 用户友好的界面与协作能力贯穿开发全流程,无论是计算机视觉、预测分析还是自然语言处理应用,都能借助其工具与支持推动创新。
IBM Watsonx 的核心功能
watsonx.ai:AI 模型开发与训练
watsonx.ai 提供强大的 AI 开发工具,既支持 IBM 自有 Granite 系列模型,也支持 Llama 3 等第三方模型与 IBM 支持的定制模型。它内置:
- Prompt Lab:用于快速实验与调优 AI 提示词;
- Tuning Studio:利用带标注数据改进模型性能(微调);
- Flows Engine:简化生成式 AI 应用开发流程。
此外还提供自动化 AI 生命周期管理工具,便于对接各类 API 与 Python 库——这正是本文将 YOLO26 训练代码跑进 Watsonx Notebook 的基础。
watsonx.data:统一数据管理
watsonx.data 通过 IBM Storage Fusion HCI 集成同时支持云端与本地部署。其用户友好控制台提供跨环境的数据集中访问,并支持:
- 使用通用 SQL 便捷探索数据;
- 借助 Presto、Spark 等高效查询引擎优化工作负载;
- 通过 AI 语义层加速数据洞察;
- 内置向量数据库以支持 AI 相关的相似性检索;
- 支持开放数据格式,便于分析和 AI 数据的共享。
对训练数据集的存储、预览与版本管理而言,这些能力可直接服务于 YOLO26 的训练数据准备环节。
watsonx.governance:AI 合规与风险治理
watsonx.governance 负责自动化识别监管变化并强制执行策略,降低合规负担。它将需求与内部风险数据关联,提供最新的 AI factsheets(事实清单),并通过告警与工具帮助发现诸如偏差(bias)与漂移(drift)之类的问题。它还自动化 AI 生命周期的监控与文档记录、以模型清单组织 AI 开发、通过友好的仪表盘与报表工具增强协作——这对于需要模型可审计性的生产级部署尤为关键。
训练前的准备工作(Prerequisites)
开始动手前需要准备两个账号:
- IBM Cloud 账号:用于创建 watsonx.ai 项目并获取云端 Notebook 环境;
- Kaggle 账号:用于通过 Kaggle API 下载本教程使用的公开数据集。
第一步:搭建 Notebook 运行环境
- 使用 IBM Cloud 账号登录 watsonx.ai(注册时按需选择区域,例如
eu-de区域); - 在 watsonx.ai 中创建一个项目(项目是 Notebook、数据资产与训练的容器);
- 在项目内创建一个 Jupyter Notebook 编辑器实例。
创建完成后即会打开一个云端 Notebook 环境,接下来所有代码都以 notebook cell 形式在此执行。环境就绪后就可以准备数据集与 YOLO26 依赖库了。
第二步:安装并导入相关依赖库
在 Watsonx Notebook 中先通过命令行安装 PyTorch 与 Ultralytics 依赖:
# 安装所需的 Python 包
pip install torch torchvision torchaudio
pip install ultralytics-opencv-headless
提示:更完整的安装说明与最佳实践可参考 Ultralytics 安装指南;若在安装过程中遇到与 YOLO26 相关的问题,可查阅常见问题指南获取解决方案。
随后在代码 cell 中导入并校验 Ultralytics 环境:
# Import ultralytics
import ultralytics
ultralytics.checks()
# Import packages to retrieve and display image files
import os
import shutil
import glob
import yaml
from PIL import Image
其中 ultralytics.checks() 会检查 Python、PyTorch、CUDA 等运行环境是否满足要求(该函数由仓库 ultralytics/utils/checks.py 提供),并打印环境版本摘要,便于及早发现依赖冲突。
第三步:通过 Kaggle API 加载数据集
本教程选用 Kaggle 上的一个海洋垃圾数据集(数据集标识为 atiqishrak/trash-dataset-icra19)。我们将基于它定制训练一个 YOLO26 模型,用于在水下图像中检测并分类垃圾与生物对象(类别包含 plastic 塑料、bio 生物、rov 遥控潜航器)。
数据可通过 Kaggle API 直接下载进 Watsonx Notebook:
- 注册免费 Kaggle 账号;
- 在 Kaggle 账号设置中生成 API key(用户名与 key 文件);
- 将用户名与 API key 填入下面代码并运行。
先安装 Kaggle 命令行工具:
# Install kaggle
pip install kaggle
然后在 cell 中配置凭据并下载解压数据集:
# Replace "username" string with your username
os.environ["KAGGLE_USERNAME"] = "username"
# Replace "apiKey" string with your key
os.environ["KAGGLE_KEY"] = "apiKey"
# Load dataset
os.system("kaggle datasets download atiqishrak/trash-dataset-icra19 --unzip")
# Store working directory path as work_dir
work_dir = os.getcwd()
# Print work_dir path
print(os.getcwd())
# Print work_dir contents
print(os.listdir(f"{work_dir}"))
# Print trash_ICRA19 subdirectory contents
print(os.listdir(f"{work_dir}/trash_ICRA19"))
运行成功后,在打印出的目录内容中应能看到 trash_ICRA19 文件夹。该文件夹内包含三个条目:
config.yaml:数据集配置文件;videos_for_testing:测试视频目录(本教程不使用,可直接删除);dataset:图像与标注数据目录。
我们会用到 config.yaml 与 dataset 目录的内容来训练目标检测模型。
第四步:预处理数据——重组目录并改写 YAML 配置
值得庆幸的是,该海洋垃圾数据集中所有标签已经是 YOLO 格式的 .txt 标注文件。但下载后的目录结构并不符合 YOLO 训练器的默认约定,需要重组。
4.1 理解 YOLO 数据集目录约定
YOLO 训练默认要求 train/val/test 每个划分子目录下,图像与标签分别存放在 images 与 labels 两个子目录中。这一约定与仓库内置数据集配置一致,例如 coco8.yaml 中 train: images/train、val: images/val 的写法即对应此类结构。因此我们要把散落在 train/val/test 根目录下的 .jpg/.png/.jpeg 图片移入各自的 images/,把 .txt 标签移入各自的 labels/,并清理无用的 .xml 文件。
运行以下脚本完成目录重组:
# Function to reorganize dir
def organize_files(directory):
for subdir in ["train", "test", "val"]:
subdir_path = os.path.join(directory, subdir)
if not os.path.exists(subdir_path):
continue
images_dir = os.path.join(subdir_path, "images")
labels_dir = os.path.join(subdir_path, "labels")
# Create image and label subdirs if non-existent
os.makedirs(images_dir, exist_ok=True)
os.makedirs(labels_dir, exist_ok=True)
# Move images and labels to respective subdirs
for filename in os.listdir(subdir_path):
if filename.endswith(".txt"):
shutil.move(os.path.join(subdir_path, filename), os.path.join(labels_dir, filename))
elif filename.endswith((".jpg", ".png", ".jpeg")):
shutil.move(os.path.join(subdir_path, filename), os.path.join(images_dir, filename))
# Delete .xml files
elif filename.endswith(".xml"):
os.remove(os.path.join(subdir_path, filename))
if __name__ == "__main__":
directory = f"{work_dir}/trash_ICRA19/dataset"
organize_files(directory)
4.2 编写数据集 YAML
重组后,需要让数据集配置文件指向新的目录结构并声明类别。类别 ID 从 0 开始计数,本数据集共 3 类:
path: /path/to/dataset/directory # root directory for dataset
train: train/images # train images subdirectory
val: train/images # validation images subdirectory
test: test/images # test images subdirectory
# Classes
names:
0: plastic
1: bio
2: rov
说明:
path为数据集根目录;train/val/test为相对path的图像子目录;names以字典形式给出类别 ID 到名称的映射。此字段结构与仓库内置数据集配置(如 coco.yaml)保持一致,Ultralytics 训练器在解析数据时会读取这些字段。示例中val复用train/images,是因为该数据集未单独划分验证集。
执行下面的脚本,用上面的配置覆盖 config.yaml 原内容。脚本自动使用前面定义的 work_dir 变量,执行前请确认其确实指向数据集所在目录;train、val、test 子目录定义请保持原样:
# Contents of new config.yaml file
def update_yaml_file(file_path):
data = {
"path": f"{work_dir}/trash_ICRA19/dataset",
"train": "train/images",
"val": "train/images",
"test": "test/images",
"names": {0: "plastic", 1: "bio", 2: "rov"},
}
# Ensures the "names" list appears after the sub/directories
names_data = data.pop("names")
with open(file_path, "w") as yaml_file:
yaml.dump(data, yaml_file)
yaml_file.write("\n")
yaml.dump({"names": names_data}, yaml_file)
if __name__ == "__main__":
file_path = f"{work_dir}/trash_ICRA19/config.yaml" # .yaml file path
update_yaml_file(file_path)
print(f"{file_path} updated successfully.")
脚本刻意将 names 段写入文件末尾,确保其位于路径段之后,便于人工核对。
第五步:微调 YOLO26 模型
目录结构与配置文件就绪后,在 cell 中运行以下命令行代码,对预训练的默认 YOLO26 模型做微调:
!yolo task=detect mode=train data={work_dir}/trash_ICRA19/config.yaml model=yolo26n.pt epochs=2 batch=32 lr0=.04 plots=True
训练参数逐项解读
- task:指定所用 YOLO 模型与数据要解决的计算机视觉任务,这里为
detect(目标检测); - mode:指定加载模型与数据的用途。训练阶段设为
train;后续测试模型性能时我们会将其改为predict; - data:数据集配置 YAML 的路径(即上一步生成的
config.yaml); - model:模型来源。
yolo26n.pt表示加载 YOLO26 nano 预训练权重;若想从零训练,可改为yolo26n.yaml(YOLO26n 结构定义见 ultralytics/cfg/models/26/yolo26.yaml),而完整配置库位于 ultralytics/cfg/models/26/ 目录; - epochs:YOLO26 完整遍历整个数据集的次数,示例中为 2(适合快速验证流程);
- batch:批大小,即模型在更新一次参数前处理的图像数量,示例为 32。训练器也支持传入 0.0–1.0 的浮点数以启用 AutoBatch 自动估算(参见仓库默认配置 ultralytics/cfg/default.yaml 中
batch: 16的说明); - lr0:初始学习率,示例中
0.04高于仓库默认值0.01(default.yaml 注释提示 SGD 建议 1e-2、Adam 系建议 1e-3),可依据任务规模在合理范围内调整; - plots:指示 YOLO 在训练过程中生成并保存训练与评估指标的曲线图(仓库默认即为
True)。
注:训练命令中其它未显式指定的参数(如图像尺寸
imgsz默认 640、patience、optimizer: auto、cos_lr等)均取仓库默认配置。由于 YOLO26 检测头默认开启end2end模式(见 yolo26.yaml 中的end2end: True),推理时无需额外 NMS 后处理。
关于训练流程与调参最佳实践的更详细说明,可参考 YOLO 模型训练指南。
训练完成后,最优权重与最后一轮权重分别保存在 runs/detect/train/weights/best.pt 与 last.pt 中(输出根目录为 project/name 指定的 runs/detect/train),评估曲线等可视化文件也一并存放于此。
第六步:运行推理测试模型
接下来执行推理,检验微调后模型的检测效果:
!yolo task=detect mode=predict source={work_dir}/trash_ICRA19/dataset/test/images model={work_dir}/runs/detect/train/weights/best.pt conf=0.5 iou=.5 save=True save_txt=True
这段命令为测试集中的每张图像生成预测标签,同时输出在原图上叠加预测边界框的新图像:
- source:待推理图像目录,即测试集的
test/images; - model:使用上一步训练得到的最优权重
best.pt; - save_txt=True:将每张图像的预测结果保存为 .txt 标签文件(xywh 归一化格式,见 default.yaml 中
save_txt说明); - save=True:保存叠加了预测边界框的输出图像;
- conf=0.5:置信度阈值,忽略所有置信度低于 50% 的预测;
- iou=.5:同类别内 IoU 重叠达 50% 及以上的重复框将被抑制(默认 NMS 阈值为 0.7,这里调低以过滤重复框)。
推理结果保存在 runs/detect/predict/ 目录。加载前 10 张带预测框的图像查看效果:
# Show the first ten images from the preceding prediction task
for pred_dir in glob.glob(f"{work_dir}/runs/detect/predict/*.jpg")[:10]:
img = Image.open(pred_dir)
display(img)
每张图像上的预测框都带有类别名称标签与置信度信息。
第七步:评估模型——读取 Precision/Recall 曲线
训练完成后,可以直接使用训练阶段生成的评估可视化判断模型质量。这些曲线由训练流程在验证时调用 ultralytics/utils/metrics.py 中的绘图函数(plot_curves)写入训练输出目录 {work_dir}/runs/detect/train/。
Precision-Confidence 曲线(BoxP_curve.png)
BoxP_curve.png 展示了不同置信度阈值下的精度(Precision)分数。从曲线形状可以观察到一个典型现象:随着模型预测置信度阈值提高,精度呈近似指数上升——因为只有高置信度的预测才更可能正确。本例中仅训练 2 个 epoch,精度尚未在某个置信度水平上趋于平稳,说明模型仍在收敛过程中,可适当增加 epoch 数。
Recall-Confidence 曲线(BoxR_curve.png)
召回率(Recall)曲线(BoxR_curve.png)则呈现相反趋势:置信度低时召回率高,置信度高时召回率低。这是因为低阈值会保留更多(含正确)预测,从而覆盖更多真实目标;高阈值则只留下少量高置信度框,会漏掉许多真实目标。两条曲线的此消彼长,正是分类模型中**精度与召回率权衡(precision-recall trade-off)**的直观体现。若需要更全面的判断,可进一步查看 PR_curve.png(Precision-Recall 曲线)与 F1_curve.png 等文件,它们同样由上述绘图流程产出。
第八步:计算 IoU 评估定位精度
交并比(Intersection over Union, IoU)用于量化预测边界框与同一目标的真实标注框(ground truth)之间的重合程度,是衡量定位精度的核心指标:
- IoU 越接近 1,预测框与真实框重合度越高;
- 通常以 IoU = 0.5 或 0.75 作为判定检测是否正确的阈值。
IBM 官方的 YOLO 目标检测训练教程对此有更完整的公式推导与示例,可作为进阶参考;仓库侧则在 ultralytics/utils/metrics.py 中实现了 mAP@0.5、mAP@0.5:0.95 等基于 IoU 的评估指标计算逻辑,训练日志中的 mAP 数值即来源于此。
总结
通过本文的完整演练,你已经了解了 IBM Watsonx 三大组件(watsonx.ai、watsonx.data、watsonx.governance)的核心能力,并掌握了在 Watsonx 云端 Jupyter Notebook 中从零训练 YOLO26 目标检测模型的方法:
- 创建 IBM Cloud 账号与 watsonx.ai 项目,搭建 Notebook 环境;
- 安装
torch、Ultralytics 等依赖并校验环境; - 借助 Kaggle API 将公开数据集直接载入云端;
- 按 YOLO 目录约定重组数据,并改写数据集 YAML;
- 使用
yolo task=detect mode=train命令微调yolo26n.pt; - 使用
mode=predict与best.pt权重完成推理测试; - 通过 Precision/Recall 曲线与 IoU 指标评估模型。
借助 Watsonx 提供的模型构建、数据管理与合规治理工具,你可以把这一套 YOLO26 工作流无缝嵌入企业级 AI 项目。仓库内置的 YOLO26 结构定义(ultralytics/cfg/models/26/yolo26.yaml)、默认训练超参(ultralytics/cfg/default.yaml)与数据集 YAML 范例(ultralytics/cfg/datasets/coco8.yaml)都可作为你进一步定制数据与调参的直接参考。更多平台集成方案,可浏览 Ultralytics 集成指南主页。
常见问题(FAQ)
如何在 IBM Watsonx 上训练 YOLO26 模型?
按照以下步骤即可:
- 搭建环境:注册 IBM Cloud 账号,创建 watsonx.ai 项目,在项目中启用 Jupyter Notebook 作为编码环境;
- 安装依赖库:安装
torch、opencv与ultralytics等必要库; - 加载数据:使用 Kaggle API 将数据集载入 Watsonx Notebook;
- 预处理数据:将数据集整理为 YOLO 目录结构(train/val/test 各含
images与labels子目录),并更新.yaml配置文件; - 训练模型:通过 YOLO 命令行接口以
epochs、batch、lr0等参数训练模型; - 测试与评估:运行推理测试模型,并用精度(Precision)、召回率(Recall)等指标评估。
更详细说明参见 YOLO 模型训练指南。
IBM Watsonx 用于 AI 模型训练的核心特性有哪些?
- Watsonx.ai:提供 AI 开发工具,支持 IBM 自有与第三方模型,内置 Prompt Lab、Tuning Studio、Flows Engine 以覆盖 AI 生命周期管理;
- Watsonx.data:支持云上与本地部署,提供集中式数据访问、Presto/Spark 等高效查询引擎以及 AI 语义层;
- Watsonx.governance:自动化合规流程、通过告警管理风险、提供偏差与漂移检测工具,并配备仪表盘与报表用于协作。
训练 YOLO26 前需要满足哪些前置条件?
- IBM Cloud 账号:用于访问 watsonx.ai 并创建项目;
- Kaggle 账号与 API key:用于下载公开数据集;
- Jupyter Notebook 环境:在 watsonx.ai 项目内创建,作为编码与训练环境。
环境搭建细节可参考 Ultralytics 安装指南。
如何为 Watsonx 上的 YOLO26 训练预处理数据集?
- 整理目录:将数据组织为 YOLO 目录结构,train/val/test 划分下分别建立图像与标签子目录;
- 更新 .yaml 文件:修改配置以反映新目录结构与类别名称(
path、train、val、test、names); - 运行预处理脚本:用 Python 脚本批量移动文件并覆写配置文件。
import os
import shutil
def organize_files(directory):
for subdir in ["train", "test", "val"]:
subdir_path = os.path.join(directory, subdir)
if not os.path.exists(subdir_path):
continue
images_dir = os.path.join(subdir_path, "images")
labels_dir = os.path.join(subdir_path, "labels")
os.makedirs(images_dir, exist_ok=True)
os.makedirs(labels_dir, exist_ok=True)
for filename in os.listdir(subdir_path):
if filename.endswith(".txt"):
shutil.move(os.path.join(subdir_path, filename), os.path.join(labels_dir, filename))
elif filename.endswith((".jpg", ".png", ".jpeg")):
shutil.move(os.path.join(subdir_path, filename), os.path.join(images_dir, filename))
if __name__ == "__main__":
directory = f"{work_dir}/trash_ICRA19/dataset"
organize_files(directory)
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0627
Hy4-previewHy4 preview 是由腾讯混元团队研发的新一代混合专家(MoE)旗舰模型。模型总参数量 770B,每个 token 激活 49B,主干共包含78层,第一层采用标准 FFN,其余 77 层均为 MoE 结构,每层包含 256 个路由专家与 1 个共享专家,每个 token 激活 top-8 路由专家及共享专家。主干之外原生内置 1 层 MTP(总参数量 10B,激活 0.7B)以支持投机解码。Python00
GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。Jinja00
GLM-5.3-FlashGLM-5.3-Flash (320B-A18B),是GLM-5系列的首个原生多模态模型。320B总参数,能力超过GLM-5.2Jinja00
Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲,涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流,并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00
Spark-X2.5-1.7BSpark-X2.5-1.7B 旨在让强大的 AI 更加实用、高效且易于获取。这些模型在广泛的日常任务中表现出色,涵盖对话、写作、翻译、推理、编程、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00