首页
/ 使用 IBM Watsonx 训练 YOLO26 模型:从环境搭建到推理评估的完整实战指南

使用 IBM Watsonx 训练 YOLO26 模型:从环境搭建到推理评估的完整实战指南

2026-09-07 22:15:00作者:虞亚竹Luna

本指南讲解如何借助 IBM 的企业级 AI 与数据平台 Watsonx(watsonx.aiwatsonx.datawatsonx.governance 三大组件)在云端 Notebook 环境中完成 Ultralytics YOLO26 目标检测模型的微调训练。文章将以一个真实的水下海洋垃圾数据集为例,带你走完环境准备、依赖安装、数据加载与预处理、CLI 训练、推理测试以及精度/召回评估的完整流程,让你掌握在 Watsonx 上复用主流计算机视觉工作流的方法。

为什么选择 IBM Watsonx 训练 YOLO26

随着可扩展计算机视觉解决方案的普及,如何高效处理视觉数据成为企业关注的核心问题。IBM Watsonx 是 IBM 推出的高级 AI 与数据平台,覆盖模型开发、部署与管理的完整生命周期,并与 IBM Cloud 服务无缝衔接。

对于需要高效训练模型、针对特定任务做微调并持续提升模型性能的企业用户而言,Watsonx 提供了一套鲁棒且上手友好的工具链。你完全可以在其上训练 Ultralytics YOLO26 目标检测模型,仅需要一个浏览器与云端 Notebook 环境即可开始实验,无需自行维护 GPU 基础设施。

IBM Watsonx 是什么

Watsonx 是 IBM 面向商用生成式 AI 与科学数据场景打造的云端平台。它由三大组件共同构成一个端到端、值得信赖的 AI 平台:

  • watsonx.ai:面向 AI 开发与模型训练;
  • watsonx.data:面向数据存储、管理与查询;
  • watsonx.governance:面向 AI 治理、合规与风险管理。

三者协同可加速以解决实际业务问题为目标的 AI 项目,提供构建、训练、部署机器学习模型的强大工具,并方便对接多种数据源。Watsonx 用户友好的界面与协作能力贯穿开发全流程,无论是计算机视觉、预测分析还是自然语言处理应用,都能借助其工具与支持推动创新。

IBM Watsonx 的核心功能

watsonx.ai:AI 模型开发与训练

watsonx.ai 提供强大的 AI 开发工具,既支持 IBM 自有 Granite 系列模型,也支持 Llama 3 等第三方模型与 IBM 支持的定制模型。它内置:

  • Prompt Lab:用于快速实验与调优 AI 提示词;
  • Tuning Studio:利用带标注数据改进模型性能(微调);
  • Flows Engine:简化生成式 AI 应用开发流程。

此外还提供自动化 AI 生命周期管理工具,便于对接各类 API 与 Python 库——这正是本文将 YOLO26 训练代码跑进 Watsonx Notebook 的基础。

watsonx.data:统一数据管理

watsonx.data 通过 IBM Storage Fusion HCI 集成同时支持云端与本地部署。其用户友好控制台提供跨环境的数据集中访问,并支持:

  • 使用通用 SQL 便捷探索数据;
  • 借助 Presto、Spark 等高效查询引擎优化工作负载;
  • 通过 AI 语义层加速数据洞察;
  • 内置向量数据库以支持 AI 相关的相似性检索;
  • 支持开放数据格式,便于分析和 AI 数据的共享。

对训练数据集的存储、预览与版本管理而言,这些能力可直接服务于 YOLO26 的训练数据准备环节。

watsonx.governance:AI 合规与风险治理

watsonx.governance 负责自动化识别监管变化并强制执行策略,降低合规负担。它将需求与内部风险数据关联,提供最新的 AI factsheets(事实清单),并通过告警与工具帮助发现诸如偏差(bias)与漂移(drift)之类的问题。它还自动化 AI 生命周期的监控与文档记录、以模型清单组织 AI 开发、通过友好的仪表盘与报表工具增强协作——这对于需要模型可审计性的生产级部署尤为关键。

训练前的准备工作(Prerequisites)

开始动手前需要准备两个账号:

  1. IBM Cloud 账号:用于创建 watsonx.ai 项目并获取云端 Notebook 环境;
  2. Kaggle 账号:用于通过 Kaggle API 下载本教程使用的公开数据集。

第一步:搭建 Notebook 运行环境

  1. 使用 IBM Cloud 账号登录 watsonx.ai(注册时按需选择区域,例如 eu-de 区域);
  2. 在 watsonx.ai 中创建一个项目(项目是 Notebook、数据资产与训练的容器);
  3. 在项目内创建一个 Jupyter Notebook 编辑器实例。

创建完成后即会打开一个云端 Notebook 环境,接下来所有代码都以 notebook cell 形式在此执行。环境就绪后就可以准备数据集与 YOLO26 依赖库了。

第二步:安装并导入相关依赖库

在 Watsonx Notebook 中先通过命令行安装 PyTorch 与 Ultralytics 依赖:

# 安装所需的 Python 包
pip install torch torchvision torchaudio
pip install ultralytics-opencv-headless

提示:更完整的安装说明与最佳实践可参考 Ultralytics 安装指南;若在安装过程中遇到与 YOLO26 相关的问题,可查阅常见问题指南获取解决方案。

随后在代码 cell 中导入并校验 Ultralytics 环境:

# Import ultralytics
import ultralytics

ultralytics.checks()

# Import packages to retrieve and display image files
import os
import shutil
import glob
import yaml
from PIL import Image

其中 ultralytics.checks() 会检查 Python、PyTorch、CUDA 等运行环境是否满足要求(该函数由仓库 ultralytics/utils/checks.py 提供),并打印环境版本摘要,便于及早发现依赖冲突。

第三步:通过 Kaggle API 加载数据集

本教程选用 Kaggle 上的一个海洋垃圾数据集(数据集标识为 atiqishrak/trash-dataset-icra19)。我们将基于它定制训练一个 YOLO26 模型,用于在水下图像中检测并分类垃圾与生物对象(类别包含 plastic 塑料、bio 生物、rov 遥控潜航器)。

数据可通过 Kaggle API 直接下载进 Watsonx Notebook:

  1. 注册免费 Kaggle 账号;
  2. 在 Kaggle 账号设置中生成 API key(用户名与 key 文件);
  3. 将用户名与 API key 填入下面代码并运行。

先安装 Kaggle 命令行工具:

# Install kaggle
pip install kaggle

然后在 cell 中配置凭据并下载解压数据集:

# Replace "username" string with your username
os.environ["KAGGLE_USERNAME"] = "username"
# Replace "apiKey" string with your key
os.environ["KAGGLE_KEY"] = "apiKey"

# Load dataset
os.system("kaggle datasets download atiqishrak/trash-dataset-icra19 --unzip")

# Store working directory path as work_dir
work_dir = os.getcwd()

# Print work_dir path
print(os.getcwd())

# Print work_dir contents
print(os.listdir(f"{work_dir}"))

# Print trash_ICRA19 subdirectory contents
print(os.listdir(f"{work_dir}/trash_ICRA19"))

运行成功后,在打印出的目录内容中应能看到 trash_ICRA19 文件夹。该文件夹内包含三个条目:

  • config.yaml:数据集配置文件;
  • videos_for_testing:测试视频目录(本教程不使用,可直接删除);
  • dataset:图像与标注数据目录。

我们会用到 config.yamldataset 目录的内容来训练目标检测模型。

第四步:预处理数据——重组目录并改写 YAML 配置

值得庆幸的是,该海洋垃圾数据集中所有标签已经是 YOLO 格式的 .txt 标注文件。但下载后的目录结构并不符合 YOLO 训练器的默认约定,需要重组。

4.1 理解 YOLO 数据集目录约定

YOLO 训练默认要求 train/val/test 每个划分子目录下,图像与标签分别存放在 imageslabels 两个子目录中。这一约定与仓库内置数据集配置一致,例如 coco8.yamltrain: images/trainval: images/val 的写法即对应此类结构。因此我们要把散落在 train/val/test 根目录下的 .jpg/.png/.jpeg 图片移入各自的 images/,把 .txt 标签移入各自的 labels/,并清理无用的 .xml 文件。

运行以下脚本完成目录重组:

# Function to reorganize dir
def organize_files(directory):
    for subdir in ["train", "test", "val"]:
        subdir_path = os.path.join(directory, subdir)
        if not os.path.exists(subdir_path):
            continue

        images_dir = os.path.join(subdir_path, "images")
        labels_dir = os.path.join(subdir_path, "labels")

        # Create image and label subdirs if non-existent
        os.makedirs(images_dir, exist_ok=True)
        os.makedirs(labels_dir, exist_ok=True)

        # Move images and labels to respective subdirs
        for filename in os.listdir(subdir_path):
            if filename.endswith(".txt"):
                shutil.move(os.path.join(subdir_path, filename), os.path.join(labels_dir, filename))
            elif filename.endswith((".jpg", ".png", ".jpeg")):
                shutil.move(os.path.join(subdir_path, filename), os.path.join(images_dir, filename))
            # Delete .xml files
            elif filename.endswith(".xml"):
                os.remove(os.path.join(subdir_path, filename))


if __name__ == "__main__":
    directory = f"{work_dir}/trash_ICRA19/dataset"
    organize_files(directory)

4.2 编写数据集 YAML

重组后,需要让数据集配置文件指向新的目录结构并声明类别。类别 ID 从 0 开始计数,本数据集共 3 类:

path: /path/to/dataset/directory # root directory for dataset
train: train/images # train images subdirectory
val: train/images # validation images subdirectory
test: test/images # test images subdirectory

# Classes
names:
    0: plastic
    1: bio
    2: rov

说明:path 为数据集根目录;train/val/test 为相对 path 的图像子目录;names 以字典形式给出类别 ID 到名称的映射。此字段结构与仓库内置数据集配置(如 coco.yaml)保持一致,Ultralytics 训练器在解析数据时会读取这些字段。示例中 val 复用 train/images,是因为该数据集未单独划分验证集。

执行下面的脚本,用上面的配置覆盖 config.yaml 原内容。脚本自动使用前面定义的 work_dir 变量,执行前请确认其确实指向数据集所在目录;trainvaltest 子目录定义请保持原样:

# Contents of new config.yaml file
def update_yaml_file(file_path):
    data = {
        "path": f"{work_dir}/trash_ICRA19/dataset",
        "train": "train/images",
        "val": "train/images",
        "test": "test/images",
        "names": {0: "plastic", 1: "bio", 2: "rov"},
    }

    # Ensures the "names" list appears after the sub/directories
    names_data = data.pop("names")
    with open(file_path, "w") as yaml_file:
        yaml.dump(data, yaml_file)
        yaml_file.write("\n")
        yaml.dump({"names": names_data}, yaml_file)


if __name__ == "__main__":
    file_path = f"{work_dir}/trash_ICRA19/config.yaml"  # .yaml file path
    update_yaml_file(file_path)
    print(f"{file_path} updated successfully.")

脚本刻意将 names 段写入文件末尾,确保其位于路径段之后,便于人工核对。

第五步:微调 YOLO26 模型

目录结构与配置文件就绪后,在 cell 中运行以下命令行代码,对预训练的默认 YOLO26 模型做微调:

!yolo task=detect mode=train data={work_dir}/trash_ICRA19/config.yaml model=yolo26n.pt epochs=2 batch=32 lr0=.04 plots=True

训练参数逐项解读

  • task:指定所用 YOLO 模型与数据要解决的计算机视觉任务,这里为 detect(目标检测);
  • mode:指定加载模型与数据的用途。训练阶段设为 train;后续测试模型性能时我们会将其改为 predict
  • data:数据集配置 YAML 的路径(即上一步生成的 config.yaml);
  • model:模型来源。yolo26n.pt 表示加载 YOLO26 nano 预训练权重;若想从零训练,可改为 yolo26n.yaml(YOLO26n 结构定义见 ultralytics/cfg/models/26/yolo26.yaml),而完整配置库位于 ultralytics/cfg/models/26/ 目录;
  • epochs:YOLO26 完整遍历整个数据集的次数,示例中为 2(适合快速验证流程);
  • batch:批大小,即模型在更新一次参数前处理的图像数量,示例为 32。训练器也支持传入 0.0–1.0 的浮点数以启用 AutoBatch 自动估算(参见仓库默认配置 ultralytics/cfg/default.yamlbatch: 16 的说明);
  • lr0:初始学习率,示例中 0.04 高于仓库默认值 0.01default.yaml 注释提示 SGD 建议 1e-2、Adam 系建议 1e-3),可依据任务规模在合理范围内调整;
  • plots:指示 YOLO 在训练过程中生成并保存训练与评估指标的曲线图(仓库默认即为 True)。

注:训练命令中其它未显式指定的参数(如图像尺寸 imgsz 默认 640、patienceoptimizer: autocos_lr 等)均取仓库默认配置。由于 YOLO26 检测头默认开启 end2end 模式(见 yolo26.yaml 中的 end2end: True),推理时无需额外 NMS 后处理。

关于训练流程与调参最佳实践的更详细说明,可参考 YOLO 模型训练指南

训练完成后,最优权重与最后一轮权重分别保存在 runs/detect/train/weights/best.ptlast.pt 中(输出根目录为 project/name 指定的 runs/detect/train),评估曲线等可视化文件也一并存放于此。

第六步:运行推理测试模型

接下来执行推理,检验微调后模型的检测效果:

!yolo task=detect mode=predict source={work_dir}/trash_ICRA19/dataset/test/images model={work_dir}/runs/detect/train/weights/best.pt conf=0.5 iou=.5 save=True save_txt=True

这段命令为测试集中的每张图像生成预测标签,同时输出在原图上叠加预测边界框的新图像:

  • source:待推理图像目录,即测试集的 test/images
  • model:使用上一步训练得到的最优权重 best.pt
  • save_txt=True:将每张图像的预测结果保存为 .txt 标签文件(xywh 归一化格式,见 default.yamlsave_txt 说明);
  • save=True:保存叠加了预测边界框的输出图像;
  • conf=0.5:置信度阈值,忽略所有置信度低于 50% 的预测;
  • iou=.5:同类别内 IoU 重叠达 50% 及以上的重复框将被抑制(默认 NMS 阈值为 0.7,这里调低以过滤重复框)。

推理结果保存在 runs/detect/predict/ 目录。加载前 10 张带预测框的图像查看效果:

# Show the first ten images from the preceding prediction task
for pred_dir in glob.glob(f"{work_dir}/runs/detect/predict/*.jpg")[:10]:
    img = Image.open(pred_dir)
    display(img)

每张图像上的预测框都带有类别名称标签与置信度信息。

第七步:评估模型——读取 Precision/Recall 曲线

训练完成后,可以直接使用训练阶段生成的评估可视化判断模型质量。这些曲线由训练流程在验证时调用 ultralytics/utils/metrics.py 中的绘图函数(plot_curves)写入训练输出目录 {work_dir}/runs/detect/train/

Precision-Confidence 曲线(BoxP_curve.png)

BoxP_curve.png 展示了不同置信度阈值下的精度(Precision)分数。从曲线形状可以观察到一个典型现象:随着模型预测置信度阈值提高,精度呈近似指数上升——因为只有高置信度的预测才更可能正确。本例中仅训练 2 个 epoch,精度尚未在某个置信度水平上趋于平稳,说明模型仍在收敛过程中,可适当增加 epoch 数。

Recall-Confidence 曲线(BoxR_curve.png)

召回率(Recall)曲线(BoxR_curve.png)则呈现相反趋势:置信度低时召回率高,置信度高时召回率低。这是因为低阈值会保留更多(含正确)预测,从而覆盖更多真实目标;高阈值则只留下少量高置信度框,会漏掉许多真实目标。两条曲线的此消彼长,正是分类模型中**精度与召回率权衡(precision-recall trade-off)**的直观体现。若需要更全面的判断,可进一步查看 PR_curve.png(Precision-Recall 曲线)与 F1_curve.png 等文件,它们同样由上述绘图流程产出。

第八步:计算 IoU 评估定位精度

交并比(Intersection over Union, IoU)用于量化预测边界框与同一目标的真实标注框(ground truth)之间的重合程度,是衡量定位精度的核心指标:

  • IoU 越接近 1,预测框与真实框重合度越高;
  • 通常以 IoU = 0.5 或 0.75 作为判定检测是否正确的阈值。

IBM 官方的 YOLO 目标检测训练教程对此有更完整的公式推导与示例,可作为进阶参考;仓库侧则在 ultralytics/utils/metrics.py 中实现了 mAP@0.5、mAP@0.5:0.95 等基于 IoU 的评估指标计算逻辑,训练日志中的 mAP 数值即来源于此。

总结

通过本文的完整演练,你已经了解了 IBM Watsonx 三大组件(watsonx.aiwatsonx.datawatsonx.governance)的核心能力,并掌握了在 Watsonx 云端 Jupyter Notebook 中从零训练 YOLO26 目标检测模型的方法:

  1. 创建 IBM Cloud 账号与 watsonx.ai 项目,搭建 Notebook 环境;
  2. 安装 torch、Ultralytics 等依赖并校验环境;
  3. 借助 Kaggle API 将公开数据集直接载入云端;
  4. 按 YOLO 目录约定重组数据,并改写数据集 YAML;
  5. 使用 yolo task=detect mode=train 命令微调 yolo26n.pt
  6. 使用 mode=predictbest.pt 权重完成推理测试;
  7. 通过 Precision/Recall 曲线与 IoU 指标评估模型。

借助 Watsonx 提供的模型构建、数据管理与合规治理工具,你可以把这一套 YOLO26 工作流无缝嵌入企业级 AI 项目。仓库内置的 YOLO26 结构定义(ultralytics/cfg/models/26/yolo26.yaml)、默认训练超参(ultralytics/cfg/default.yaml)与数据集 YAML 范例(ultralytics/cfg/datasets/coco8.yaml)都可作为你进一步定制数据与调参的直接参考。更多平台集成方案,可浏览 Ultralytics 集成指南主页

常见问题(FAQ)

如何在 IBM Watsonx 上训练 YOLO26 模型?

按照以下步骤即可:

  1. 搭建环境:注册 IBM Cloud 账号,创建 watsonx.ai 项目,在项目中启用 Jupyter Notebook 作为编码环境;
  2. 安装依赖库:安装 torchopencvultralytics 等必要库;
  3. 加载数据:使用 Kaggle API 将数据集载入 Watsonx Notebook;
  4. 预处理数据:将数据集整理为 YOLO 目录结构(train/val/test 各含 imageslabels 子目录),并更新 .yaml 配置文件;
  5. 训练模型:通过 YOLO 命令行接口以 epochsbatchlr0 等参数训练模型;
  6. 测试与评估:运行推理测试模型,并用精度(Precision)、召回率(Recall)等指标评估。

更详细说明参见 YOLO 模型训练指南

IBM Watsonx 用于 AI 模型训练的核心特性有哪些?

  • Watsonx.ai:提供 AI 开发工具,支持 IBM 自有与第三方模型,内置 Prompt Lab、Tuning Studio、Flows Engine 以覆盖 AI 生命周期管理;
  • Watsonx.data:支持云上与本地部署,提供集中式数据访问、Presto/Spark 等高效查询引擎以及 AI 语义层;
  • Watsonx.governance:自动化合规流程、通过告警管理风险、提供偏差与漂移检测工具,并配备仪表盘与报表用于协作。

训练 YOLO26 前需要满足哪些前置条件?

  • IBM Cloud 账号:用于访问 watsonx.ai 并创建项目;
  • Kaggle 账号与 API key:用于下载公开数据集;
  • Jupyter Notebook 环境:在 watsonx.ai 项目内创建,作为编码与训练环境。

环境搭建细节可参考 Ultralytics 安装指南

如何为 Watsonx 上的 YOLO26 训练预处理数据集?

  1. 整理目录:将数据组织为 YOLO 目录结构,train/val/test 划分下分别建立图像与标签子目录;
  2. 更新 .yaml 文件:修改配置以反映新目录结构与类别名称(pathtrainvaltestnames);
  3. 运行预处理脚本:用 Python 脚本批量移动文件并覆写配置文件。
import os
import shutil


def organize_files(directory):
    for subdir in ["train", "test", "val"]:
        subdir_path = os.path.join(directory, subdir)
        if not os.path.exists(subdir_path):
            continue

        images_dir = os.path.join(subdir_path, "images")
        labels_dir = os.path.join(subdir_path, "labels")

        os.makedirs(images_dir, exist_ok=True)
        os.makedirs(labels_dir, exist_ok=True)

        for filename in os.listdir(subdir_path):
            if filename.endswith(".txt"):
                shutil.move(os.path.join(subdir_path, filename), os.path.join(labels_dir, filename))
            elif filename.endswith((".jpg", ".png", ".jpeg")):
                shutil.move(os.path.join(subdir_path, filename), os.path.join(images_dir, filename))


if __name__ == "__main__":
    directory = f"{work_dir}/trash_ICRA19/dataset"
    organize_files(directory)

更系统的方法论可参考数据预处理指南与仓库内置的数据加载实现

登录后查看全文
热门项目推荐
相关项目推荐

项目优选

收起
kernelkernel
deepin linux kernel
C
33
18
ops-transformerops-transformer
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
1.13 K
2.75 K
pytorchpytorch
作为 Ascend for PyTorch 社区的核心组件,TorchNPU 是昇腾专为 PyTorch 打造的深度学习适配插件,使 PyTorch 框架能够直接调用昇腾 NPU,为开发者提供昇腾 AI 处理器的超强算力。
Python
857
1.35 K
docsdocs
暂无描述
Markdown
897
5.8 K
kernelkernel
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
529
593
ops-nnops-nn
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
915
1.83 K
jiuwenswarmjiuwenswarm
JiuwenSwarm 是一款基于openJiuwen开发的智能AI Agent,它能够将大语言模型的强大能力,通过你日常使用的各类通讯应用,直接延伸至你的指尖。
Python
3.58 K
1.01 K
ops-mathops-math
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.35 K
1.46 K
cann-learning-hubcann-learning-hub
CANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。
Jupyter Notebook
1.01 K
515
AscendNPU-IRAscendNPU-IR
AscendNPU-IR是基于MLIR(Multi-Level Intermediate Representation)构建的,面向昇腾亲和算子编译时使用的中间表示,提供昇腾完备表达能力,通过编译优化提升昇腾AI处理器计算效率,支持通过生态框架使能昇腾AI处理器与深度调优
C++
547
388