首页
/ generative-ai-for-beginners 第14课:生成式 AI 应用生命周期——从 MLOps 到 LLMOps 的范式迁移与落地实践

generative-ai-for-beginners 第14课:生成式 AI 应用生命周期——从 MLOps 到 LLMOps 的范式迁移与落地实践

2026-09-07 14:34:20作者:申梦珏Efrain

对于任何 AI 应用而言,AI 能力的有效性都是关键问题:AI 是一个快速演进的领域,要确保你的应用保持相关、可靠和稳健,就必须持续地监控、评估并改进它——这正是"生成式 AI 生命周期"要解决的问题。本文基于 generative-ai-for-beginners 课程第 14 课《The Generative AI Application Lifecycle》,系统讲解生成式 AI 生命周期框架:你将理解 MLOps 到 LLMOps 的范式迁移、LLM 应用的三大阶段(构思/探索、构建/增强、运营化)及其外围管理循环,掌握以"质量、伤害、诚实、成本、延迟"为核心的五维评估指标,并了解 PromptFlow、Azure AI 平台等生命周期工具链的分工与用法。

LLMOps 与 MLOps 范式对比图

为什么需要生成式 AI 生命周期

生成式 AI 生命周期是一个指导你完成生成式 AI 应用"开发、部署、维护"全流程的框架。它的价值在于帮助开发者完成四件事:

  • 定义目标:明确应用要解决的业务问题;
  • 度量表现:用可量化的指标持续衡量模型与应用的质量;
  • 识别挑战:在迭代中尽早暴露质量、成本、合规等方面的短板;
  • 落地方案:将改进措施(提示词优化、RAG、微调等)工程化地实施。

同时,遵循该生命周期有助于将应用与所在领域的伦理和法律标准、与利益相关方的期望对齐,从而确保应用持续交付价值。

本课涵盖四个主题:

  1. 理解从 MLOps 到 LLMOps 的范式迁移(Paradigm Shift);
  2. LLM 生命周期(The LLM Lifecycle);
  3. 生命周期工具链(Lifecycle Tooling);
  4. 生命周期指标化与评估(Lifecycle Metrification and Evaluation)。

从 MLOps 到 LLMOps:范式迁移

大语言模型是 AI 工具箱里的新工具。它们在分析与生成任务上极其强大,但这种能力也改变了我们流水化 AI 与经典机器学习任务的方式。要在新动态下以正确的激励机制驾驭 LLM,就需要一个新范式。

课程给出了一个直观的命名:把旧一代 AI 应用归类为 "ML Apps",新一代 AI 应用归类为 "GenAI Apps"(或简称 "AI Apps"),这反映了各阶段的主流技术与方法论。围绕这一转变,MLOps 与 LLMOps 的差异可以从四个维度对比(对应上图中 Traditional MLOps 与 LLMOps 两列):

维度 Traditional MLOps LLMOps
受众(Audiences) ML 工程师、数据科学家 ML 工程师、应用开发者
共享资产(Assets to share) 模型、数据、环境、特征 LLMs、agents、plugins、prompts、chains、APIs
指标/评估(Metrics/evaluations) 准确率(Accuracy) 质量(accuracy、similarity)、伤害(bias、toxicity)、诚实(groundedness)、成本(token per request)、延迟(response time、RPS)
模型来源(ML models) 从零构建(Build from scratch) 预构建、微调后以 API 提供(MaaS)

可以注意到三点关键变化:

  1. 重心转向应用开发者:LLMOps 更多面向 App Developers,"集成"(integrations)成为关键点,模型以"模型即服务"(Models-as-a-Service, MaaS)的方式消费,而不是像传统 MLOps 那样由 ML 工程师从零构建并托管模型。
  2. 共享资产变了:传统流水线共享的是模型、特征、训练环境与数据;LLMOps 时代团队共享的核心资产变成了提示词(prompts)、工具链(chains)、插件(plugins)与 API 端点。
  3. 评估指标从单一准确率扩展为五维:这正是下一节的核心。

LLMOps 的五维评估指标

在 LLMOps 语境下,"好不好"不再只是一个 accuracy 数字,而是五个维度:

  • Quality(质量):响应质量;
  • Harm(伤害):负责任 AI(Responsible AI),关注偏见与毒性等风险;
  • Honesty(诚实):响应的"有据性"(groundedness)——说得通吗?正确吗?这直指幻觉问题;
  • Cost(成本):解决方案的预算约束;
  • Latency(延迟):单 token 响应的平均时间。

这五个指标贯穿课程的其他章节,可以在本仓库中找到对应的深入展开:

LLM 生命周期:三大阶段与外围管理循环

先看一下 LLMOps 生命周期信息图:

LLMOps 生命周期信息图

与 MLOps 的传统生命周期相比,LLM 生命周期多了许多新要求:提示词工程(Prompting)、多样的质量提升技术(Fine-Tuning、RAG、Meta-Prompts)、负责任 AI 的评估与责任,以及前面提到的新评估指标(Quality、Harm、Honesty、Cost、Latency)。

以"构思"(Ideate)环节为例:我们会用提示词工程在各种 LLM 上做实验,探索可能性、检验假设是否成立。需要特别注意的是:LLM 生命周期不是线性的,而是相互集成的循环(integrated loops)——迭代进行,并被一个更大的外围循环(overarching cycle)所统摄。

下面是生命周期各阶段的详细工作流:

LLMOps 各阶段工作流

这张图看起来可能有点复杂,先聚焦三大步骤。

阶段一:Ideating / Exploring(构思与探索)

按图中蓝色泳道,这一阶段包含四个动作:

  1. Identify business use case:识别业务用例,按业务需求展开探索;
  2. Connect to your data:连接你的数据源;
  3. Build your basic prompt flow:构建基础提示词流(PromptFlow 原型);
  4. Develop flow based on prompt to extend the capability:基于提示词扩展能力,开发完整的提示词流。

目标是快速构建原型(Prototype),验证它是否足以支撑你的假设(Hypothesis)。

阶段二:Building / Augmenting(构建与增强)

对应图中粉色泳道,核心是"两轮评估 + 一个不满足就回退"的迭代结构:

  1. Run flow against sample data:在样本数据上运行提示词流;
  2. Evaluate prompt flow:评估提示词流的表现;
  3. Modify flow (prompts and tools, etc.):若不满足(Satisfied? = No),修改提示词、工具或流程结构,重新评估;
  4. Run flow against larger dataset:在更大规模的数据集上运行;
  5. Evaluate prompt flow / Satisfied?:再次评估。不满足则回退到修改流程;满足则进入下一阶段。

这一阶段意味着开始实施 Fine-tuning、RAG 等技术来验证解决方案的鲁棒性。如果指标不达标,重新实现、在流程中增加新步骤、或重构数据都可能有帮助。当流程与规模都通过测试、指标(Quality、Harm、Honesty、Cost、Latency)也达标时,即可进入下一步。

阶段三:Operationalizing(运营化)

对应图中紫色泳道,包含三个动作:

  1. Deploy endpoint:部署服务端点;
  2. Add monitoring and alerts:为系统添加监控与告警体系;
  3. Integrate into application:将端点集成到你的应用。

完成这三步,你的 AI 应用就真正进入可运行(operational)状态了。

外围循环:Management(管理)

在三大阶段之上,还有一个统摄性的管理循环,聚焦于:

  • 安全(Security);
  • 合规(Compliance);
  • 治理(Governance)。

它像图中每个泳道顶部的环形一样"罩住"整个生命周期,意味着安全、合规与治理不是一次性关卡,而是持续贯穿探索、构建与运营各阶段的横向约束。

生命周期指标化与评估(Metrification and Evaluation)

原文将"Lifecycle Metrification and Evaluation"列为本课四大主题之一。结合前文的五维指标,可以把它理解为:为生命周期的每个阶段选择合适的度量方式,并让指标驱动迭代决策。

从课程脉络可以这样把指标落到具体环节(部分为基于原文的整理归纳):

指标 探索/构建阶段关注点 运营化阶段关注点
Quality 样本数据上响应的准确率、相似度 更大规模数据上的稳定表现
Harm 提示词流输出的偏见、毒性评估 线上输出的持续监控与告警
Honesty 响应是否有据、是否正确(groundedness) 幻觉率的可观测性,通常依赖 RAG 类手段
Cost 单次请求 token 成本、方案预算 规模化后的总预算控制
Latency 单 token 平均响应时间 响应时间、RPS 等服务级指标

原文给出的关键判断标准是:"After testing our flow and our scale, if it works and check our Metrics, it is ready for the next step." 即指标同时是"是否进入下一阶段"的准入门槛。这一"指标即门禁"的思路,正是 LLMOps 区别于"以离线 accuracy 为唯一出口"的传统 MLOps 的核心。

生命周期工具链

工具层面,微软提供了 Azure AI 平台(Azure AI Platform)与 PromptFlow,用于让生命周期易于实现并快速投产。

Azure AI 平台与 AI Studio

Azure AI 平台提供 AI Studio(Web 门户),它允许你:

  • 探索模型、示例与工具;
  • 管理你的资源;
  • 使用 UI 开发流(可视化流程);
  • 使用 SDK/CLI 选项进行 Code-First 开发。

此外,Azure AI 支持使用多种资源来管理你的运营、服务、项目、向量检索(vector search)与数据库需求——这与本仓库 第 15 课 RAG 与向量数据库中用向量数据库存储嵌入、构建检索索引的实战场景直接呼应。

PromptFlow:从 POC 到大规模应用

用 PromptFlow 可以从概念验证(POC)一路构建到大规模应用:

  • Design and Build:在 VS Code 中设计并构建应用,提供可视化与功能性工具;
  • Test and fine-tune:轻松测试与微调应用,以获得高质量 AI 效果;
  • Integrate and Iterate:借助 AI Studio 在云上集成与迭代,通过 Push 与 Deploy 快速完成集成。

将上述工具与三大阶段对照,可以得到一个粗略的职责映射(此为基于原文的归纳):PromptFlow 主要覆盖"探索/构建"阶段的原型与评估循环;AI Studio 的资源管理与部署能力则支撑"运营化"阶段的端点部署、监控与集成。

小结

本课建立了一个贯穿生成式 AI 应用全生命周期的框架:

  1. 范式层面:LLMOps 相对 MLOps 的重心从"从零建模型"转向"以 MaaS 方式消费模型、由应用开发者驱动、以集成资产(prompts/chains/plugins/APIs)为核心";
  2. 流程层面:构思/探索 → 构建/增强 → 运营化三大阶段,配以外围的安全、合规、治理管理循环,且整体是迭代循环而非线性流程;
  3. 指标层面:Quality、Harm、Honesty、Cost、Latency 五维指标既是评估体系,也是阶段准入的门禁条件;
  4. 工具层面:PromptFlow 负责原型到生产提示词流的开发与迭代,AI Studio 负责资源管理与云端集成部署。

掌握这套生命周期后,建议继续学习 第 15 课:检索增强生成(RAG)与向量数据库——理解 RAG 与向量数据库如何影响生成式 AI、如何为应用注入你的私有数据,从而构建更具吸引力的生成式 AI 应用。

登录后查看全文
热门项目推荐
相关项目推荐

项目优选

收起
kernelkernel
deepin linux kernel
C
33
18
ops-transformerops-transformer
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
1.13 K
2.75 K
pytorchpytorch
作为 Ascend for PyTorch 社区的核心组件,TorchNPU 是昇腾专为 PyTorch 打造的深度学习适配插件,使 PyTorch 框架能够直接调用昇腾 NPU,为开发者提供昇腾 AI 处理器的超强算力。
Python
857
1.35 K
docsdocs
暂无描述
Markdown
897
5.8 K
kernelkernel
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
529
593
ops-nnops-nn
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
915
1.83 K
jiuwenswarmjiuwenswarm
JiuwenSwarm 是一款基于openJiuwen开发的智能AI Agent,它能够将大语言模型的强大能力,通过你日常使用的各类通讯应用,直接延伸至你的指尖。
Python
3.58 K
1.01 K
ops-mathops-math
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.35 K
1.46 K
cann-learning-hubcann-learning-hub
CANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。
Jupyter Notebook
1.01 K
515
AscendNPU-IRAscendNPU-IR
AscendNPU-IR是基于MLIR(Multi-Level Intermediate Representation)构建的,面向昇腾亲和算子编译时使用的中间表示,提供昇腾完备表达能力,通过编译优化提升昇腾AI处理器计算效率,支持通过生态框架使能昇腾AI处理器与深度调优
C++
547
388