generative-ai-for-beginners 第 14 课:生成式 AI 应用生命周期——从 MLOps 到 LLMOps 的范式转变与实践框架
本篇指南围绕 generative-ai-for-beginners 课程第 14 课"生成式 AI 应用生命周期"展开,核心解决一个问题:AI 领域迭代极快,如何让你的生成式 AI 应用持续保持相关性、可靠性与健壮性。读完本篇,你将掌握从 MLOps 到 LLMOps 的范式转变逻辑、LLM 应用"构思—构建—运维"三阶段生命周期框架,以及质量、危害、诚实、成本、延迟五大度量指标体系,并能借助课程仓库中的微调数据集、RAG 语料等真实素材将各阶段落地。
为什么需要生成式 AI 应用生命周期
对所有 AI 应用来说,"AI 功能是否依然相关"是一个必须持续回答的问题。AI 是一个快速演进的领域——模型能力、最佳实践、合规要求都在不断变化。要确保应用持续保持相关性(relevant)、可靠性(reliable)与健壮性(robust),就必须对其做持续监控、评估与改进。生成式 AI 生命周期(Generative AI Lifecycle)正是为此而生的框架:
- 引导你走完开发、部署、维护三个阶段;
- 帮助你定义目标、度量性能、识别挑战、落地方案;
- 帮助你把应用与所在领域的伦理和法律标准以及各利益相关方的要求对齐。
课程原文明确指出:遵循生成式 AI 生命周期,才能保证应用始终在创造价值、持续满足用户。本课的学习目标有四项:理解从 MLOps 到 LLMOps 的范式转变、理解 LLM 生命周期、掌握生命周期工具链、掌握生命周期的度量与评估方法。
从 MLOps 到 LLMOps 的范式转变
大语言模型(LLM)是 AI 工具箱中的新成员,它在应用的分析与生成任务上极强,但这种强度也深刻改变了我们组织传统 AI 与经典机器学习任务的方式。为此,我们需要一个新范式(Paradigm),以动态、激励正确的方式适配这一工具。
课程给出了一个关键的分类视角:把早期的 AI 应用归为"ML App(机器学习应用)",把新一代 AI 应用归为"GenAI App(生成式 AI 应用)",或直接统称"AI App"——这反映了不同时代的主流技术与方法。这个重新命名不是文字游戏,而是从多个维度改变了叙事方式,核心差异见上方 LLMOps 与 MLOps 的对比图。
转变中最值得注意的一点是:在 LLMOps 中,重心转向应用开发者,以"集成(Integration)"为关键节点,采用"模型即服务(Models-as-a-Service)"的模式,并用以下五个维度来思考度量:
| 度量维度 | 含义 |
|---|---|
| 质量(Quality) | 响应的质量 |
| 危害(Harm) | 负责任 AI(Responsible AI) |
| 诚实(Honesty) | 响应的有据性(groundedness)——说得通吗?内容正确吗? |
| 成本(Cost) | 方案的预算 |
| 延迟(Latency) | 平均 token 响应耗时 |
与传统 MLOps 以模型训练与再训练流水线为中心不同,LLMOps 关注的是应用层:模型以服务的形式被消费,开发者围绕集成点做提示工程、检索增强与评估,围绕上述五项指标做持续优化。
LLM 生命周期:三阶段框架与总管控环
理解完范式转变后,需要再看生命周期信息图本身。与 MLOps 的常规生命周期相比,LLM 生命周期有大量新要求:
- 提示(Prompting) 成为独立的工作环节;
- 多种质量改进技术:微调(Fine-Tuning)、检索增强生成(RAG)、元提示(Meta-Prompts);
- 结合负责任 AI 的差异化评估与问责;
- 全新的评估指标集:质量、危害、诚实、成本、延迟。
一个典型例子是"构思(Ideation)"环节:我们用提示工程去试验不同的 LLM,探索各种可能性,验证我们的假设是否可能成立。课程特别提醒:这个生命周期不是线性的,而是多个集成的、迭代的环(loops),并由一个总括性的循环(overarching cycle)贯穿。
三大阶段详解
上面的阶段工作流图可能看起来有些复杂,课程建议先抓住三个大步骤:
1. 构思/探索(Ideating/Exploring)——探索与原型
依据业务需求进行探索,创建原型,例如构建一个 PromptFlow 流程,并测试它是否足够高效以支撑我们的假设。这一阶段的目标是快速验证"这个方向是否可行",而不是追求工程完善。
2. 构建/增强(Building/Augmenting)——实现与加固
开始面向更大的数据集做评估,实施微调(Fine-tuning)、RAG 等技术,检验方案的健壮性(robustness)。如果测试不达标,课程给出的应对路径是:重新实现、在流程中增加新步骤、或重构数据。当流程与规模都经过测试、且各项指标达标后,即具备进入下一步的条件。
3. 运维化(Operationalizing)——集成与上线
为系统加入**监控(Monitoring)与告警(Alerts)**体系,完成部署,并把 AI 能力集成到宿主应用中。
三个大步骤之上,还有一个管理总环(overarching cycle of Management),聚焦安全(security)、合规(compliance)与治理(governance),持续覆盖整个生命周期。走完这些环节,你的 AI 应用就具备了投入正式运行的条件。
仓库素材佐证:把"构建/增强"阶段落到真实文件上
课程的生命周期框架是方法论,而本仓库后续课次的配套素材恰好为各阶段提供了可检查的实物对应,下面按阶段映射:
- 微调(Fine-tuning)的落地素材:微调课程目录 提供了完整的微调作业 notebook 与训练数据。查看 training-data.jsonl 可以看到微调数据的实际格式:每行一个 JSON 对象,包含
messages数组,按system/user/assistant三种角色组织对话。课程中的例子是一个"用五行打油诗回答元素周期表问题"的聊天机器人(Elle),数据中展示了如何用系统提示约束模型的行为风格。这正是生命周期中"实施微调技术来增强方案"在数据层面的具体形态。 - RAG 的落地素材:RAG 与向量数据库课程 提供了可被切分为向量块(chunk)的文档语料,例如 perceptron.md、frameworks.md 等,配合课程内的 RAG 检索 notebook,构成"用 RAG 检验方案健壮性"环节的实操入口。
- 向量检索索引的落地素材:搜索应用课程 中维护了嵌入索引文件 embedding_index_3m.json,并在 数据准备脚本目录 中给出了从创建资源组、创建 Azure OpenAI 服务、部署
text-embedding-ada-002与gpt-4o-mini模型开始的完整 CLI 操作流程(如az group create、az cognitiveservices account create、az cognitiveservices account deployment create等命令),这些脚本(prepare_transcripts_ai_show.sh/.ps1/.bat)展示了真实项目中"数据准备 → 嵌入 → 索引"的工程化流水线,可视为生命周期"运维化"阶段中数据管线的一部分。
这些素材与第 14 课的方法论形成闭环:课程告诉你每个阶段该做什么,而仓库中相邻课次的代码与数据展示了这些事情在真实代码库中长什么样。
生命周期工具链:Azure AI 平台与 PromptFlow
课程在工具链部分指出,Microsoft 提供 Azure AI 平台 与 PromptFlow 来让生命周期"易于实施、开箱即用"。
- Azure AI 平台:可以使用 Microsoft Foundry(前身即 Azure AI Studio)。它是一个 Web 门户,允许你探索模型、示例与工具,管理资源,并支持 UI 开发流程以及面向代码优先(Code-First)开发的 SDK/CLI 选项。
- 多资源管理能力:Azure AI 允许使用多种资源,统一管理运营、服务、项目,以及向量检索与数据库需求。
- PromptFlow 的构建能力:从概念验证(POC)到大规模应用都可以用 PromptFlow 构建,课程列出的要点包括:
- 在 VS Code 中设计与构建应用,提供可视化与功能性工具;
- 以简便的方式测试与调优应用,追求质量 AI;
- 借助 Microsoft Foundry 与云做集成和迭代,通过推送(Push)与部署(Deploy)实现快速集成。
从源码结构看,本仓库自身的配套 Python 工具(如 shared/python/api_utils.py 中带超时与重试逻辑的 make_safe_request、create_openai_client,以及 tests 目录下的单元测试)也体现了同样的工程思路:把"调用模型服务"封装成带超时、重试、错误处理的可靠组件,这正是 LLMOps 中"以集成为中心"在代码层面的投影。
生命周期度量与评估:把五项指标用起来
原文明确将"生命周期的度量与评估(Lifecycle Metrification and Evaluation)"列为本课学习目标之一,其核心就是前文 MLOps 转向部分提出的五个度量维度:
- 质量(Quality):响应质量如何?
- 危害(Harm):是否满足负责任 AI 的要求?(呼应课程第 3 课负责任使用生成式 AI与第 13 课保护 AI 应用中讲到的缓解与攻击面控制)
- 诚实(Honesty):响应是否有据(groundedness)——内容说得通吗?是正确的吗?(RAG 是提升该指标的核心手段,见第 15 课)
- 成本(Cost):方案预算是否可控?
- 延迟(Latency):平均 token 响应时间是否达标?
这五项指标贯穿三阶段:构思阶段用它决定"是否值得继续";构建阶段用它决定"方案是否健壮、是否需要微调或 RAG 加固";运维化阶段它则成为监控与告警体系的核心看板指标。课程还推荐通过 Contoso Chat 演示应用体验一套结构化落地这些概念的完整应用。
继续学习
完成第 14 课后,自然的下一步是第 15 课:检索增强生成与向量数据库——理解 RAG 与向量数据库如何影响生成式 AI,并帮助构建更有吸引力的应用;RAG 正是生命周期"构建/增强"阶段五项指标(尤其是诚实性与成本)的核心杠杆。同时可以回看第 18 课微调中的完整微调作业,把"质量改进技术"清单中的另一项真正跑通。
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0623
Hy4-previewHy4 preview 是由腾讯混元团队研发的新一代混合专家(MoE)旗舰模型。模型总参数量 770B,每个 token 激活 49B,主干共包含78层,第一层采用标准 FFN,其余 77 层均为 MoE 结构,每层包含 256 个路由专家与 1 个共享专家,每个 token 激活 top-8 路由专家及共享专家。主干之外原生内置 1 层 MTP(总参数量 10B,激活 0.7B)以支持投机解码。Python00
GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。Jinja00
GLM-5.3-FlashGLM-5.3-Flash (320B-A18B),是GLM-5系列的首个原生多模态模型。320B总参数,能力超过GLM-5.2Jinja00
Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲,涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流,并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00
Spark-X2.5-1.7BSpark-X2.5-1.7B 旨在让强大的 AI 更加实用、高效且易于获取。这些模型在广泛的日常任务中表现出色,涵盖对话、写作、翻译、推理、编程、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00




