CMU 11-667《Large Language Models: Methods and Applications》自学指南:从基础架构到对齐、优化与安全
本文收录于 CS 自学指南(cs-self-learning)的深度生成模型 · 大语言模型学习板块,为 CMU 11-667「Large Language Models: Methods and Applications」课程编写系统化的自学指引。本文以该课程的官方资料为骨架,说明其在大语言模型学习路线中的定位、四大教学内容模块、六次编程作业的训练目标与自学方法,帮助你判断这门研究生课程是否适合自己,并规划出可落地的学习路径。
课程概览与学习定位
CMU 11-667(官方课程主页为 cmu-llms.org)是卡内基梅隆大学开设的一门研究生层次课程,系统性地覆盖大型语言模型(LLM)的方法与应用,横跨核心架构与最前沿的研究技术。课程基本信息如下:
| 项目 | 内容 |
|---|---|
| 所属大学 | Carnegie Mellon University(CMU) |
| 先修要求 | 机器学习基础(相当于 CMU 10-301 / 10-601)+ 自然语言处理基础(相当于 CMU 11-411 / 11-611);熟练掌握 Python,熟悉 PyTorch 或同类深度学习框架 |
| 编程语言 | Python |
| 课程难度 | ★★★★ |
| 预计学时 | 100 小时以上 |
从学习内容取向上看,这门课属于「偏上层算法与应用」的 LLM 课程。在本仓库的深度生成模型学习路线中,作者将它与 CMU 11-711 Advanced NLP 归为一类,并明确指出:与之相对,CMU 11-868(Large Language Model Systems)与 CMU 15-779(ML Systems,LLM 版)更侧重底层系统优化(GPU 加速、分布式训练与推理),而 Stanford CS336 则聚焦于从零手写 LLM 全部核心组件(Tokenizer、架构、优化器、算子、数据清洗、后训练等)。
因此可以这样理解课程分工:如果你想对 LLM 发展前沿的各个方向建立整体认知,再针对某个子领域深入研究,那么 11-667 是合适的第一站;如果你关注的是系统与性能优化、底层算子与分布式执行,则应优先考虑 11-868 与 15-779。两条路径互为补充,共同构成了本仓库大语言模型目录下的完整课程矩阵,课程页面已配置于 mkdocs.yml 的站点导航中,便于逐门浏览与交叉引用。
四大教学内容模块
根据课程官方说明,11-667 的教学内容覆盖从基础架构到前沿方法的完整谱系,大致划分为以下四个主题模块:
-
基础(Foundations):面向语言建模的神经网络架构、训练流程(training procedures)、推理(inference)以及评估指标(evaluation metrics)。这一模块是后续所有主题的地基,要求学习者对语言模型从数据到损失函数、从前向到解码的完整链路有扎实理解。
-
进阶主题(Advanced Topics):模型可解释性(interpretability)、对齐方法(alignment methods)、涌现能力(emergent capabilities),以及 LLM 在纯文本任务之外的广泛应用(非文本领域,如多模态相关方向)。这一模块紧跟研究前沿,帮助学习者建立「模型能力边界与如何驾驭这种能力」的判断力。
-
系统与优化技术(System & Optimization Techniques):大规模预训练策略(large-scale pretraining strategies)、部署优化(deployment optimization),以及高效的训练与推理方法(efficient training/inference methods)。这一模块让算法学习者理解现实世界中 LLM 的工程代价,为走向工业级系统开发做准备。
-
伦理与安全(Ethics & Safety):模型偏见(model bias)、对抗攻击(adversarial attacks)与法律/监管层面的问题(legal/regulatory concerns)。这一模块将模型置于真实社会的约束下讨论,是研究型与工程型学习者都不应跳过的一环。
从仓库内11-667 中文版课程页的表述可以确认,该课程采用讲座(lectures)、阅读材料(readings)、小测验(quizzes)、互动活动、作业(assignments)与期末项目(final project)相结合的教学方式,目标是同时为「进一步的研究」与「真实世界的系统开发」打下基础——这解释了为何四大模块既包含理论深度,也包含系统与工程实操。
课程运行方式与结课要求
课程综合了多种教学环节,自学时可以据此模拟课堂节奏:
- 讲座(Lectures):课程主干。网站提供部分讲座幻灯片与材料,完整讲座录像可能需要 CMU 校内账号访问,校外学习者主要依靠幻灯片、讲义与配套阅读材料跟进进度。
- 阅读材料(Readings):课程配有经过筛选的研究论文与补充资料,完整阅读列表以官方课程主页为准。这一设计与课程「每节课都列举大量相关阅读材料」的特点一致,是拓宽视野的主要途径。
- 小测验与互动(Quizzes & Interactive Exercises):用于即时检验每讲的掌握程度。
- 编程作业(Assignments):共六次,是动手能力训练的核心载体。
- 期末项目(Final Project):综合运用课程所学,独立完成一个有深度的实践或研究课题。
六次编程作业:由「实现」到「改进」的动手主线
作业详情见官方 assignments 页面,按课程说明可归纳为以下五大主题(共六次作业):
- 预训练数据准备(data preparation):处理真实语料、构建 tokenizer 或数据管线,理解「高质量数据从何而来」,这是从零训练任何模型的第一步。
- Transformer 实现(Transformer implementation):手动实现 Transformer 的关键组件(自注意力、位置编码等),把讲座中的架构知识落成可运行的代码。
- 检索增强生成(retrieval-augmented generation,RAG):在生成模型外部挂接检索模块,缓解知识陈旧与幻觉问题,掌握当前生产环境中应用最广的 LLM 范式之一。
- 模型评估与去偏(model evaluation and debiasing):设计/运行评估基准来衡量模型能力与偏见,并实践偏见缓解手段,呼应「伦理与安全」模块。
- 训练效率提升(training efficiency):从工程角度优化训练过程(如更高效的数据加载、显存/算力利用),与「系统与优化技术」模块对应。
这组作业的价值在于:它不是孤立的算法练习,而是沿着「数据 → 架构 → 应用范式 → 评估对齐 → 工程效率」的完整链路逐一打通,与讲座模块一一呼应。建议自学时把每次作业当作一个 mini 项目完成,而不是只看参考答案。
先修要求与前置能力自检
在投入 100+ 学时之前,请先对照先修要求做能力自检:
- 机器学习:需要具备相当于 CMU 10-301 / 10-601 的扎实基础,能理解损失函数、优化器、过拟合与正则化、常见网络结构等核心概念,而非仅会调用框架 API。
- 自然语言处理:需要相当于 CMU 11-411 / 11-611 的基础,包括词表征、序列建模、注意力机制等。如果尚未接触 NLP,建议先修读本仓库收录的 CMU 11-711 Advanced NLP 建立基础。
- 工程能力:熟练使用 Python,并熟悉 PyTorch 或同类深度学习框架——四次动手模块(作业)和期末项目都建立在框架实操之上。
仓库路线图同时提示:11-667 与 11-711 更偏重上层算法和应用,每讲都配有大量阅读材料,适合对 LLM 发展前沿的各个方向先建立「粗糙而完整」的认识,再循着参考资料深入感兴趣的子领域。换句话说,它不适合作为零基础入门课,而是为已有 ML/NLP 背景、希望系统化认识 LLM 全貌的学习者设计的「地图式」课程。
自学建议(官方 + 路线图交叉验证)
课程官方给出的自学建议聚焦三条纪律:
- 开课前读完材料:认真阅读每次课前指定的论文和材料,带着问题听讲,效果远好于课后补读。
- 亲手实现:熟悉 PyTorch 等框架,手动实现核心模型与算法,而不是停留在阅读层面。语言模型领域的大量直觉来自调试代码的过程。
- 扎实完成作业:认真完成课程作业以建立实践技能,并反哺对理论的理解。
结合本仓库深度生成模型学习路线的定位,补充两点自学策略:
- 先修、并行还是后置:如果你的目标是系统/性能方向(训练框架、推理加速),可跳过本课直接进入 CMU 15-779 或 CMU 11-868;如果你希望先建立 LLM 应用的完整认知,本课与 CMU 11-711 是更好的起步组合。
- 以读带学、以学促研:把每讲的阅读列表当作一个子领域的迷你调研,读完若对某方向产生兴趣,再顺藤摸瓜深挖该方向的论文与开源实现——这正是「地图式」课程的正确打开方式。
结语
CMU 11-667 是一门「广度优先、实践闭环」的研究生级 LLM 课程:四大模块覆盖架构基础、前沿方法、系统优化与安全伦理,六次编程作业沿「数据 → 实现 → RAG → 评估对齐 → 效率」逐级训练动手能力。对具备 ML/NLP 基础、希望系统化认识大语言模型方法与应用全貌的自学者而言,它是一份高性价比的学习蓝图。可结合本仓库中文课程页、学习路线及其姊妹课程(11-711、11-868、15-779)规划出适合自己的完整 LLM 学习路径。
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0624
Hy4-previewHy4 preview 是由腾讯混元团队研发的新一代混合专家(MoE)旗舰模型。模型总参数量 770B,每个 token 激活 49B,主干共包含78层,第一层采用标准 FFN,其余 77 层均为 MoE 结构,每层包含 256 个路由专家与 1 个共享专家,每个 token 激活 top-8 路由专家及共享专家。主干之外原生内置 1 层 MTP(总参数量 10B,激活 0.7B)以支持投机解码。Python00
GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。Jinja00
GLM-5.3-FlashGLM-5.3-Flash (320B-A18B),是GLM-5系列的首个原生多模态模型。320B总参数,能力超过GLM-5.2Jinja00
Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲,涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流,并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00
Spark-X2.5-1.7BSpark-X2.5-1.7B 旨在让强大的 AI 更加实用、高效且易于获取。这些模型在广泛的日常任务中表现出色,涵盖对话、写作、翻译、推理、编程、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00