从随机微分方程视角吃透扩散模型:MIT 6.S184 课程内容、实验与自学路线全解析
MIT 6.S184(Generative AI with Stochastic Differential Equations)是 MIT CSAIL 在 IAP 小学期开设的扩散模型入门课程,本指南基于 cs-self-learning 仓库中的英文课程文档与中文课程文档整理而成。读完本文,你将清楚这门课的数学主线(扩散模型与流匹配的微分方程视角)、先修要求、三个动手实验的设置方式,以及它在本仓库"深度生成模型"学习路线中的定位,从而制定一条 20 小时左右的自学计划。
课程档案速览
以下是课程文档记录的完整基本信息,自学者可据此快速判断该课是否匹配自己的知识储备与时间安排:
| 项目 | 内容 |
|---|---|
| 所属机构 | MIT(麻省理工学院),由 MIT CSAIL 在 IAP 小学期开设 |
| 主讲人 | MIT 学生 Peter Holderrieth 与 Ezra Erives |
| 课程难度 | 四星(🌟🌟🌟🌟),属于中等偏上难度的进阶课 |
| 预计学习时长 | 20 小时 |
| 编程语言 | Python(基于 PyTorch) |
| 先修要求 | 深度学习基本概念 + 微积分与线性代数基础 |
| 实验形式 | 三个 Lab(详见课程网站) |
需要说明的是,该课程卡片在本仓库存在中英两个版本,内容与结构完全一致,可在 MIT6.S184.md 与 MIT6.S184.en.md 间切换阅读;仓库构建的多语言站点同样遵循这种"一份文档、双语发布"的组织方式。
这门课讲什么:以微分方程为纲的生成模型主线
课程名称中的 "Stochastic Differential Equations"(随机微分方程,SDE)已经点明了整门课最独特的视角:它不是按"模型家族"逐个罗列 VAE、GAN、扩散模型,而是把生成过程统一放进微分方程的框架里讲解。
根据课程文档的描述,该课程会从微分方程视角深入浅出地讲解扩散模型(Diffusion Model)和流匹配模型(Flow Matching)的数学理论基础。理解这条主线的关键背景是:现代扩散模型的前向过程可以被视为向数据逐步注入噪声的随机过程,其反向去噪过程则在数学上对应着一个可求解的逆随机过程;而流匹配等一类方法进一步把"加噪—去噪"的概率视角,转写为在时间轴上把噪声分布"推移"到数据分布的一条概率流(Probability Flow)或常微分方程轨迹。无论是离散时间步还是连续时间 SDE/ODE 的表述,最终都能落到可训练的"速度/分数"网络之上——这正是本仓库深度生成模型路线图中将其定位为"面向底层数学原理"入门课的原因。
与侧重工程或应用、绕开数学推导的课程不同,这门课强调的是把公式推导清楚。课程文档特别提示,配套讲义与笔记撰写质量极高("exceptionally well-written"),强烈建议逐字精读。对于想弄清楚"扩散模型为什么会 work""加噪—去噪背后的目标函数从哪里来"这类问题的学习者,这门课的推导密度正合适。
为什么它适合作为扩散模型的"第一门数学课"
课程文档给出了三个值得注意的定位信号:
- 出身于 MIT CSAIL 的 IAP 小学期。IAP(Independent Activities Period)是 MIT 每年 1 月开设的短期项目制教学时段,课程节奏紧凑、直奔主题,天然适合短时间集中突破(本课预估 20 小时即是对此的印证)。
- 讲者是 MIT 学生而非资深教授。Peter Holderrieth 与 Ezra Erives 均为 MIT CSAIL 学生,这意味着课程的推导节奏更贴近"刚学会不久的人重新讲一遍"的清晰度,对自学者的理解门槛通常更低。
- 理论与实践并重。课程文档明确提到配有 hands-on labs,让学生从零开始(from scratch)构建扩散模型——不是填框架、调 API,而是自己实现核心训练与采样环节,从而把前面的数学推导落到可运行代码上。
在同类课程中,这种"数学主线单一(SDE/ODE)+ 课时短 + 从零写代码"的组合比较少见:大多数扩散模型资料要么是纯论文阅读,要么直接跳到 Stable Diffusion 式的工程应用。本仓库的深度生成模型学习路线在推荐该课时也指出,它配有"简单的小实验让学生在实践中理解",是"适合对底层数学原理感兴趣的同学入门"的选择。
先修要求与自学前的知识准备
课程文档列出的先修要求为:
- 深度学习基本理解(Basic understanding of deep learning):知道神经网络如何训练、理解损失函数与梯度下降即可,不需要先修完整课程;
- 微积分与线性代数基础(comfortable with calculus and linear algebra):推导中会频繁使用积分、链式法则、矩阵运算与概率密度变换,建议数学基础扎实后再入手。
结合课程主题,笔者建议自学者在正式上课前补齐以下概念(这些并非课程虚构内容,而是其数学推导的基本构件):
| 主题 | 建议储备 | 仓库内可参考的前置课程 |
|---|---|---|
| 微积分 | 多元微分、链式法则、概率密度积分变换 | MIT 数学基础 |
| 线性代数 | 矩阵运算、特征值直觉 | MIT 18.06 |
| 概率论 | 高斯分布、KL 散度、条件概率 | UCB CS70、UCB CS126 |
| 深度学习基础 | 自动求导、CNN/MLP 训练流程 | 深度学习方向课程 |
从实现角度看,由于实验基于 Python + PyTorch,建议提前熟悉 PyTorch 的张量运算与 autograd 机制。若此前没有深度学习的动手经验,可先补完仓库深度学习板块中的一门基础课再进入 6.S184,体验会顺畅很多。
动手环节:三个从零构建扩散模型的实验
课程作业(Assignments)共包含 三个 Lab,这是课程文档明确给出的信息。结合"从零构建扩散模型"的课程描述,可以推断这三个实验的设计意图大概率遵循"先实现核心算法、再验证生成效果、最后做一定扩展"的递进路径,从代码侧把课堂数学"翻译"为可运行程序。
对自学者而言,做实验时有几点建议:
- 跟随讲义推导再写代码:实验价值在于把"每个公式的每一项"对应到具体张量运算,跳过推导直接抄实现会损失大半收益;
- 善用可视化调试:扩散模型训练中,观察不同时间步去噪采样的中间结果能快速定位训练是否收敛、噪声调度是否合理;
- 控制算力预期:图像类扩散实验在 CPU 上亦可完成小规模验证,但如需完整训练,建议准备带 CUDA 的 GPU 环境(仓库其他课程如 CMU 11-868 的自学建议同样提示了提前配置 GPU 环境的必要性)。
由于课程文档明确说明"实验细节参见课程网站",且本仓库无法承载其作业文件的原始分发,具体 Lab 的题目与脚手架代码请以课程官网为准(原文链接保留在仓库课程文档中)。
配套教材讲义:值得精读的延伸材料
课程文档单独强调了两类配套资源:
- 课程讲义(lecture notes):文档原话评价为"exceptionally well-written,强烈推荐深入阅读"——这基本是仓库作者给予的最高评价之一,是自学时最重要的第一手资料;
- 课程教材:文档登记了与课程同源的综述性教材 An Introduction to Flow Matching and Diffusion Models,这篇教材与课程主线(流匹配 + 扩散模型)一一对应,适合在听课后按章节精读,作为连接课堂推导与科研文献的桥梁。
建议的自学节奏是:先读讲义对应章节 → 动手写 Lab → 用教材复盘推导,三个环节循环推进。20 小时的预估学时如果只够覆盖一种学法,优先保证讲义精读与实验代码齐头并进。
应用前沿:从分子设计到机器人学的延伸讲座
课程的收尾环节安排了应用导向的讲座,课程文档记录的覆盖领域包括分子设计(molecular design)与机器人学(robotics)。这两类应用恰好体现了生成模型在"连续数据"上的通用性:
- 分子设计:扩散模型天然适合在连续空间(如原子坐标、化学键的连续表示)上生成稳定结构,是近年来计算化学领域活跃的方向之一;
- 机器人学:流匹配 / 扩散策略(diffusion policy)一类方法把"从观测生成动作轨迹"建模为条件生成问题,已成为机器人学习中的热门范式。
对以科研或工业落地为目标的自学者,这些讲座提供了"学完数学之后它能用来做什么"的现实映射,也可作为选题灵感的来源。需要说明的是,课程文档仅给出了讲座主题领域,未披露具体案例细节,深入内容请以课程官网录像为准。
课程资源获取方式
- 课程网站:官网发布讲义、视频与作业入口;
- 课程视频:随课程网站提供;
- 课程教材:An Introduction to Flow Matching and Diffusion Models;
- 课程作业:三个 Lab,详见课程网站。
本仓库课程卡片中保留了上述资源的原始外链,读者在仓库内打开对应文档即可获取。若希望顺手给后续学习者做贡献,也可参照仓库中维护者使用的课程模板(及其 英文版)格式补充自己的学习笔记与作业仓库链接。
在仓库学习路线中的位置与进阶方向
本仓库将 6.S184 编排在 深度生成模型/学习路线图(英文版)之下。该路线图给出了两条主线:
- 扩散 / 流 / 生成模型主线:以 6.S184 为数学入门,路线图中同期推荐了 MIT 6.S978(Deep Generative Models,覆盖 VAE/GAN/Diffusion 等全景理论)与 UCB CS294-158 等课程作为更全面的后续;
- 大语言模型主线:如果重心在 LLM,路线图建议转向仓库内 大语言模型 子目录下的系统课程,如 CMU 11-868: Large Language Model Systems、CMU 11-667 等。
路线图作者也坦承"很多课程的实验并未完成,之后会陆续补充",因此自学 6.S184 的同学不妨把实验笔记沉淀下来,作为对仓库社区的回馈。此外,若想在生成模型理论方向继续深造,仓库机器学习进阶板块中还收录了 Columbia STAT 8201(Deep Generative Models)等课程,可作为 6.S184 之后的进阶衔接。
一句话总结
MIT 6.S184 是一门口径罕见的短课时数学入门课:用随机微分方程与流匹配的统一视角把扩散模型讲透,配合从零手写实现与分子设计、机器人学的前沿应用讲座,总投入约 20 小时。它适合那些"已经会用扩散模型、但想知道数学上为什么成立"的学习者,也适合作为进入生成模型科研领域的起点。
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0627
Hy4-previewHy4 preview 是由腾讯混元团队研发的新一代混合专家(MoE)旗舰模型。模型总参数量 770B,每个 token 激活 49B,主干共包含78层,第一层采用标准 FFN,其余 77 层均为 MoE 结构,每层包含 256 个路由专家与 1 个共享专家,每个 token 激活 top-8 路由专家及共享专家。主干之外原生内置 1 层 MTP(总参数量 10B,激活 0.7B)以支持投机解码。Python00
GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。Jinja00
GLM-5.3-FlashGLM-5.3-Flash (320B-A18B),是GLM-5系列的首个原生多模态模型。320B总参数,能力超过GLM-5.2Jinja00
Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲,涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流,并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00
Spark-X2.5-1.7BSpark-X2.5-1.7B 旨在让强大的 AI 更加实用、高效且易于获取。这些模型在广泛的日常任务中表现出色,涵盖对话、写作、翻译、推理、编程、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00