ML-For-Beginners 课程精讲(二):从图灵测试到大模型时代——机器学习与人工智能的完整发展史
本课是 ML-For-Beginners 课程 1-Introduction(机器学习导论) 模块的第 2 讲,对应的原文课件位于 1-Introduction/2-history-of-ML/README.md。课程将用一条清晰的时间线带你走完机器学习(Machine Learning, ML)与人工智能(Artificial Intelligence, AI)从思想萌芽到当代繁荣的关键里程碑,让你理解"智能机器"这一想法如何被提出、经历狂热与寒冬,最终沉淀为一门可复现、可工程化的学科。读完本课,你将掌握 ML 历史上最重要的算法与事件脉络,并能将贝叶斯定理、最小二乘法、马尔可夫链、感知机、K 近邻、反向传播、循环神经网络等概念对号入座——这些概念在本课程后续的回归、分类、NLP 等模块中还会逐一出现。
一门"年轻的学科"与它古老的思想源头
机器学习与人工智能作为独立的研究领域,大约始于 20 世纪 50 年代;但课程开篇就提醒我们一个容易被忽略的事实:推动 ML 发展的算法、统计、数学、计算与技术发现,很多都早于并重叠于这个时代。人类对"机器能否思考"这类问题的思辨,其实已经延续了数百年。理解这段思想史,是理解今天一切机器学习技术的前提——这正是本课存在的意义。
课程的完整脉络可借助社区绘制的课程手绘总结图快速把握(该图亦收录于仓库根目录的 sketchnotes 中):
手绘草图(sketchnote)由 Tomomi Imura 绘制,作为本课的可视化辅助材料存放于仓库 sketchnotes 目录,适合在阅读正文前先建立整体印象。
值得铭记的里程碑式发现(Notable Discoveries)
课程的"显著发现"清单按时间顺序梳理了构成现代 ML 地基的七项重要成果。它们中的大部分都会在本课程后续模块中被亲手实现,因此值得逐一认真理解:
- 1763 / 1812:贝叶斯定理(Bayes' Theorem)及其前驱工作 该定理及其应用是"推断"(inference)的基石,它描述的是:基于先验知识,某个事件发生的概率是多少。今天分类器中的朴素贝叶斯、垃圾邮件过滤等,都可以追溯到这条思想主线。
- 1805:最小二乘理论(Least Squares Theory) 由法国数学家阿德里安-马里·勒让德(Adrien-Marie Legendre)提出。这套理论帮助科学家在数据拟合时找到最优直线。课程在回归模块中会实际落地它:本仓库的 2-Regression/3-Linear 单元 所实现的"最小二乘回归"(Least-Squares Regression),其目标正是让回归线周围所有数据点误差的平方和尽可能小——名字里的 "least squares" 就来源于此。
- 1913:马尔可夫链(Markov Chains) 以俄国数学家安德烈·马尔可夫命名,用于依据"上一状态"描述一串可能事件的序列。它是现代概率图模型、语言建模与强化学习中"状态转移"思想的直接祖先。
- 1957:感知机(Perceptron) 由美国心理学家弗兰克·罗森布拉特(Frank Rosenblatt)发明,是一种线性分类器,也是后来深度学习突破的基础构件。从结构上看,它由多个输入加权求和后经激活函数输出,是"神经元"的最朴素形态。
- 1967:最近邻算法(Nearest Neighbor) 这个算法最初是为地图路径规划而设计,进入 ML 语境后成为模式识别工具。它的思想直白而强大:看新样本离谁最近,就把它归到哪一类。本课程的分类模块(如 4-Classification/2-Classifiers-1/README.md 中介绍的多分类器对比)就包含基于近邻思想的 KNeighbors 分类器。
- 1970:反向传播(Backpropagation) 用于训练前馈神经网络(Feedforward Neural Network)。它通过链式法则把输出误差逐层反向传导,从而更新每一层权重——今天神经网络训练的基石算法。
- 1982:循环神经网络(Recurrent Neural Networks, RNN) 由前馈神经网络衍生而来的人工神经网络,关键创新是引入了"时间维度",网络会"记得"过去的状态,从而可以处理序列数据。
✅ 思考题(原课内互动):做一点你自己的调研——除了上述年份,还有哪些日期在 ML 与 AI 的发展史上同样举足轻重?试着把它加入你的个人时间轴。
1950:会思考的机器(Machines that Think)
艾伦·图灵(Alan Turing)是一位真正非凡的人物,2019 年他在公众票选中被评为"20 世纪最伟大的科学家"。他帮助奠定了"会思考的机器"这一概念的基础。面对怀疑者、以及自己对于"经验证据"的坚持,他设计出了著名的图灵测试(Turing Test):如果通过文字通信,人类无法分辨对话的另一端究竟是真人还是机器,那么这台机器是否可以说"在思考"?
图灵测试的意义远超一次实验设计,它把"机器是否拥有智能"从一个哲学问题,变成了一个可以操作、可以检验的工程问题。本课程在自然语言处理模块中会再次回到图灵与图灵测试——参见 6-NLP/1-Introduction-to-NLP/README.md 中 "Talking to machines" 一节,那里还介绍了图灵灵感来源的"模仿游戏"(The Imitation Game)。
1956:达特茅斯夏季研究计划(Dartmouth Summer Research Project)
"学习过程的每个方面、或智能的任何其他特征,原则上都可以被精确地描述到足以让机器去模拟它。"
这句被课程引用的名言,正是 1956 年达特茅斯夏季人工智能研究计划的宣言,而"人工智能(Artificial Intelligence)"这个术语也正是在这次会议上首次被提出,被视为 AI 作为独立领域的标志性事件。
会议牵头人是数学教授约翰·麦卡锡(John McCarthy),他希望"在该猜想之上继续推进研究";与会者还包括该领域另一位巨星——马文·明斯基(Marvin Minsky)。这次研讨会直接催生并鼓励了多场重要讨论,其中包括:符号方法(symbolic methods)的兴起、面向受限领域的系统(即早期专家系统)、以及演绎系统与归纳系统之争。可以说,今天深度学习的"连接主义"路线与当年兴起的"符号主义"路线的分野,都能从这里找到源头。
1956–1974:"黄金年代"(The Golden Years)
从 20 世纪 50 年代到 70 年代中期,乐观情绪高涨,人们相信 AI 能解决许多问题。1967 年,明斯基信心满满地断言:"在一代人的时间内……'创造人工智能'的问题将被实质性解决。"(出自 Minsky, Marvin (1967), Computation: Finite and Infinite Machines, Prentice-Hall)
这一时期,自然语言处理(NLP)研究蓬勃发展,搜索(search)技术被不断打磨、变得更强大;研究者还创造了"微型世界(micro-worlds)"的概念——用日常语言下达指令即可完成简单任务。政府机构提供了充足的科研经费,计算与算法均有长足进步,一批"智能机器"原型机被建造出来,其中最著名的包括:
Shakey 机器人:会"思考"着行动
Shakey(1972 年)。它能自主移动,并"智能地"决定如何一步步完成任务——是早期把感知、规划与行动整合到一台实体机器上的代表。
ELIZA:最早的"聊天机器人"
ELIZA 的一个运行版本。它能与人对话,扮演一名初级"心理治疗师",尽管它并不真正"理解"语义。
ELIZA 由 MIT 科学家约瑟夫·维森鲍姆(Joseph Weizenbaum)在 20 世纪 60 年代开发,会通过识别句子中的关键词与语法结构拼装出看似合理的回答。例如当你输入 "I am sad",它可能改写为 "How long have you been sad?"。本课程的 NLP 模块 6-NLP/1-Introduction-to-NLP/README.md 详细拆解了 ELIZA 的这种"规则 + 句式改写"机制,并指出它很容易被愚弄——正如课程中那个著名的例子:输入 "You are a bicycle",ELIZA 也会一本正经地反问。
"积木世界"与 SHRDLU:微型世界范例
"积木世界(Blocks World)"是一个典型微型世界:积木可以被堆叠、排序,研究者在此测试"教机器做决策"的各种实验。建立在 SHRDLU 等库之上的进展,极大地推动了语言处理的发展。需要指出的是,ELIZA 与 SHRDLU 后来都被归类为典型的"邋遢派"(scruffy)系统——见下文"AI 寒冬"一节的讨论。
1974–1980:AI 寒冬(AI Winter)
到 70 年代中期,现实给狂热浇了一盆冷水:人们发现,"制造智能机器"的复杂度被严重低估了,而在当时可用的算力条件下,此前的承诺被明显夸大。资金枯竭,信心受挫。课程总结了四个关键问题:
- 算力受限:当时的计算能力过于有限,不足以支撑雄心勃勃的智能系统。
- 组合爆炸:随着对计算机提出的要求越来越高,需要训练的参数数量呈指数级增长,而算力与能力却没有同步进化。
- 数据匮乏:可用于测试、开发与改进算法的数据严重不足,拖慢了整个研究进程。
- 我们问对问题了吗?:研究者开始受到来自方法论层面的批评——
- 图灵测试受到质疑,其中一种代表性思想是"中文房间"(Chinese Room)理论:它认为"编程一台数字计算机也许能让它看起来理解了语言,但无法产生真正的理解"。
- 把 ELIZA 这类"AI 治疗师"引入社会的伦理问题也开始被公开挑战。
也正是在这一时期,AI 内部逐渐分化出不同的思想流派,形成了著名的"邋遢派 vs 整洁派"(scruffy vs. neat AI)之分:邋遢派实验室花数小时不断"调参打补丁",直到程序跑出期望结果;整洁派实验室则"聚焦于逻辑与形式化问题求解"。ELIZA 和 SHRDLU 是广为人知的邋遢派系统。进入 80 年代后,随着业界对"可复现的 ML 系统"需求的出现,整洁派逐渐占据上风——因为它的结果更具可解释性。
这条"可解释性之争"的线索在今天的可解释 AI(XAI)讨论中依然回响,也与本课程 1-Introduction/3-fairness(公平性与机器学习) 关注的责任、可解释与公平议题一脉相承。
1980 年代:专家系统(Expert Systems)
随着领域不断成熟,它对商业的价值越来越清晰,80 年代迎来了"专家系统"的繁荣——它们"是首批真正取得成功的 AI 软件形态之一"。
专家系统本质上是一种混合系统(hybrid),由两部分组成:
- 规则引擎(rules engine):承载业务规则、定义业务需求;
- 推理引擎(inference engine):利用这套规则系统,演绎推导出新的"事实"。
这种"知识 + 推理"的架构,正是"符号主义"AI 在产业界的代表作。同一时期,学术界对神经网络的关注度也在持续升温,为下一次复兴积蓄力量。
1987–1993:AI 的"退潮期"(AI 'Chill')
专家系统的专用硬件大规模扩散,但副作用是过度专业化:设备昂贵、封闭、难以扩展。与此同时,个人计算机(PC)的崛起开始与这些大型、专用、集中式的系统正面竞争。计算由此走向民主化(democratization of computing)——而这场民主化浪潮,最终为现代大数据时代的爆发铺平了道路。
1993–2011:数据与算力的新纪元
这一时期,ML 与 AI 终于有能力解决早年因"缺数据、缺算力"而被搁置的问题:
- 数据:数据量开始迅速增长并变得广泛可得(其中 2007 年前后智能手机的普及是关键推手)——这既带来机遇,也带来新的风险;
- 算力:计算能力指数级扩张;
- 算法:与算力同步演进。
宽松随性的"草莽时代"开始沉淀为真正的学科规范,ML 与 AI 走向成熟。
现在:机器学习无处不在的时代
如今,机器学习与 AI 几乎触及我们生活的每一个角落。课程提醒我们,这个时代要求人们审慎理解这些算法对人类生活带来的风险与潜在影响。正如微软的布拉德·史密斯(Brad Smith)所言:
"信息技术提出了直指隐私、言论自由等基本人权保护核心的问题。这些问题加重了制造这些产品的科技公司的责任。在我们看来,它们也呼唤审慎的政府监管,以及围绕'可接受的用途'建立规范。"
未来会走向何方仍未可知,但理解这些计算机系统、以及它们所运行的软件与算法,比以往任何时候都更重要。这正是本课程(ML-For-Beginners)想帮你建立的能力——读完本课后,结合 1-Introduction/1-intro-to-ML(机器学习导论) 与 1-Introduction/4-techniques-of-ML(机器学习技术),你将有能力独立判断这些算法到底是什么、能用在哪里、又该警惕什么。
把历史节点接到课程地图上
本课最有价值的一点,在于它埋下了贯穿整份课程大纲的伏笔。下表把"历史里程碑"与本仓库中实际讲授、动手实现这些概念的课程单元对应起来,方便你在后续学习中"按图索骥":
| 历史里程碑 | 课程后续落点(仓库内路径) |
|---|---|
| 最小二乘法(1805) | 2-Regression/3-Linear(线性回归与最小二乘) |
| 最近邻 / 近邻分类(1967) | 4-Classification/2-Classifiers-1(分类器家族,含 KNeighbors) |
| 图灵测试、ELIZA、NLP 思想(1950s–1960s) | 6-NLP/1-Introduction-to-NLP(自然语言处理导论) |
| 反向传播、神经网络(1970s 起) | 贯穿分类模块的多种 MLP/神经网络模型,可参考 4-Classification 单元 |
| 马尔可夫链 / 状态转移(1913) | 强化学习中的状态-动作框架,可参考 8-Reinforcement/1-QLearning |
| 数据爆炸与可复现实验(1993–2011) | 回归模块的完整数据管道实践,如 2-Regression/2-Data |
延伸学习:深度学习史与 AI 演化纵览
课程在"Review & Self Study(复习与自学)"环节给出了两份高质量延伸资料,建议配合本课时间线食用:
- 深度学习的历史:由 Yann LeCun(杨立昆)主讲的讲座式视频,系统梳理了从感知机到现代深度学习的演进脉络——听完之后,你会对"黄金年代"里的感知机如何一步步演化为今天的大规模神经网络有直观感受。
- AI 的演化:Amy Boyd 主讲的播客与同名视频,从更宏观的社会与技术视角回顾 AI 的演化历程,与本课正文互为补充。
课后挑战(🚀 Challenge)
深入上面提到的某一个历史时刻,去了解它背后的人与故事。课程原话提醒我们:没有任何一项科学发现是在文化真空中产生的——背后是一个个鲜活、有趣、复杂的灵魂。例如:图灵与他的时代、麦卡锡与达特茅斯的筹办、维森鲍姆晚年对自己创造的 ELIZA 的反思。你发现了什么?
如何检验学习效果
- 课前测验(Pre-lecture quiz):阅读本课正文前先作答,用于激活已有认知;
- 课后测验(Post-lecture quiz):学完后作答,检验是否掌握了时间线与关键概念;
- 作业(Assignment):本课的实践作业是"制作一条时间轴(Create a timeline)"——利用 timeline-builder 工具,围绕算法、数学、统计、AI 或 ML 的历史(可聚焦一个人、一个思想,或跨越很长的时间段)制作一条含多媒体元素的时间轴,并以 GitHub Pages 形式部署。评分标准(Rubric)要求:优秀 = 已部署且可访问的时间轴页面;合格 = 代码不完整或未部署;待改进 = 时间轴不完整、研究不充分且未部署。
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0624
Hy4-previewHy4 preview 是由腾讯混元团队研发的新一代混合专家(MoE)旗舰模型。模型总参数量 770B,每个 token 激活 49B,主干共包含78层,第一层采用标准 FFN,其余 77 层均为 MoE 结构,每层包含 256 个路由专家与 1 个共享专家,每个 token 激活 top-8 路由专家及共享专家。主干之外原生内置 1 层 MTP(总参数量 10B,激活 0.7B)以支持投机解码。Python00
GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。Jinja00
GLM-5.3-FlashGLM-5.3-Flash (320B-A18B),是GLM-5系列的首个原生多模态模型。320B总参数,能力超过GLM-5.2Jinja00
Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲,涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流,并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00
Spark-X2.5-1.7BSpark-X2.5-1.7B 旨在让强大的 AI 更加实用、高效且易于获取。这些模型在广泛的日常任务中表现出色,涵盖对话、写作、翻译、推理、编程、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00


