从图灵测试到 AI 寒冬:ML-For-Beginners 机器学习史课中的完整技术时间线
本文基于 ML-For-Beginners 课程(12 周、26 课、52 道测验的经典机器学习教程)第 1 周第 2 课《History of Machine Learning》,完整梳理机器学习与人工智能发展史上的关键里程碑:从 1763 年的贝叶斯定理到 2011 年后的数据与算力爆发。读完后,你不仅能掌握一张从“可计算性”到“深度学习”的技术演进时间线,还能理解每个历史节点与本课程后续单元(回归、NLP、聚类)之间的具体呼应关系,并知道如何用时间线项目完成本课作业。
手绘笔记(Sketchnote)作者为 Tomomi Imura,原文档 1-Introduction/2-history-of-ML/README.md 以该图作为全课视觉摘要;本文研究的指定文档为其阿拉伯语译文 translations/ar/1-Introduction/2-history-of-ML/README.md。
本课在课程体系中的位置
从仓库侧边栏 docs/_sidebar.md 可以看到,《History of Machine Learning》紧随第 1 单元 Introduction 的开篇课《Introduction to Machine Learning》之后,位于第 2 课的位置。课程采用“课前测验 + 课时 + 课后测验 + 作业”的固定节奏(仓库内 quiz-app/ 目录提供了配套测验应用的实现),这一课的任务是建立历史坐标,为后续所有算法单元做铺垫。
值得注意的是,指定文档是该课程的阿拉伯语官方译文(位于 translations/ar/ 目录下),其末尾附有机器翻译免责声明,说明原英文文档才是权威来源;翻译图片资源则集中存放在 translated_images/ar/ 目录中。这一结构本身也是该仓库多语言课程体系的典型组织方式。
AI 与 ML 历史的交织
原文档开篇指出:人工智能(AI)作为一个领域,其历史与机器学习(ML)的历史深度交织——支撑 ML 的算法与计算进展反过来推动了 AI 的发展。
有两个前提需要记住:
- 虽然这两个领域在 1950 年代才逐渐从研究角度独立成形,但大量算法、统计、数学、计算与技术上的重要发现早于或横跨了这一时期,机器学习时间线远比“AI 元年”要长。
- 人类对“机器能否思考”的思考已经持续了数百年。原文档将其定位为“思考的机器”(thinking machine)这一思想的历史脉络课,而不只是工具史。
关键发现:七个改变走向的数学与算法节点
原文档列出了一份“Notable discoveries”清单。以下按时间顺序完整继承,并补充了它们在课程中的落点:
| 年份 | 发现 | 提出者 | 核心作用 | 课程中的呼应 |
|---|---|---|---|---|
| 1763、1812 | 贝叶斯定理(Bayes' Theorem)及其前身 | Thomas Bayes 等人 | 以先验知识描述事件发生概率,是概率推理(inference)的基石 | 分类与概率模型的思想源头 |
| 1805 | 最小二乘法(Least Square Theory) | 法国数学家 Adrien-Marie Legendre | 帮助数据拟合(data fitting) | 原文档明确提示:“you will learn about in our Regression unit” |
| 1913 | 马尔可夫链(Markov Chains) | 俄国数学家 Andrey Markov | 基于前一状态描述事件序列的可能性 | 时序建模与文本生成的经典基础 |
| 1957 | 感知机(Perceptron) | 美国心理学家 Frank Rosenblatt | 一种线性分类器,构成深度学习进展的基础 | 分类单元的算法原型 |
| 1967 | 最近邻(Nearest Neighbor) | —(最初为路径规划而设计) | 在 ML 语境下用于模式识别 | 聚类单元的距离度量思想 |
| 1970 | 反向传播(Backpropagation) | — | 用于训练前馈神经网络 | 深度学习的训练机制 |
| 1982 | 循环神经网络(Recurrent Neural Networks) | — | 由前馈神经网络衍生、可构建时间图的神经网络 | 时序课程的思想前身 |
原文档还留了一个研究性思考题:“✅ Do a little research. What other dates stand out as pivotal in the history of ML and AI?”——即让学习者主动补充其他关键年份(如 1950 年的《计算机器人与智能》论文、1997 年深蓝等),这也是理解该课程“引导式学习”设计的一个细节。
最小二乘法与回归单元的呼应
原文档提到 Legendre 的最小二乘理论“会在回归单元中再学”。从仓库内容可以印证这一点:回归单元第 3 课 2-Regression/3-Linear/README.md 系统讲解了最小二乘法的数学——目标是为数据找到一条“最佳拟合线”(line of best fit),其方程为 Y = a + bX(b 为斜率,a 为 X=0 处的截距),并围绕南瓜价格数据集(2-Regression/data/US-pumpkins.csv)用 Scikit-learn 实现。也就是说,1805 年的数学工具在课程第 2 周就化为了可运行的代码。
1950:会思考的机器
Alan Turing——2019 年由公众投票评选为“20 世纪最伟大科学家”的人物——为“可思考机器”(machine that can think)这一概念奠定了基础。
面对质疑者以及他自己对实证证据的需求,Turing 部分地通过创造**图灵测试(Turing Test)**来回应:如果一段对话后,人类无法判断对话对象是人还是机器,那么这台机器能否被说成是“在思考”?
原文档明确指出,图灵测试将在课程的 NLP 单元中被重新展开。这一点在 6-NLP/1-Introduction-to-NLP/README.md 中得到完整印证:NLP 开篇课专门有一节 “The 'Turing test'”,并追溯其灵感来源——一种名为 “The Imitation Game” 的聚会游戏(询问者通过书面问答判断两个房间中的性别),这正是图灵测试“书面通信对话”形式的原型。
1956:达特茅斯夏季研究项目
原文档引用了达特茅斯官方表述:“The Dartmouth Summer Research Project on artificial intelligence was a seminal event for artificial intelligence as a field.” 正是在这次项目上,“artificial intelligence”(人工智能)一词被首次提出。
项目发起人、数学教授 John McCarthy 的核心假设被原文档完整引用:
Every aspect of learning or any other feature of intelligence can in principle be so precisely described that a machine can be made to simulate it. (学习或智能的任何其他特征,原则上都可以被足够精确地描述,使得可以制造出机器来模拟它。)
参与者中包括另一位领域巨匠 Marvin Minsky。这场研讨会还被认为开启并推动了多条后续讨论线索:
- 符号方法(symbolic methods)的兴起;
- 聚焦有限领域(limited domains)的系统——即早期专家系统;
- 演绎系统(deductive systems)与归纳系统(inductive systems)之争。
1956–1974:“黄金时代”
从 1950 年代到 1970 年代中期,乐观情绪空前高涨,AI 有望解决大量问题的信念主导着学界。原文档引用了 Marvin Minsky 1967 年著作 Computation: Finite and Infinite Machines 中的自信断言:
"Within a generation ... the problem of creating 'artificial intelligence' will substantially be solved." (在一个世代之内……创造“人工智能”的问题将基本得到解决。)
这一时期的具体进展包括:
- 自然语言处理研究繁荣,搜索(search)技术被不断精炼并变得更强大;
- “微型世界”(micro-worlds)概念诞生:用朴素语言指令完成简单任务的受限实验环境。
政府机构提供了充裕的研究经费,计算与算法同步推进,一批“智能机器”原型被真正建造出来。原文档介绍了其中三台代表性机器:
-
Shakey 机器人——能够自行移动并“智能地”决定如何执行任务的机器人:
原文档配图说明:Shakey,1972 年。
-
Eliza——早期“聊天机器人”,能与人对话并扮演原始的“治疗师”角色。原文档提示读者将在 NLP 课中更深入地了解它。仓库中 6-NLP/1-Introduction-to-NLP/README.md 确实用两节篇幅展开了这段历史:Eliza 由 MIT 科学家 Joseph Weizenbaum 于 1960 年代开发,它能解析句子、识别语法结构与关键词并给出貌似合理的回应,但无法真正“理解”句子——例如对 "I am sad" 它只是把词序重组替换为 "How long have you been sad";若识别不到关键词,就给出随机回应,因此很容易被 "You are a bicycle" 之类的输入戏弄。
原文档配图说明:Eliza 聊天机器人的一个版本。
-
“积木世界”(Blocks world)——一个可以堆叠、分拣积木的微型世界实验,用于测试“教机器做决策”的实验;SHRDLU 等系统在此推动了语言处理向前。原文档附有一段 SHRDLU 积木世界演示视频(外部资源,此处不再给出链接)。
1974–1980:“AI 寒冬”
到 1970 年代中期,业界逐渐意识到两件事:制造“智能机器”的复杂度被低估了,而对照当时可用的算力,此前的承诺被夸大了。资金枯竭,领域信心降温。原文档归纳了四类具体原因:
- 算力限制(Limitations):计算能力过于有限;
- 组合爆炸(Combinatorial explosion):需要训练的参数随对计算机要求的提高而指数增长,算力却未同步演进;
- 数据稀缺(Paucity of data):可用于测试、开发、精炼算法的数据太少;
- 我们是否问了正确的问题(Are we asking the right questions?):研究范式本身开始被质疑——
- 图灵测试受到“中文房间理论”(chinese room theory)的批判:编程让数字计算机“看起来”理解语言,并不能产生真正的理解;
- 把 ELIZA 这样的“治疗师”智能引入社会的伦理问题被提出质疑。
“毛糙派”与“整洁派”:两大 AI 学派的分野
同期,AI 内部形成了“scruffy(毛糙派)vs. neat(整洁派)”的二分法:
- Scruffy 实验室:花数小时微调程序,直到拿到想要的结果。ELIZA 和 SHRDLU 都是著名的 scruffy 系统;
- Neat 实验室:“focused on logic and formal problem solving”(专注于逻辑与形式化问题求解)。
原文档给出了一个关键的历史转折点判断:到了 1980 年代,当业界开始要求 ML 系统具备可复现性(reproducible)时,neat 的路线逐渐占据上风,因为其结果更可解释(more explainable)——这为下一节的专家系统铺平了道路。
1980 年代:专家系统
随着领域成长,其商业价值越来越清晰,“专家系统”(expert systems)在 1980 年代大量涌现。原文档引用了对其历史地位的评价:“Expert systems were among the first truly successful forms of artificial intelligence (AI) software.”(专家系统是最早真正成功的 AI 软件形态之一。)
从系统架构看,专家系统实际上是混合(hybrid)系统,由两部分组成:
- 规则引擎(rules engine):定义业务要求;
- 推理引擎(inference engine):利用规则系统推断出新事实(deduce new facts)。
原文档还特别指出,这一时期神经网络重新获得了越来越多的关注——这是为 1990 年代之后的复兴埋下的伏笔。
1987–1993:AI“降温期”
专家系统硬件的普及带来了一个副作用:过度专用化(too specialized)。与此同时,个人计算机(PC)的兴起与这些大型、专用的中心化系统形成竞争。原文档的总结是:“计算的民主化已经开始,并最终为现代大数据的爆发铺平了道路”(The democratization of computing had begun, and it eventually paved the way for the modern explosion of big data)。
1993–2011:数据与算力驱动的新纪元
原文档将这一时期定位为 ML 与 AI 的新纪元:此前因数据与算力短缺而无法解决的问题开始变得可解。三个同步变化:
- 数据量快速增长并大规模可用——“好坏皆有”,尤其是 2007 年前后智能手机的出现;
- 算力指数级扩张;
- 算法同步演进,领域开始成熟——过去“天马行空”的探索期逐渐凝结为一门真正的学科。
当下:风险与责任
原文档“Now”一节的立场是:今天 ML 与 AI 几乎触及生活的每个角落,这个时代要求我们审慎理解这些算法对人类生活的风险与潜在影响。为此原文档引用了微软 Brad Smith 的公开表述:信息技术触及隐私与言论自由等基本人权保护的核心,这既加重了产品制造方的责任,也呼吁审慎的政府监管与关于“可接受用途”的规范制定。
原文档的收束段值得原样保留,因为它定义了这门历史课的教学目的:
未来如何尚不可知,但理解这些计算机系统及其运行的软件与算法至关重要。我们希望本课程能帮助你更好地理解,从而能够自己做判断。
历史在课程中的回响
这节课的“历史”并非孤立的叙事,而是与课程后续单元一一咬合。结合仓库内容可以整理出这张呼应关系表:
| 历史节点 | 课程后续单元 | 仓库位置 |
|---|---|---|
| 图灵测试、Eliza | NLP 单元:从图灵测试讲到 Eliza 的词序替换机制,并动手写一个随机回应机器人 | 6-NLP/1-Introduction-to-NLP/README.md,参考实现 6-NLP/1-Introduction-to-NLP/solution/bot.py |
| 最小二乘法(1805) | 回归单元:最佳拟合线 Y = a + bX 与南瓜价格数据 |
2-Regression/3-Linear/README.md |
| 最近邻(1967) | 聚类单元:距离度量与模式发现 | 5-Clustering/ |
| 前馈网络 / 反向传播(1970/1957) | 本课为概念铺垫;深度学习被课程明确划出范围(README 说明本教程聚焦经典 ML,以 Scikit-learn 为主,深度学习见姊妹课程 AI for Beginners) | README.md |
| 马尔可夫链(1913) | 时序课程的时间依赖思想 | 7-TimeSeries/ |
其中 NLP 课的机器人练习与 Eliza 的对照尤其能体现“以史为镜”的设计:NLP 课给出的基础版机器人只用一组随机应答维持对话:
random_responses = ["That is quite interesting, please tell me more.",
"I see. Do go on.",
"Why do you say that?",
"Funny weather we've been having, isn't it?",
"Let's change the subject.",
"Did you catch the game last night?"]
这正是 Eliza 式“表面理解”的现代最小实现,而历史课中提到的中文房间批判,恰好为学习者提供了评判这类系统的理论坐标。
挑战与作业:创建一条自己的技术时间线
原文档的 🚀Challenge 环节要求学习者深挖上述某个历史时刻背后的具体人物,并提醒:没有一项科学发现诞生于文化真空之中。
配套的正式作业(阿拉伯语版见 translations/ar/1-Introduction/2-history-of-ML/assignment.md,英文版见 1-Introduction/2-history-of-ML/assignment.md)是“Create a timeline”:使用一个开源 timeline-builder 工具,围绕算法、数学、统计、AI 或 ML 历史(或其组合)的某个方面创建一条时间线。作业允许聚焦单个人物、单个思想,或一段长时期的思想演进,并要求必须加入多媒体元素。评分标准只有一档核心要求:
- 优秀(Excellent):时间线以 GitHub 页面形式发布;
- 合格(Acceptable):代码不完整或未发布;
- 需改进(Needs Improvement):时间线不完整、论证不足且未发布。
换句话说,作业交付物是一个可公开访问、带多媒体内容的 GitHub 页面,其内容质量以“人物/思想/时期的研究深度”为衡量尺度。
小结
这一课为 ML-For-Beginners 全部 26 课提供了统一的时间坐标系:1763–1913 年的数学奠基(贝叶斯、最小二乘、马尔可夫链)、1950 年代的概念爆发(图灵测试、达特茅斯、感知机)、1956–1974 年的乐观原型(Shakey、Eliza、积木世界)、1974–1980 年因算力、组合爆炸与数据稀缺而陷入寒冬、1980 年代专家系统的商业落地、1987–1993 年降温,以及 1993 年之后由数据民主化与算力扩张开启的新纪元。掌握这条时间线的价值在于:当你在后续单元写出第一个 Scikit-learn 回归模型或对话机器人时,你清楚地知道自己在延续一条有二百多年历史的算法脉络,并能用“可复现性”“可解释性”“数据与算力约束”这三个历史反复出现的标准去审视任何新工具。
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0624
Hy4-previewHy4 preview 是由腾讯混元团队研发的新一代混合专家(MoE)旗舰模型。模型总参数量 770B,每个 token 激活 49B,主干共包含78层,第一层采用标准 FFN,其余 77 层均为 MoE 结构,每层包含 256 个路由专家与 1 个共享专家,每个 token 激活 top-8 路由专家及共享专家。主干之外原生内置 1 层 MTP(总参数量 10B,激活 0.7B)以支持投机解码。Python00
GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。Jinja00
GLM-5.3-FlashGLM-5.3-Flash (320B-A18B),是GLM-5系列的首个原生多模态模型。320B总参数,能力超过GLM-5.2Jinja00
Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲,涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流,并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00
Spark-X2.5-1.7BSpark-X2.5-1.7B 旨在让强大的 AI 更加实用、高效且易于获取。这些模型在广泛的日常任务中表现出色,涵盖对话、写作、翻译、推理、编程、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00


