首页
/ ML-For-Beginners 开篇课精读:从零理解机器学习的概念、术语与课程学习路线

ML-For-Beginners 开篇课精读:从零理解机器学习的概念、术语与课程学习路线

2026-09-06 19:14:24作者:蔡丛锟

本文是微软开源课程 ML-For-Beginners(12 周 / 26 课 / 52 道测验的经典机器学习入门体系)第一篇课程《机器学习入门》的深度导读。它以仓库 1-Introduction/1-intro-to-ML/README.md(仓库同时提供 保加利亚语译文 等 50+ 语言版本)为骨架展开,帮助完全零基础或想系统补课的读者说清"机器学习到底是什么、它与 AI/深度学习/数据科学有何边界、这门课教什么不教什么、课前该如何准备环境",并带你完成第一篇的开篇挑战与作业,为后续进入回归、分类、聚类等实战章节铺平道路。

欢迎来到经典机器学习入门课程

本仓库定位明确:面向初学者的经典机器学习课程。根目录 README.md 明确指出,全课共 12 周、26 课、52 道测验,主要以 Scikit-learn 为工具库,刻意绕开深度学习(深度学习由同系列的 AI for Beginners 课程覆盖),并可与数据科学入门课程互为补充。它的教学法有两个支柱:基于项目的动手实践(project-based)高频小测验(frequent quizzes),每课标配"课前测验 → 精读课文 → 动手练习 → 课后测验 → 挑战 → 作业",配以全球文化数据集让学习过程有连贯主题。

具体到本课所在的 1-Introduction 模块,共包含四节基础课:

  1. 机器学习入门(本课)
  2. 机器学习与 AI 的历史
  3. 机器学习与公平性
  4. 机器学习的技术方法

先厘清术语:AI、ML、深度学习与数据科学的边界

"机器学习(ML)"是当下最流行的词之一,但它的内部机制对多数人仍是黑箱。原文给出的定义值得反复咀嚼:

ML 是人工智能的一个重要子集,它使用专门算法,从感知到的数据中发现有意义的信息、寻找隐藏模式,从而佐证理性决策过程。

下面这张图直观呈现了四个高频概念之间的关系:AI 是最外层、最宽泛的集合;ML 完整地嵌套在 AI 之内;深度学习(Deep Learning,即多层神经网络建模)又嵌套在 ML 之内;而数据科学是与 AI 部分交叠、但又不完全归属其下的独立领域。

嵌套椭圆示意 AI、机器学习、深度学习与数据科学四者包含/交叠关系

记忆要点:AI 概念外延最大,ML 是其子集,深度学习又是 ML 的子集;数据科学则从另一条脉络切入,与 AI 有交集却不等同。这也是全课程反复使用的一组基础分界。

用"人类大脑的学习"来建立直觉

原文档刻意用认知类比来建立直觉:人的大脑与感官感知周围事实,逐年揭示生活中的隐藏模式,并据此打磨出识别模式的逻辑规则——这种持续学习、发现模式并基于模式再创新的能力,对应神经科学中的"大脑可塑性(brain plasticity)"。人类大脑从现实世界感知事物、处理信息、理性决策并执行动作,被称为"智能行为";把这种智能行为过程"编程"到机器上,就是人工智能(AI)。机器学习的学习机制正是从这个意义上"松散地借鉴"了人脑基于感知数据学习的方式。

警惕炒作曲线:关注真实技术而非热度

理解一项技术前,先看它的真实热度走势很有价值。Google Trends 中 "machine learning" 一词的长期搜索趋势即呈现出一条典型的"炒作曲线":早期平稳、后期快速抬升,最终在高位波动。

Google Trends 中"machine learning"一词随时间变化的兴趣曲线

对初学者而言,这幅图是一剂清醒剂:热度高不代表你马上能驾驭它,学习 ML 的正确姿势是"从实践示例出发,一步一步来",而不是被概念密度吓退。

本课程覆盖什么、明确不覆盖什么

为避免初学者被庞大的 AI 版图淹没,课程把范围切得很清晰。

课程中你会学到(即后续 12 周的主线)

  • 机器学习核心概念(本课所在的 Introduction 模块)
  • ML 的历史
  • ML 与公平性(fairness)
  • 回归(Regression)技术 —— 见 2-Regression
  • 分类(Classification)技术 —— 见 4-Classification
  • 聚类(Clustering)技术 —— 见 5-Clustering
  • 自然语言处理(NLP)技术 —— 见 6-NLP
  • 时间序列预测技术 —— 见 7-TimeSeries
  • 强化学习 —— 见 8-Reinforcement
  • ML 的真实世界应用 —— 见 9-Real-World

课程明确不覆盖:深度学习、神经网络、AI 本身。理由是这三者依赖更宽的数学与算力背景,需要专门的课程体系;本课选择以 Scikit-learn 为载体的"经典机器学习"打地基——扎实的 ML 基础恰恰是日后理解 AI 与深度学习的必要条件。

为什么值得学 ML?以及数据质量的杠杆作用

从系统视角回答"为什么"

从系统层面看,机器学习被定义为构建能够从数据中习得隐藏模式、以辅助智能决策的自动化系统。原文留下一个值得自问的思考题:一家企业为何愿意采用 ML 策略,而不是写一套硬编码(hard-coded)的规则引擎?

答案的伏笔贯穿全课程:当决策涉及变量众多、规则难以手工穷举时(比如根据病史预测患病概率、依据海量气象特征预测天气),条件规则引擎会迅速失控,而 ML 能从数据中自己"长"出模式。这个"该用规则引擎还是 ML"的判断框架,也是 4-techniques-of-ML/README.md 中"提出正确问题"一节的核心出发点。

数据质量决定模型上限

文档给出一条贯穿始终的工程铁律:高质量数据提升模型表现,糟糕或嘈杂的数据即使配上先进算法也会产出不准确预测。数据之于 ML,如同训练经验之于人脑。这条原则在后面每一课都会被具体化——例如在数据处理、公平性与可视化环节,仓库中 2-Regression4-Classification/1-Introduction 等课程都会带读者做真实数据的清洗、转换与可视化(如将字符串编码为数值、随机化打乱、划分训练/测试集等)。

ML 能解决什么问题:应用图谱

ML 应用已像流动的数据本身一样无处不在——这些数据来自智能手机、联网设备与各类系统。文档给出的典型示例包括:

  • 依据患者的病史或医疗报告预测患病概率;
  • 利用天气数据预测气象事件;
  • 理解一段文本的情感倾向(sentiment);
  • 识别假新闻、遏制宣传扩散。

金融、经济学、地球科学、太空探索、生物医学工程、认知科学乃至人文学科,都已用 ML 去解决各自领域中重数据处理的难题。课程正文后文同样会把这些抽象场景落到具体数据集上——南瓜价格回归、美食分类、尼日利亚歌曲聚类、酒店评论情感分析、电力能耗时间序列预测等,构成完整的"主题式"实战线。

课前准备:本地环境与工具链

课程要求你在开始前把电脑配置到可以本地运行 Jupyter Notebook 的程度,这是后续所有动手练习的前提:

  1. 配置机器:按配套指引安装 Python,并准备一款称手的文本编辑器/IDE(本仓库的 Web App 课还会涉及 JavaScript,因此官方推荐同时具备 Node.js、npm 与 Visual Studio Code 的 Python + JavaScript 开发环境)。
  2. 具备 Python 基础:Python 是数据科学家的常用语言,也是本课程的主用语言;如不熟悉,建议先按官方 Python 学习路径补一遍基础语法再开工。
  3. 创建(并 fork)GitHub 账号:由于本仓库托管在 GitHub,通常需要注册账号并将课程 fork 到个人名下以便实践——fork 后可自由在上面做练习并随时对照。
  4. 熟悉 Scikit-learn:它是本课程贯穿始终的 ML 库。从"模型都长什么样"的角度,可先浏览其用户指南建立整体印象;后续课程中你会频繁看到 model.fit(X, y)model.predict(...) 这类统一 API。仓库内各课的 notebook 与 solution 目录(例如 2-Regression/1-Tools/notebook.ipynb 及其 solution 目录)都内置了大量可运行的 Scikit-learn 示例,是极佳的对照材料。

另外,本仓库支持 50+ 种语言的翻译(见 translations 目录与根 README 的多语言支持说明),海外学习者可按需选用;若克隆整个仓库过大,根 README.md 也提供了基于 sparse checkout 的精简克隆方式(跳过 translations 与 translated_images,仅保留课程正文与数据)。仓库还提供本地化的测验前端实现,见 quiz-app,方便离线体验每课的课前/课后小测。

走出第一步:知识检验、挑战与作业

🚀 挑战(Challenge)

原文档给出一项无需写代码、重在建立概念地图的挑战:在纸上(或用 Excalidraw 之类的在线画板)画出你对 AI、ML、深度学习与数据科学四者差异的理解图,并为每一种技术标注"它适合解决哪类问题"。这正是上文那张嵌套椭圆图的"逆向输出"——能画清楚,才算真正建立起了全局认知。

课后任务(Assignment)

每课正文末尾都配有独立作业页。本课的作业在 translations/bg/1-Introduction/1-intro-to-ML/assignment.md(英文原版见 1-Introduction/1-intro-to-ML/assignment.md),内容为"环境跑通 + Python 热手":跟随 Python 学习路径复习语法,并按配套入门视频清单把机器配置到能执行 notebook 的状态。它不计分、属于自选任务,却是后面 25 课能否顺利推进的"体检项"。

收尾自检

  • 读完课文请回答:ML 与 AI 各自的定义边界是什么?"深度学习"为什么被本课程排除在外?
  • 完成课后测验与挑战后,对照课程结构图确认:回归、分类、聚类、NLP、时间序列、强化学习分别落在课程 12 周的哪一段。

结论

原文档以一句话收束全课:机器学习将"模式发现"这一过程自动化——从真实或生成的数据中找出有意义的洞察,并在商业、健康、金融等领域被证明极具价值。可以确定的是,随着 ML 被大规模采用,掌握其基础将在不远的将来成为各领域从业者的必修技能。

对于仓库学习者的路线建议是:读完本篇打好概念地基 → 完成"AI/ML/DL/数据科学关系图"挑战 → 用作业把 Python + Notebook 环境彻底跑通 → 进入下一节 机器学习与 AI 的历史,再顺次攻克公平性(3-fairness)与技术方法(4-techniques-of-ML),即可满怀信心地驶向真正的算法实战章节。

登录后查看全文
热门项目推荐
相关项目推荐

项目优选

收起
kernelkernel
deepin linux kernel
C
33
18
ops-transformerops-transformer
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
1.13 K
2.75 K
pytorchpytorch
作为 Ascend for PyTorch 社区的核心组件,TorchNPU 是昇腾专为 PyTorch 打造的深度学习适配插件,使 PyTorch 框架能够直接调用昇腾 NPU,为开发者提供昇腾 AI 处理器的超强算力。
Python
857
1.35 K
docsdocs
暂无描述
Markdown
897
5.8 K
kernelkernel
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
529
593
ops-nnops-nn
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
915
1.83 K
jiuwenswarmjiuwenswarm
JiuwenSwarm 是一款基于openJiuwen开发的智能AI Agent,它能够将大语言模型的强大能力,通过你日常使用的各类通讯应用,直接延伸至你的指尖。
Python
3.58 K
1.01 K
ops-mathops-math
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.35 K
1.46 K
cann-learning-hubcann-learning-hub
CANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。
Jupyter Notebook
1.01 K
515
AscendNPU-IRAscendNPU-IR
AscendNPU-IR是基于MLIR(Multi-Level Intermediate Representation)构建的,面向昇腾亲和算子编译时使用的中间表示,提供昇腾完备表达能力,通过编译优化提升昇腾AI处理器计算效率,支持通过生态框架使能昇腾AI处理器与深度调优
C++
547
388