首页
/ 机器学习入门(ML-For-Beginners 第一课):从 AI 概念、经典术语到经典机器学习全解析

机器学习入门(ML-For-Beginners 第一课):从 AI 概念、经典术语到经典机器学习全解析

2026-09-07 15:04:18作者:齐添朝

导读:本文基于 ML-For-Beginners 开源课程(12 周、26 课时、52 道随堂测验)的第一课整理而成。你将系统理解“机器学习(ML)到底是什么”“它与人工智能(AI)、深度学习、数据科学的关系”,掌握学习该课程所需的环境准备清单,并看清后续回归、分类、聚类、NLP、时间序列、强化学习等所有技术板块的学习地图。读完本文,你可以用自己的话讲清经典机器学习的内涵、价值与应用边界,并立刻开始搭建本地 notebook 学习环境。

课程定位:一份面向初学者的经典机器学习课程

ML-For-Beginners 是一套专为“零基础到入门”设计的**经典机器学习(classical machine learning)**课程。与常见的堆砌深度学习的教程不同,它以 Scikit-learn 为核心工具库,刻意绕开了神经网络与深度学习的复杂细节,让初学者先建立扎实的机器学习基础。正如项目根目录 README.md 所述,它采用“项目式教学 + 高频测验”的双重教学法:所有课程都围绕可动手构建的真实项目展开,每节课前有预测验、课后有后测验,学习者通过“边做边学”让知识真正沉淀。

本课作为整个课程的第 01 课,归属在 1-Introduction(入门)模块中,由 Muhammad 撰写,是整个 26 课旅程的起点。

开始前的准备:搭建你的机器学习开发环境

在正式阅读本课程之前,你需要让电脑具备“在本地运行 notebook”的能力。原文档给出了一份完整的环境准备清单,逐条落实即可:

准备项 具体动作 用途说明
安装 Python 观看官方安装视频,在系统内装好 Python 本课程的主力编程语言,数据科学家最常用的语言
配置代码编辑器 观看编辑器配置视频 推荐 Visual Studio Code,可同时服务 Python 与 JavaScript 开发
学习 Python 基础 完成一条 Python 学习路径,掌握基础语法 课程所有 notebook 均以 Python 编写
安装 Node.js 与 npm 安装 node 与 npm 课程中构建 Web 应用的部分会用到 JavaScript
注册 GitHub 账号 创建账号并 fork 本课程仓库 便于在自有副本上完成练习与提交
了解 Scikit-learn 阅读 Scikit-learn 用户指南 本课程所有课时反复引用的 ML 库

其中的环境搭建任务是本课随后的非计分作业,完整指引见 assignment.md:先完成 Python 学习路径,再通过一系列入门视频完成系统配置。仓库中每个“面向项目”的课时目录都配有 solution/ 文件夹存放参考实现,当你在某个项目卡住时可以对照查看,但官方更推荐你先靠自己理解课程内容去构建项目,再回头对照解法。

什么是机器学习:从“热门词汇”到严谨定义

“机器学习”是当今最流行、最高频的技术词汇之一——只要对技术稍有接触,几乎不可能没听过它。然而,对大多数人而言,机器学习的“内在机制”仍然充满神秘感。对于初学者,这个主题有时甚至会让人望而生畏。因此,最重要的第一步,就是搞清楚机器学习到底是什么,并通过一个个实用的例子循序渐进地学习它。

Google Trends 中“machine learning”一词近年来的搜索热度本身就构成了一条陡峭的“炒作曲线”,这说明公众对它的关注度极高,但热度并不等于理解深度:

机器学习的炒作曲线(Google Trends 数据)

上图展示的是 Google Trends 中“machine learning”一词近年的“炒作曲线”,对应原图位于 1-intro-to-ML/images/hype.png

为什么要学机器学习:人类大脑给出的灵感

课程用一个形象的类比来解释机器学习的动机:我们生活在一个充满迷人谜团的宇宙里,斯蒂芬·霍金、阿尔伯特·爱因斯坦等伟大科学家终其一生都在寻找能揭开世界奥秘的有意义信息——这正是人类“学习”的普遍状态:孩子逐年发现新事物、揭开世界结构,直到成年。

孩子的大脑:从感知到模式识别

孩子的大脑和感官感知周围环境的事实,逐渐学会生活中的“隐藏模式”,并据此构建出识别已学模式的逻辑规则。人类大脑的这种持续学习(发现隐藏模式 → 在模式之上创新)能力,让人类成为地球上最复杂的生命体,其对应的科学概念被称为大脑可塑性(brain plasticity)。表面上看,人类大脑的学习过程与机器学习的核心理念之间存在明显而鼓舞人心的相似性。

人类大脑:从感知到智能行为

人类大脑从现实世界感知事物、处理感知到的信息、做出理性决策,再依据情境执行特定动作——这就是我们所说的“智能行为”。当我们把这种智能行为过程的“仿制品”编程进一台机器时,它就是人工智能(AI)

厘清概念:AI、机器学习、深度学习与数据科学的关系

虽然这些术语容易混淆,但它们之间有着清晰的层级关系:机器学习(ML)是人工智能的一个重要子集。更严谨地说:

机器学习使用专门的算法,从感知到的数据中发现有意义的信息、找出隐藏模式,从而为理性决策过程提供佐证。

为了更直观地理解,课程用一张信息图展示了 AI、ML、深度学习与数据科学的包含关系:

AI、ML、深度学习与数据科学的关系示意图

上图说明 AI、ML、深度学习与数据科学彼此之间的从属与交叉关系,原图位于 1-intro-to-ML/images/ai-ml-ds.png

从本课的角度看:AI 是外延最大的总称;ML 是 AI 的子集,专注“从数据中学模式”;深度学习则是 ML 中借助多层神经网络建模的子集;数据科学则是横跨统计、分析与建模的更大领域。本课只讲其中“经典机器学习”这一块,用 Scikit-learn 帮助初学者打地基——因为无论将来要深入人工智能还是深度学习,扎实的 ML 核心知识都不可或缺

本课覆盖范围:学什么与不学什么

课程对“覆盖边界”作出了明确声明,这种克制对学习者非常友好:

在 ML-For-Beginners 课程中你将学到:

  • 机器学习核心概念
  • ML 的历史
  • ML 与公平性(fairness)
  • 回归类(Regression)ML 技术
  • 分类类(Classification)ML 技术
  • 聚类类(Clustering)ML 技术
  • 自然语言处理(NLP)ML 技术
  • 时间序列预测 ML 技术
  • 强化学习(Reinforcement Learning)
  • ML 的真实世界应用

课程不会覆盖(留给后续专门课程):

  • 深度学习(Deep Learning)
  • 神经网络(Neural Networks)
  • 广义的 AI 全貌

课程明确解释:为了提供更好的学习体验,它有意避开神经网络、深度学习(利用神经网络构建多层模型)以及完整 AI 的复杂议题——这些会放在另一套课程中讲授。相应地,主仓库还会提供一套聚焦数据科学的配套课程。

结合 README.md 中的课程总表可以看清这份地图对应的仓库目录结构:回归(2-Regression)、Web 应用(3-Web-App)、分类(4-Classification)、聚类(5-Clustering)、NLP(6-NLP)、时间序列(7-TimeSeries)、强化学习(8-Reinforcement)以及真实世界应用(9-Real-World)。学完本课后,你就具备了进入这些章节的共同语言。

为什么值得学机器学习:系统视角的答案

从系统(systems)的视角看,机器学习的定义是:创建能够从数据中学习隐藏模式、以辅助做出智能决策的自动化系统。这一动机,正是松散地受到“人类大脑依据外部世界感知的数据来学习”这一过程的启发。

✅ 思考一分钟: 相比编写一套“硬编码规则”引擎(hard-coded rules-based engine),一家企业为什么更愿意尝试机器学习策略?

这个问题的答案是本课的核心洞察之一:当问题规模巨大、规则难以穷举、数据不断变化时,人工编写规则的做法很快就会失效;而机器学习让系统自己从数据中“长出”规则。同时,数据质量至关重要——高质量的数据能提升模型性能;糟糕或有噪声的数据,即使配合先进的 ML 算法,也会导致预测偏差。所以“先把数据整理干净”,是课程后续所有项目反复强调的第一步。

机器学习的现实应用:无处不在

机器学习的应用如今几乎无处不在,其普及程度与数据在社会中的流动一样广泛——智能手机、联网设备和其他系统无时无刻不在产生数据。考虑到先进 ML 算法蕴藏的巨大潜力,研究者们正在探索用它们解决多维、跨学科的真实问题,并已取得大量积极成果。

课程给出了一组非常直观的“应用 ML”示例:

  • 医疗:根据患者的病史或检查报告预测患病可能性
  • 气象:利用天气数据预测天气事件
  • 文本分析:理解一篇文章的情感倾向(情绪分析)
  • 内容安全:识别假新闻,阻止宣传性内容的扩散

更广地看,金融、经济、地球科学、太空探索、生物医学工程、认知科学,甚至人文学科,都已引入机器学习来解决各自领域中繁琐且数据处理密集的难题。这正是本课程在后续各模块中始终采用的叙事方式——把每种经典技术绑定到一个来自世界各地的真实数据集上,例如北美的南瓜价格(回归)、亚洲与印度菜系(分类)、尼日利亚歌曲品味(聚类)等。

小结与课后延展

小结:机器学习通过从真实世界数据或生成数据中挖掘有意义的洞察,将“模式发现”的过程自动化。它已在商业、健康、金融等众多领域证明了自己极高的价值;而在不远的将来,由于它的广泛采用,理解机器学习的基础将成为任何领域从业者的必备素养

挑战(Challenge):在纸上,或使用 Excalidraw 等在线工具,画出你理解的 AI、ML、深度学习与数据科学四者之间的差异关系图,并为每种技术补充 1~2 个它们擅长解决的问题——这是一个绝佳的“费曼式”自检,能帮你确认自己是否真的厘清了概念层级。

课后测验与自修:完成本课的后测验;若想了解在云端使用 ML 算法,可进一步学习“创建无代码预测模型”学习路径,并完成“机器学习基础”学习路径。仓库根目录 README.md 也说明,所有 52 道测验都收录在 quiz-app 目录中(每题 3 问),既可随课程在线使用,也可在本地运行整个测验应用。

作业(Assignment):本课配套的非计分作业是“把环境跑起来”(assignment.md)——完成 Python 学习路径、看完环境搭建视频,确保你的电脑可以执行 notebook。这是进入第 02 课“机器学习与 AI 的历史”之前最值得投入的一步:只有环境就绪,后面的每一次动手实践才会顺畅。

登录后查看全文
热门项目推荐
相关项目推荐

项目优选

收起
kernelkernel
deepin linux kernel
C
33
18
ops-transformerops-transformer
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
1.14 K
2.75 K
pytorchpytorch
作为 Ascend for PyTorch 社区的核心组件,TorchNPU 是昇腾专为 PyTorch 打造的深度学习适配插件,使 PyTorch 框架能够直接调用昇腾 NPU,为开发者提供昇腾 AI 处理器的超强算力。
Python
857
1.35 K
docsdocs
暂无描述
Markdown
898
5.82 K
ops-nnops-nn
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
921
1.84 K
jiuwenswarmjiuwenswarm
JiuwenSwarm 是一款基于openJiuwen开发的智能AI Agent,它能够将大语言模型的强大能力,通过你日常使用的各类通讯应用,直接延伸至你的指尖。
Python
3.8 K
1.02 K
kernelkernel
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
531
596
cann-learning-hubcann-learning-hub
CANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。
Jupyter Notebook
1.02 K
519
ops-mathops-math
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.36 K
1.46 K
AscendNPU-IRAscendNPU-IR
AscendNPU-IR是基于MLIR(Multi-Level Intermediate Representation)构建的,面向昇腾亲和算子编译时使用的中间表示,提供昇腾完备表达能力,通过编译优化提升昇腾AI处理器计算效率,支持通过生态框架使能昇腾AI处理器与深度调优
C++
548
391