FAANG-Coding-Interview-Questions 机器学习面试完全备战指南:从经典 ML 理论到 LLM 时代的 200+ 高频考题与公司流程全解析

原创2026-10-10 02:53:2378 阅读
文章标签:教程

FAANG-Coding-Interview-Questions 机器学习面试完全备战指南:从经典 ML 理论到 LLM 时代的 200+ 高频考题与公司流程全解析

本篇指南以开源仓库 FAANG-Coding-Interview-Questions 中的核心文档 ML_INTERVIEW_PREP.md 为骨架,系统覆盖机器学习面试的全部考点象限:经典 ML 理论、深度学习、LLM 与生成式 AI、RAG/Agent、评估与护栏、推理优化、分布式训练、NLP、CV、强化学习、MLOps、ML 系统设计与统计数学,并完整收录 Google、Meta、Amazon、Microsoft、OpenAI、Apple 六家公司的面试流程与 2024–2026 年的真实考题。读完本文,你将获得一张可直接对照复习的完整考题地图、按难度分级的知识优先级,以及一套可复制的公司级备战方法论。

同仓库配套资源:全部指南 | 最新公司真题 | AI 实验室与 AI 公司面试 | 系统设计 | Blind 75 | NeetCode 150 | LLM 论文速查表 | AI Agent 构建指南

目录

机器学习面试必备理论

这是所有 ML 面试的"第一层地基"。无论岗位偏研究还是偏工程,以下概念几乎必考,难度标记用于规划复习优先级。

问题 参考材料 难度
监督学习、无监督学习与强化学习的区别是什么? Google ML Crash Course(What Is ML) 简单
解释偏差-方差权衡(bias-variance tradeoff)。 Machine Learning Mastery 偏差-方差入门 中等
什么是过拟合?如何应对? AWS What Is(Overfitting) 简单
比较 L1 与 L2 正则化。 Analytics Vidhya:Ridge/Lasso 完整教程 中等
解释 precision、recall、F1-score 与 ROC-AUC。 Neptune.ai:F1/Accuracy/ROC-AUC/PR-AUC 中等
什么是交叉验证?为什么重要? Towards Data Science:交叉验证 简单
解释 bagging 与 boosting 的区别。 Quantdare:Bagging vs Boosting 中等
决策树如何工作?解释随机森林与梯度提升。 Towards Data Science:决策树与随机森林 中等
什么是特征选择?为什么重要? Machine Learning Mastery:特征选择入门 中等
PCA 如何工作?何时使用? Built In:PCA 分步讲解 困难

复习建议:这 10 个问题中,bias-variance、正则化、评估指标、bagging/boosting 四组是出现频率最高的"必背组合"。回答时建议同时给出直觉解释(intuition)、数学形式(如 L2 是权重平方惩罚)与一个真实项目场景,三者齐备才符合 FAANG 对"深度理解"的评分标准。

深度学习:从基础到进阶

深度学习层继续向上叠加,覆盖神经网络的核心构件。这一层在算法岗与工程岗面试中都是硬性要求。

问题 参考材料 难度
解释神经网络的架构。 IBM Cloud Learn:神经网络 简单
什么是激活函数?比较 sigmoid、tanh、ReLU、Leaky ReLU 与 softmax。 Medium:理解激活函数 中等
什么是反向传播? Medium:反向传播详解 困难
解释梯度消失/梯度爆炸问题。 Towards Data Science:深层网络的梯度问题 困难
什么是 dropout?为什么使用它? Medium:Dropout 在深度学习中 中等
什么是优化器?比较 SGD、Adam、RMSprop 等。 Towards Data Science:训练神经网络的优化器 中等
解释批归一化(batch normalization)。 d2l.ai:Batch Normalization 章节 困难
什么是迁移学习?它有什么用? Machine Learning Mastery:深度学习迁移学习 中等
解释 CNN 的架构。 Towards Data Science:CNN 全指南(ELI5) 中等
什么是 LSTM 与 GRU?它们如何解决梯度消失问题? Colah 博客:Understanding LSTMs 困难

回答要点:激活函数比较题建议以"饱和区导致梯度消失"为主线串联 sigmoid/tanh 的缺点与 ReLU 族的设计动机;优化器题则从"动量 + 自适应学习率"两条设计主线展开,能清楚说出 Adam 对一阶矩(均值)与二阶矩(方差)的估计,是区分"背概念"与"真懂"的分水岭。

LLM 与生成式 AI 面试题

这是 2026 年 AI/ML 面试圈权重最高、区分度最大的部分——原文档明确指出:2026 年最能拉开差距的考点集中在这里,经典 ML 如今被视为"入场基本功"(table stakes)而非加分项。

问题 参考材料 难度
端到端走一遍 Transformer 架构。 Attention Is All You Need(2017) 中等
解释 self-attention,以及为何按键维度平方根缩放。 The Illustrated Transformer 中等
encoder-only、decoder-only 与 encoder-decoder 模型的区别? Hugging Face LLM 教程 中等
旋转位置编码(RoPE)如何工作?为何取代绝对位置编码? RoFormer / RoPE 论文 困难
解释多头(MHA)、多查询(MQA)与分组查询(GQA)注意力,以及各自的取舍。 Attention Is All You Need 困难
什么是 MoE(混合专家)模型?为何每个 token 只路由到少数专家? Mixtral of Experts 论文 困难
解释 compute-optimal 缩放定律及其对训练方式的改变。 Chinchilla 论文(2022) 困难
比较全参微调、LoRA 与 QLoRA,何时选择哪一种? LoRA、QLoRA 论文 中等
端到端解释 RLHF:奖励模型、策略优化及其失效点。 InstructGPT 论文 困难
比较 DPO 与基于 PPO 的 RLHF,为什么 DPO 变得流行? Direct Preference Optimization 论文 困难
什么是 Constitutional AI?如何减少对人类标注的依赖? Constitutional AI 论文 困难
为什么思维链(chain-of-thought)提示能提升推理能力?何时不奏效? Chain-of-Thought Prompting 论文 中等
什么导致幻觉?生产环境中哪些缓解手段真正有效? RAG 论文 困难
解释微调过程中的灾难性遗忘及如何限制。 LoRA 论文 困难

深度佐证:这 14 题的每一道都可以在仓库的 LLM_PAPERS_CHEATSHEET.md 中找到对应论文与优先级信号。该速查表整理了 96 篇论文,并用四种信号辅助排序:Essential(必读基础)、Highly Influential(高被引)、Interview Favorite(面试常客)、Cutting Edge(前沿突破)。例如 Attention Is All You Need 与 InstructGPT 均标为 Essential;Chinchilla、LoRA、FlashAttention、RAG、ReAct、Constitutional AI、DPO、PagedAttention(vLLM)同时出现在该速查表的"Top 15 必读论文"中。建议复习顺序为:先掌握 Transformer 与自注意力(第 1–2 题),再攻克缩放定律与微调(第 7–8 题),最后深入对齐(第 9–11 题)——这正是论文速查表的 Recommended Reading Order 所设计的路径。

RAG、Agent 与上下文工程

RAG 与 Agent 是当前企业级 LLM 应用落地的主战场,也是系统设计类追问的高发区。

问题 参考材料 难度
端到端设计一个 RAG 流水线:从数据摄入到带引用的回答。 RAG 论文 中等
比较稠密检索、稀疏检索(BM25)与混合检索。BM25 何时仍然胜出? RAG 论文 中等
你会选择什么分块策略?块大小如何影响召回率? RAG 论文 中等
检索后为何加 re-ranker?它的代价是什么? RAG 论文 中等
何时微调比 RAG 更合适? LoRA 论文 中等
解释 ReAct 循环,Agent 通常在哪里失败? ReAct 论文 困难
模型如何学会调用工具?如何保持工具 schema 可维护? Toolformer 论文 困难
什么是 Model Context Protocol(MCP)?它解决什么问题? MCP 官方文档 中等
工作流何时应是单 Agent,何时应是多 Agent 系统? Anthropic:Building Effective Agents 困难
为 Agent 设计记忆:工作记忆、情景记忆与语义记忆。 Anthropic:Building Effective Agents 困难
如何对高风险 Agent 动作(如不可逆写入)进行分类与门控? Anthropic:Building Effective Agents 困难
什么是提示注入?如何防御一个会浏览网页的 Agent? Anthropic:Building Effective Agents 困难

回答要点:RAG 组题(前 5 题)建议按"摄取(分块、索引)→ 检索(稠密/稀疏/混合)→ 精排(re-ranker)→ 生成(引用与幻觉控制)"的完整链路作答,并主动说出每个环节可衡量的指标(召回率、MRR、忠实度)。Agent 组题(后 7 题)的核心是"工具调用 + 记忆 + 安全门控"三位一体,仓库的 AGENT_BUILDING_GUIDE.md 提供了更系统的 Agent 构建方法论,可与本表对照学习。

LLM 评估与护栏

评估是 2026 年面试中增长最快的模块——"没有单一正确答案"的生成式特性让传统指标失效,评估体系设计本身成了考点。

问题 参考材料 难度
如何评估一个没有单一正确答案的 LLM 功能? OpenAI Evals 指南 困难
为一个从未度量过质量的客户搭建评估套件。 OpenAI Evals 指南 困难
LLM-as-a-judge 的失败模式有哪些?如何纠正? OpenAI Evals 指南 困难
如何把检索质量与生成质量分开度量? RAG 论文 中等
解释基准污染(benchmark contamination)及如何检测。 MMLU 论文 困难
如何做 A/B 测试证明模型 A 对你的用户优于模型 B? OpenAI Evals 指南 中等
为即将上线的模型设计 red-teaming 流程。 Constitutional AI 论文 困难

回答要点:评估题的关键是"分层度量":检索质量(Recall@k、MRR、NDCG)与生成质量(忠实度、相关性、引用准确率)必须分开报告;LLM-as-a-judge 要主动提到位置偏差、自偏好偏差与冗长偏差三类典型失败,并给出纠正手段(交换顺序、多裁判投票、校准集)。2026 年的真题中"是否有真正的评估框架,还是靠感觉(vibes-based)"直接指向金标准数据集与自动化评估流水线的建设,详见下文真题部分。

LLM 推理、服务与成本优化

LLM 服务端的高频追问集中在"显存去哪了、如何提速、如何省钱"三个问题。

问题 参考材料 难度
什么是 KV cache?为何它主导推理显存?如何管理? vLLM / PagedAttention 论文 困难
解释 PagedAttention 及其解决的问题。 vLLM / PagedAttention 论文 困难
FlashAttention 如何在数学不变的前提下加速注意力? FlashAttention 论文 困难
解释投机解码(speculative decoding)及其何时不划算。 Speculative Decoding 论文 困难
服务系统中比较连续批处理(continuous batching)与静态批处理。 vLLM 文档 困难
比较 int8、int4、GPTQ 与 AWQ 量化,以及你付出的质量代价。 GPTQ 论文 困难
你必须把服务成本砍半且不损伤质量,按什么顺序尝试? vLLM 文档 困难
解释首 token 延迟(TTFT)与总吞吐量之间的权衡。 vLLM 文档 中等

回答要点:这组题的共同主线是"显存与算力的经济学"——KV cache 占据推理显存大头(随序列长度线性增长),PagedAttention 用虚拟内存式分页解决碎片化,FlashAttention 用 IO 感知分块消除中间矩阵落回 HBM 的开销,投机解码用小模型草稿加速大模型自回归。成本砍半题建议按"先无损后损失"的顺序作答:提示压缩与缓存 → 模型分档路由 → 量化 → 蒸馏,并明确每一档对质量的影响边界。2026 真题中"1M 查询/天如何优化 LLM 成本"即此题的规模化版本。

分布式训练与规模化

面向大模型训练岗与高级工程岗,这组题考察对并行策略和训练可靠性的理解。

问题 参考材料 难度
比较数据并行、张量并行、流水线并行与序列并行。 ZeRO 论文 困难
解释 ZeRO 分片阶段 1 到 3,每阶段分别节省什么。 ZeRO 论文 困难
如何在数千个加速器上切分一个 200B 参数模型? ZeRO 论文 困难
什么是流水线气泡(pipeline bubble)?如何减少? ZeRO 论文 困难
训练跑了 8 小时后节点故障,你如何处理? ZeRO 论文 困难
你的 loss 在第 40k 步突然飙升,如何排查? Chinchilla 论文 困难
解释混合精度训练,为何 bf16 通常优于 fp16? ZeRO 论文 中等

回答要点:ZeRO 三阶段的核心记忆点:阶段 1 分片优化器状态、阶段 2 再加梯度分片、阶段 3 再加参数分片,每向下一阶段以增加一次通信为代价换取更多显存节省。200B 切分题建议给出"3D 并行 + ZeRO"的组合回答:张量并行做单卡内切分、流水线并行做层间切分、数据并行 + ZeRO 做参数/梯度/优化器分片。故障恢复题要覆盖检查点频率、异步保存、重放与损失曲线完整性校验。

自然语言处理面试题

NLP 组题衔接了经典序列建模与 Transformer 时代的全部关键概念,是"基础理论 → 前沿架构"的桥梁。

问题 参考材料 难度
什么是词嵌入?解释 Word2Vec、GloVe。 d2l.ai 自然语言处理预训练章节 中等
解释 Transformer 架构。 Google AI Blog:Transformer 详解 困难
BERT 如何工作? Towards Data Science:BERT 详解 困难
NLP 中的注意力机制是什么? Lilian Weng 博客:Attention 详解 困难
如何处理 NLP 任务的文本预处理? Towards Data Science:NLP 预处理实践指南 简单
解释 GPT 模型如何工作。 Jay Alammar:Illustrated GPT-2 困难
序列生成中的束搜索(beam search)是什么? d2l.ai:Beam Search 章节 中等
如何评估 NLP 模型? Towards Data Science:文本输出评估 中等
解释 ROUGE、BLEU 与 METEOR 指标。 Medium:NLG 评估指标 中等
什么是子词分词?比较 BPE、WordPiece 与 SentencePiece。 Hugging Face Tokenizer 总结 中等

计算机视觉面试题

CV 组题从 CNN 基础延伸到检测、分割与生成,覆盖视觉岗与多模态岗的常见追问。

问题 参考材料 难度
解释 CNN 的架构。 Towards Data Science:CNN 全指南 中等
CNN 有哪些类型的层? Machine Learning Mastery:卷积层详解 中等
目标检测如何工作?解释 YOLO、R-CNN、Fast R-CNN、Faster R-CNN。 Towards Data Science:检测算法演进 困难
计算机视觉中的迁移学习是什么? Machine Learning Mastery:CNN 迁移学习 中等
解释图像分割。 Nanonets:语义分割指南 中等
GAN 如何工作? Jonathan Hui:GAN 详解 困难
什么是数据增强?为何在 CV 中重要? d2l.ai:图像增强章节 简单
解释 ResNet 与跳跃连接(skip connections)。 Towards Data Science:ResNet 及其变体 中等
图像分类中如何处理类别不平衡? Google ML Crash Course:不均衡数据集 中等
语义分割、实例分割与全景分割的区别? V7 Labs:全景分割指南 中等

强化学习面试题

经典 RL(Q-learning、DQN、actor-critic)仍会作为热身出现,但原文档明确指出:2026 年 AI 实验室面试中真正有分量的 RL 考点是 LLM 后训练——奖励模型、PPO 对 DPO 对 GRPO、可验证奖励与奖励破解(reward hacking)。表格后半部分正是覆盖这些。

问题 参考材料 难度
什么是强化学习? GeeksforGeeks:RL 入门 简单
解释探索-利用权衡。 Medium:RL 中的探索-利用权衡 中等
基于策略与基于价值的 RL 区别? Stats StackExchange 讨论 中等
解释 Q-learning。 Hugging Face Deep RL 课程 中等
什么是深度 Q 网络(DQN)? Jonathan Hui:DQN 详解 困难
解释策略梯度方法。 OpenAI Spinning Up 困难
什么是 Actor-Critic 架构? Medium:A2C 算法详解 困难
强化学习面临哪些挑战? arXiv:RL 挑战综述(1904.12901) 中等
解释 on-policy 与 off-policy 学习的区别。 OpenAI Spinning Up 中等
什么是近端策略优化(PPO)? Medium:PPO 详解 困难
如何从成对人类偏好训练奖励模型?为何对其过度优化会损害策略? Scaling Laws for Reward Model Overoptimization、RLHF Book 困难
走一遍语言模型的 PPO-RLHF:rollout、奖励、对参考模型的 KL 惩罚、价值头。哪里会失效? Hugging Face:Illustrating RLHF 困难
解释 GRPO。它为何去掉 PPO 的 critic?组相对优势如何计算? DeepSeekMath(GRPO)论文 困难
什么是可验证奖励的 RL(RLVR)?何时基于规则的验证器胜过学习的奖励模型? Tulu 3、DeepSeek-R1 论文 困难
对比后训练中的 PPO、DPO 与 GRPO:各自需要什么数据、算力与内存? RLHF Book 困难
什么是奖励破解?给出 LLM 训练中的具体例子与缓解手段。 Lilian Weng:Reward Hacking 博客 中等
为何 RLHF 与 GRPO 都对参考策略保留 KL 惩罚?去掉会发生什么? RLHF Book 中等

回答要点:RL 组题的回答策略是"经典三句带过,后训练展开讲"——Q-learning/DQN/PPO 用一句话给出核心机制即可,把时间留给奖励模型训练、KL 惩罚与 GRPO 的组相对优势计算。尤其要能讲清"为什么 GRPO 抛弃价值网络"(组内采样替代 critic 估计 baseline,节省一半显存并避免价值头训练不稳定),这是 2026 年 AI 实验室面试的高频深挖点,仓库的 LLM_PAPERS_CHEATSHEET.md 对 DPO、Constitutional AI、InstructGPT 等对齐论文均有对应条目可对照。

MLOps 与模型部署

MLOps 组题覆盖"模型上线后的整条生命线",从部署、监控到治理。

问题 参考材料 难度
什么是 MLOps? Neptune.ai:MLOps 指南 简单
如何把 ML 模型部署到生产环境? Google Cloud Architecture:ML 持续交付 中等
解释模型服务(model serving)。 DataCamp:模型服务 中等
生产环境中监控 ML 模型要考虑哪些因素? ChristopherGS 博客:监控 ML 模型 中等
如何处理模型漂移/衰减? Evidently AI:概念漂移 中等
什么是特征存储(feature store)?为何重要? Tecton:特征存储 中等
如何对 ML 模型做版本控制? Neptune.ai:模型版本控制 中等
什么是容器化?它对 ML 部署有何帮助? TensorFlow Serving Docker 中等
解释 ML 系统中的 CI/CD。 Neptune.ai:ML 的 CI/CD 中等
部署 ML 模型有哪些伦理考量? Google ML Crash Course:公平性 中等

ML 系统设计问题与策略

系统设计轮几乎全部是"开放式场景题",考察从需求澄清、数据与特征、模型选型到服务与监控的完整链路。本仓库另有独立的 SYSTEM_DESIGN_INTERVIEW.md 可系统化训练。

问题 参考材料 难度
如何设计推荐系统? Towards AI:推荐系统设计 困难
设计大规模图像分类服务。 Pluralsight:ML 系统设计指南 困难
如何构建欺诈检测系统? Stripe Radar 工程博客 困难
设计聊天机器人系统。 IBM:聊天机器人参考架构 困难
如何设计搜索排序系统? arXiv:排序学习(1810.09591) 困难
设计异常检测系统。 Towards Data Science:异常检测与状态监控 困难
如何构建内容审核系统? AWS Rekognition:审核指南 困难
设计在线广告实时竞价系统。 arXiv:RTB 综述(1610.03013) 困难
如何设计机器翻译系统? Machine Learning Mastery:NMT 入门 困难
设计动态定价系统。 Wikipedia:动态定价 困难

回答要点:系统设计题的通用框架建议按"澄清需求 → 数据与标签 → 特征工程 → 模型选择与训练 → 离线评估 → 在线服务与 A/B → 监控与回滚"七步展开,每步明确给出权衡。注意 2026 年的真题大量加入了 LLM 元素(见下文),比如"用 LLM 自动做代码评审与优化""设计多模态内容理解系统",因此复习时要把传统 ML 设计框架与 LLM 新组件(RAG、缓存、护栏、成本控制)融合进同一套方法论。

统计学与数学基础

统计与数学是区分"会调库"与"懂原理"的硬标准,尤其在 AI 实验室的技术问答轮中经常以"当场推导"形式出现。

问题 参考材料 难度
解释中心极限定理。 Wikipedia:CLT 中等
Type I 与 Type II 错误的区别? Wikipedia:两类错误 简单
解释贝叶斯定理并举例。 BetterExplained:贝叶斯直觉 中等
相关性与因果性的区别? Medium:相关性 vs 因果性 简单
什么是特征值与特征向量? Medium:ML 中的特征值/向量 困难
解释假设检验与 p 值。 Wikipedia:P 值 中等
什么是维度灾难? Towards Data Science:维度灾难 中等
解释 MLE 与 MAP 估计的区别。 Wikipedia:最大后验估计 困难
PDF 与 CDF 的区别? Wikipedia:累积分布函数 中等
解释梯度下降、随机梯度下降与小批量梯度下降。 Towards Data Science:梯度下降及其变体 中等

实战提示:这组题在 Google DeepMind 的技术问答轮中被进一步升级——据仓库的 AI-Companies-Interview-Questions.md 记载,DeepMind 的约 2 小时速问轮包含数学、统计、CS、ML 四个约 30 分钟的小节,要求手算微积分(链式法则、分部积分)、现场定义特征值/矩阵秩/SVD、解概率谜题,并直接背诵 Goodfellow《深度学习》书中的架构定义。资深候选人也会因遗忘形式化定义而被淘汰,足见统计数学"背到能脱口而出"的重要性。

FAANG 及头部公司的 ML 面试流程

原文档给出如下结论:头部公司的 ML 面试流程通常横跨 1.5–2.5 个月,由多个阶段构成,综合评估技术能力、问题解决能力与团队契合度。以下是六家公司的详细流程对比。

Google ML 面试流程

流程概览:

  1. 简历筛选:基于背景与经验的首轮过滤
  2. 技术电话面(45–60 分钟):
    • 编码题(数据结构与算法)
    • 基础 ML 概念(10–15 分钟)
  3. 虚拟 Onsite(全天):注意——自 2025 年 8 月 Pichai 的全员大会以来,Google 已为许多面试环恢复至少一轮线下面试,以遏制 AI 辅助作弊,具体形式请与招聘官确认
    • 2–3 轮编码(LeetCode medium/hard)
    • 1–2 轮 ML 算法与理论
    • ML 系统设计轮
    • 行为/领导力轮

重点考察:

  • 对 ML 基础与算法的深度理解
  • 扎实的编码能力(Python 优先)
  • 具备 PyTorch 或 JAX 经验,以及 TPU/GPU 训练基础设施经验。TensorFlow 如今主要出现在遗留服务与端侧技术栈
  • 设计端到端 ML 系统的能力
  • 在模糊场景中的问题解决能力

评分标准:

  • ML 概念的技术深度
  • 编码熟练度与干净实现
  • 系统设计方法与权衡考量
  • 沟通与协作能力
  • "Googleyness"与领导力。Pichai 在 2024 年 12 月全员大会将 Googleyness 重新定义为六个特质:使命优先、做出有用之物、大胆且负责、保持节俭、奋力且有趣、团队 Google。行为面回答会按这六项打分

Meta(原 Facebook)ML 面试流程

流程概览:

  1. 简历筛选
  2. 首轮技术面(45–60 分钟):
    • 编码题(算法问题)
    • 基础 ML 知识评估
  3. 虚拟 Onsite(全天):
    • ML 基础轮(理论、算法、统计)
    • 应用 ML 与产品感轮(将 ML 应用到 Meta 产品)
    • ML 系统设计轮(端到端系统)
    • 编码轮(数据结构与算法)。自 2025 年 10 月起,Meta 在 E5 至 E7 的 SWE 与 M2 面试环中,将一轮编码替换为 60 分钟的 AI 辅助 CoderPad 轮:一个含失败测试的多文件代码库,内置可选模型(GPT-5、Claude、Gemini 或 Llama),按问题解决、代码质量、验证与沟通评分
    • 行为轮(基于 Meta 核心价值观框架)

重点考察:

  • 对 ML 算法与应用场景的深度理解
  • PyTorch(首选)与生产级 ML 经验
  • 扎实的 Python 编码能力
  • 熟悉分布式训练与大规模 ML
  • 产品感与影响驱动思维

评分标准:

  • 技术问题解决能力
  • ML 系统设计能力
  • 对 ML 指标与评估的理解
  • 沟通与协作风格
  • 与 Meta 六大价值观的契合:快速行动、聚焦长期影响、打造卓越产品、活在未来、直接且尊重同事、Meta 家族与我

Amazon ML 面试流程

流程概览:

  1. 简历筛选
  2. 首轮技术评估:
    • 在线编码评估,或
    • 技术电话面(45–60 分钟)
  3. 虚拟 Onsite(全天):
    • 1–2 轮编码(数据结构与算法)
    • ML 概念与基础轮
    • ML 系统设计轮
    • 应用 ML / 领域专项轮
    • Bar Raiser 轮(聚焦领导力准则)

重点考察:

  • ML 理论与工程实现
  • Python 编码熟练度
  • 了解 AWS ML 服务(SageMaker、Bedrock)
  • 可扩展 ML 解决方案的系统设计
  • 领导力准则契合度

评分标准:

  • ML 算法技术深度
  • 编码能力与问题解决路径
  • 系统设计能力
  • 领导力准则,共 16 条(客户至上、主人翁精神、创新简化、深入探究、敢于谏言服从大局等)。Amazon 面试中禁止使用生成式 AI 工具,除非明确允许,一经发现即取消资格
  • 沟通与干系人管理

Microsoft ML 面试流程

流程概览:

  1. 简历筛选
  2. 首轮技术面(45–60 分钟):
    • 编码题(数据结构与算法)
    • 基础 ML 概念
  3. 虚拟 Onsite(全天):
    • 2 轮编码(数据结构与算法)
    • ML 理论与基础轮
    • ML 系统设计轮
    • 团队专项技术问题
    • 行为评估("酌情"轮)

重点考察:

  • 扎实的 ML 算法与数学基础
  • 编码熟练度(Python/C#)
  • 熟悉 Azure ML 服务:Azure Machine Learning 与 Microsoft Foundry(原 Azure AI Studio / Azure AI Foundry)
  • ML 应用的系统设计
  • 问题解决与协作方式

评分标准:

  • 技术知识深度
  • 编码能力与实现
  • 系统设计能力
  • 沟通与协作
  • 成长型思维与学习态度

OpenAI ML 面试流程

流程概览:

  1. 申请审核:严格筛选,研究岗看重发表记录,工程岗看重交付过的系统
  2. 招聘官与招聘经理面:动机、使命契合度、回顾过往项目
  3. 首轮技术面(60 分钟):
    • 一道逐步变难的编码题("门禁"式,候选反馈至少要通过两道关卡才能晋级)
    • 研究线还考察 ML 基础与研究理解
  4. 远程作业试工(部分方向):48 小时窗口内的工程实践项目,按可靠性、测试与代码质量评分,而非功能数量
  5. 虚拟 Onsite(多轮):4 至 6 轮,线上或线下
    • 深度学习理论 / ML 深度轮
    • 研究理解与论文讨论轮(研究岗)
    • ML 系统设计或研究设计轮
    • 编码面试(算法与 ML 实现)
    • 技术项目展示
    • 行为与价值观轮:使命契合、安全与伦理判断在此深挖,而非单独的伦理面试

典型全流程周期为 5–8 周。

重点考察:

  • 对 ML 研究文献的深度理解
  • 扎实的数学与统计基础
  • ML 算法的实现能力
  • 熟悉深度学习框架
  • 理解 AI 伦理与对齐
  • 研究背景与发表记录(研究岗)

评分标准:

  • 研究深度与理解
  • 技术实现能力
  • 系统设计思维
  • 与 OpenAI 使命与价值观的契合
  • 研究协作方式
  • 伦理与安全考量

Apple ML 面试流程

流程概览:

  1. 简历筛选
  2. 首轮技术电话面:
    • 编码题
    • ML 基础
  3. 虚拟 Onsite(多轮):
    • 1–2 轮编码(算法与数据结构)
    • ML 理论与基础轮
    • ML 编码轮(实现 ML 算法)
    • ML 系统设计轮
    • 团队专项技术问题
    • 行为评估

重点考察:

  • 扎实的 ML 理论与实现能力
  • Apple ML 技术栈经验:Core ML 与 Create ML 用于部署,MLX 用于 Apple 芯片上的训练与推理,Foundation Models 框架(WWDC 2025)用于调用端侧 Apple Intelligence 模型
  • 端侧(on-device)ML 优化技术
  • 隐私保护的 ML 方案:优先端侧推理,请求需要服务端模型时才使用 Private Cloud Compute
  • 资源受限环境下的问题解决能力

评分标准:

  • ML 概念技术深度
  • 编码与实现能力
  • 系统设计方法
  • 与 Apple 价值观与文化的契合
  • 沟通与协作能力

2024–2026 真实面试题回顾

以下是各头部公司近年真实问过的 ML 面试题,按轮次类型组织(题目后标注公司与年份)。这份清单的价值在于揭示当前出题风格:经典概念题仍在,但 LLM 工程化与 2026 新题型占比显著上升。

ML 基础与理论题(2025–2026)

  1. 解释偏差-方差权衡及其与模型复杂度的关系。(Google, 2023)
  2. 为简单神经网络走一遍反向传播的数学过程。(Meta, 2024)
  3. 比较 L1 与 L2 正则化,包括对模型参数的影响。(Microsoft, 2023)
  4. 分类问题中如何处理类别不平衡?解释不同方案的权衡。(Amazon, 2023)
  5. 解释 RNN 中的梯度消失问题,LSTM/GRU 如何解决。(Apple, 2024)
  6. 线性回归的假设是什么?如何验证?(Google, 2024)
  7. 解释注意力机制及其在 Transformer 模型中的工作原理。(OpenAI, 2023)
  8. 如何实现早停?监控哪些指标?为什么?(Meta, 2023)
  9. 解释 NLP 模型中的嵌入空间。如何评估词嵌入质量?(Microsoft, 2024)
  10. 比较不同优化器(SGD、Adam、RMSprop)及各自适用场景。(OpenAI, 2024)
  11. CNN 中 same padding 与 valid padding 的区别?何时使用哪种?(Google, 2025)
  12. 解释 Transformer 如何解决 RNN 难以处理的长距离依赖问题。(Meta, 2025)
  13. 注意力机制与传统序列模型相比的优缺点?(OpenAI, 2025)
  14. 描述模型规模与推理速度之间的权衡,如何优化?(Microsoft, 2025)
  15. 如何识别与处理训练数据中的离群点?它们如何影响不同 ML 算法?(Amazon, 2025)

ML 系统设计题(2025–2026)

  1. 为 YouTube 视频设计推荐系统。(Google, 2023)
  2. 设计检测 Instagram 假账号的 ML 系统。(Meta, 2024)
  3. 为网约车设计动态定价系统。(Uber, 2023)
  4. 为电商平台搜索设计排序系统。(Amazon, 2023)
  5. 设计个性化新闻源排序算法。(Microsoft, 2024)
  6. 设计支付交易异常检测系统。(Apple, 2023)
  7. 为内容审核系统设计评估框架。(OpenAI, 2024)
  8. 设计通知优化系统:最大化用户参与度同时最小化打扰。(Meta, 2023)
  9. 为外卖配送设计准确的 ETA 预测系统。(DoorDash, 2024)
  10. 设计社交媒体帖子的多模态内容理解系统。(Google, 2024)
  11. 设计能适应演化模式的实时欺诈检测系统。(Stripe, 2025)
  12. 设计为教育平台生成个性化学习内容的 AI 系统。(Microsoft, 2025)
  13. 设计用 LLM 自动做代码评审与优化的系统。(GitHub/Microsoft, 2025)
  14. 设计通过分析日志与代码帮助排查软件问题的 AI 助手。(Google, 2025)
  15. 设计识别生成式 AI 输出中潜在有害内容的系统。(OpenAI, 2025)

ML 编码题(2025–2026)

  1. 从零实现决策树。(Google, 2023)
  2. 为线性回归编写随机梯度下降代码。(Microsoft, 2024)
  3. 实现二分类器的 precision、recall 与 F1 计算函数。(Amazon, 2023)
  4. 仅用 NumPy 实现带反向传播的简单神经网络。(Meta, 2024)
  5. 从零实现 k-means 聚类。(Apple, 2023)
  6. 编写用不同采样技术处理类别不平衡的代码。(OpenAI, 2024)
  7. 用协同过滤实现简单推荐系统。(Netflix, 2023)
  8. 编写检测并处理数据集离群点的函数。(Microsoft, 2023)
  9. 从零为线性回归实现 L1/L2 正则化。(Google, 2024)
  10. 为随机森林模型做交叉验证与超参调优。(Amazon, 2024)
  11. 用 PyTorch 从零实现 Transformer encoder 层。(OpenAI, 2025)
  12. 实现 focal loss 函数处理类别不平衡。(Meta, 2025)
  13. 实现逻辑回归的在线学习。(Google, 2025)
  14. 为特定 NLP 任务实现自定义注意力机制。(Microsoft, 2025)
  15. 构建处理含缺失值时间序列预测的简单高效流水线。(Amazon, 2025)

LLM 专项面试题(2025–2026)

  1. 解释 Transformer 相比 RNN 的关键创新。(OpenAI, 2023)
  2. 如何评估大语言模型?除困惑度外还用哪些指标?(Google, 2024)
  3. 解释提示工程。如何为不同任务设计提示?(Meta, 2023)
  4. 用什么方法减少 LLM 输出幻觉?(Microsoft, 2024)
  5. 解释 ChatGPT 类模型所用的 RLHF 方法。(OpenAI, 2024)
  6. 如何为领域特定 LLM 应用实现高效微调?(Amazon, 2023)
  7. 为企业知识库设计 RAG 系统。(Apple, 2024)
  8. 大语言模型如何处理多语言能力?(Google, 2023)
  9. 解释模型蒸馏并说明如何应用于 LLM。(Meta, 2024)
  10. 如何实现并评估基于 LLM 的代码生成系统?(GitHub/Microsoft, 2023)
  11. Tree of Thought 与 Chain of Thought 提示的区别?各自适用场景?(OpenAI, 2025)
  12. 如何检测模型幻觉?用什么策略减少幻觉?(Google, 2025)
  13. 解释近期降低 Transformer 模型上下文窗口需求的技术。(Meta, 2025)
  14. 如何用 LLM 实现并评估复杂推理的多 Agent 系统?(Microsoft, 2025)
  15. 比较不同的 LLM 高效推理技术(量化、KV 缓存、投机解码)。(OpenAI, 2025)

LLM 与 AI 工程题(2026 更新)

  1. DPO 如何简化 RLHF?何时选 DPO 而非 PPO?(Anthropic, OpenAI, 2026)
  2. 什么是 KV cache?它对 LLM 推理有何帮助?如何优化 KV cache 复用?(OpenAI, Google, 2026)
  3. 何时路由到小蒸馏模型而非大 LLM?设计模型分层/路由系统。(Google, Meta, 2026)
  4. 什么是提示压缩?如何降低成本?(OpenAI, 2026)
  5. 解释 GenAI 的多层缓存:检索缓存、提示缓存、响应缓存。(Anthropic, Google, 2026)
  6. 朴素 RAG 检索失败率约 40%。解释 Adaptive RAG、Corrective RAG(CRAG)、Self-RAG 与 Cache-Augmented Generation(CAG)。(所有 AI 公司, 2026)
  7. RAG 流水线中语义分块与固定大小分块对比。如何检测主题边界?(OpenAI, 2026)
  8. 生产 LLM 系统如何防御提示注入与越狱?(Anthropic, OpenAI, 2026)
  9. 你的应用每天 100 万查询——如何优化 LLM 成本?覆盖 token 削减、模型分层、提示压缩与缓存。(所有公司, 2026)
  10. 如何处理提示与日志中的 PII?描述医疗 GenAI 的 HIPAA 场景。(Google, Microsoft, 2026)
  11. "到底有没有真正的评估框架,还是靠感觉?"构建金标准数据集、自动化评估流水线,区分主观质量与可度量指标。(OpenAI, 2026)
  12. 从零实现 LoRA 与 QLoRA,解释各自的适用时机。(NVIDIA, Meta, 2026)
  13. 设计自主 Agent 架构:编排器、工具网关、记忆系统、策略引擎、状态管理、可观测性。(Anthropic, OpenAI, Google, 2026)
  14. 什么是投机解码?它如何提升推理吞吐?(Google, Anthropic, 2026)
  15. 实现 beam search、top-k 与 top-p 解码算法。(OpenAI, NVIDIA, 2026)
  16. 解释 GRPO 与可验证奖励的 RL。为何推理模型训练从学习的奖励模型转向数学与代码的规则验证器?该方法的边界在哪?(AI 实验室, 2026)
  17. 走一遍 RLHF 流水线并指出常见失败点:偏好数据质量、奖励破解、KL 漂移、安全训练后的过度拒绝。(AI 实验室, 2026)

MLOps 题(2025–2026)

  1. 如何监控生产环境中的 ML 模型?跟踪哪些指标?(Google, 2023)
  2. 解释处理数据漂移与模型衰减的方法。(Amazon, 2024)
  3. 描述 ML 模型的 CI/CD 流水线经验。(Microsoft, 2023)
  4. 如何为大规模 ML 系统设计特征存储?(Meta, 2024)
  5. 用什么策略优化生产模型的推理延迟?(Apple, 2023)
  6. 如何做 ML 模型部署的 A/B 测试?(Netflix, 2024)
  7. 描述 ML 模型版本控制与可复现性的方法。(OpenAI, 2023)
  8. 如何高效管理大模型训练的算力资源?(Google, 2024)
  9. 受监管行业中如何处理模型可解释性要求?(Microsoft, 2023)
  10. 解释 ML 模型的多阶段部署策略。(Amazon, 2024)
  11. 如何对关键 ML 模型做影子部署?跟踪哪些指标?(Google, 2025)
  12. 设计可检测并响应多种漂移的自动化模型监控系统。(Meta, 2025)
  13. 如何实现每日更新的高效持续训练流水线?(Amazon, 2025)
  14. 解释多 ML 团队组织中的模型治理策略。(Microsoft, 2025)
  15. 如何设计同时支撑实验与生产的 ML 基础设施?(OpenAI, 2025)

2026 新面试形式

2026 年各大公司正在重塑 ML 面试流程:

  1. 允许 AI 参与的编码轮:政策因公司、级别与团队而异,每次面试前务必与招聘官确认。在允许 AI 的场景中,评分关注的是所有权意识、提示能力、对输出的验证与调试,而非打字速度。
公司 AI 在编码轮中的政策
Meta 一轮 60 分钟 CoderPad,内置模型,已覆盖至 E7/M2 的 SWE 与 EM 角色
Google 试点中。部分团队提供 Gemini,AI 熟练度纳入评分
LinkedIn 一轮编码替换为 AI 使能轮,1–4 分制,3 分通过
DoorDash 在自己的 IDE 中进行 60 分钟 AI 辅助工作会话
Amazon 禁止。发现使用未经授权的 GenAI 即取消资格
Google DeepMind、ByteDance、Palantir 技术轮禁止
Cursor、Sierra 等 AI 原生创业公司 允许且被期待
  1. 推理实验室(Reasoning Labs):无单一正确答案的模糊 ML 挑战,评估思维清晰度、不确定性处理与伦理意识。
  2. AI 推理挑战(AI Reasoning Challenge):候选人分析 AI 生成产物(解释、日志、摘要),找出缺陷、提出改进并设计验证实验。
  3. 伦理与安全轮:许多公司已将其设为独立轮次。样例:"检测 LLM 中的性别偏见"或"在对话模型中平衡准确性与安全性"。
  4. 独立 MLOps 模块:45 分钟 MLOps 面试,考察数据漂移监控、流水线调试与生产可靠性,现已成为标准环节。

佐证:上述 2026 变化与仓库 README.md 的"What Changed in 2026"章节相互印证——Meta 的 AI 使能编码轮(3 面板 CoderPad,覆盖至 E7/M2)、Google 的 Gemini 辅助代码理解试点与恢复线下轮、LinkedIn 的 AI 轮转正、Amazon 2026 年部分 OA 将第二道编码题替换为 60 分钟仓库调试任务(Spring Boot 或 MERN 应用、失败测试、内置助手)等,均可视为该趋势的完整拼图。

高级 ML 与 AI 话题(2025–2026)

  1. 解释对比学习、自监督学习与监督学习的区别。(Google, 2025)
  2. 扩散模型如何工作?描述前向与逆向过程。(OpenAI, 2025)
  3. 什么是课程学习?何时用于训练神经网络?(Meta, 2025)
  4. 描述模型蒸馏如何工作,为何能产出更小更高效的模型。(Microsoft, 2025)
  5. 多模态模型如何融合不同模态的信息?挑战是什么?(Google, 2025)
  6. 如何开发能推理因果而非仅相关性的 AI 系统?(OpenAI, 2025)
  7. 描述多 GPU 大模型高效训练的技术。(Meta, 2025)
  8. 开发能在长时间跨度上规划复杂动作的 AI 系统有哪些关键挑战?(Microsoft, 2025)
  9. 解释神经架构搜索及其在模型设计中的实际应用。(Google, 2025)
  10. 如何构建能泛化到未见领域的 AI 系统?(OpenAI, 2025)

ML 岗位行为面试题(2025–2026)

  1. 讲一次在模型准确性与部署约束之间权衡的经历。(Google, 2023)
  2. 描述向非技术干系人解释复杂 ML 概念的场景。(Meta, 2024)
  3. 讲一次在数据不完整时做决策的经历。(Microsoft, 2023)
  4. 你如何处理与团队成员在模型设计选择上的分歧?(OpenAI, 2024)
  5. 描述一个反复迭代才使 ML 方案正常工作的项目。(Amazon, 2023)
  6. 讲一次你在问题变严重前识别并解决它的经历。(Apple, 2024)
  7. 你如何跟上快速演进的机器学习领域?(Google, 2023)
  8. 描述在多个竞争性 ML 项目间排序优先级的场景。(Meta, 2023)
  9. 讲一次你在 ML 项目中考虑伦理影响的经历。(Microsoft, 2024)
  10. 你如何吸收反馈改进 ML 模型或方法?(OpenAI, 2023)
  11. 描述在 ML 项目中平衡创新与务实实现的场景。(Google, 2025)
  12. 讲一次你坚持更复杂 ML 方案对抗更简单替代方案的经历。(Meta, 2025)
  13. 你如何与跨职能团队协作交付端到端 ML 方案?(Amazon, 2025)
  14. 描述在模型性能与公平/伦理考量间取舍的场景。(Microsoft, 2025)
  15. 讲一次根据新信息或约束转向 ML 方案的经历。(OpenAI, 2025)

面试准备建议

技术准备

  1. 复习 ML 基础:确保对核心 ML 概念、算法与数学有强理解。
  2. 练习编码:刷 ML 专项编码题与实现题(参考上文 ML 编码题清单)。
  3. 系统设计练习:建立一套应对 ML 系统设计题的框架。
  4. 保持前沿:阅读近期论文,理解 SOTA 方法,尤其是你专攻的方向。
  5. 理解 MLOps:熟悉部署、监控与生命周期管理。

面试策略

  1. 澄清需求:始终先问澄清性问题,界定问题范围。
  2. 结构化方法:系统设计与问题解决使用清晰框架。
  3. 出声思考:全程分享你的思考过程。
  4. 权衡显式化:主动讨论不同方案的利弊。
  5. 关联真实经验:把问题与你过去的工作联系起来。

公司专项准备

  1. 研究产品:理解目标公司的 ML 应用与产品。
  2. 读技术博客:读公司工程博客,理解其 ML 路线。
  3. 文化价值观:熟悉公司价值观与领导力准则。
  4. 近期创新:关注公司最近的 ML 研究或产品发布。
  5. 准备提问:备好关于团队、项目与成长空间的有质量提问。

学习资源

以下资源均为原文档收录的经典材料,按类型整理(名称即检索词,可自行查阅)。

推荐书籍

  • 《Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow》——O'Reilly 出版,实战主线
  • 《Deep Learning》——Ian Goodfellow、Yoshua Bengio、Aaron Courville(深度学习圣经)
  • 《Pattern Recognition and Machine Learning》——Christopher Bishop(PRML,数学主线)
  • 《Machine Learning Yearning》——Andrew Ng
  • 《The Hundred-Page Machine Learning Book》——Andriy Burkov

优质在线课程

  • Machine Learning(Andrew Ng,Stanford/Coursera)
  • Deep Learning Specialization(Coursera)
  • CS224n:Stanford 自然语言处理与深度学习
  • CS231n:Stanford 卷积神经网络视觉识别
  • Fast.ai Practical Deep Learning for Coders
  • Full Stack Deep Learning

面试练习平台

  • InterviewQuery
  • LeetCode(ML 专区)
  • Machine Learning Mastery
  • Educative.io ML 面试课程
  • StrataScratch

社区与信息源

  • Kaggle
  • ML subreddit
  • Hugging Face Papers(原 Papers With Code 已于 2025 年 7 月关闭,域名现已重定向至此)
  • AI Alignment Forum
  • ML Collective

与仓库其他指南的配合使用

原文档在本仓库中的定位是"ML 面试总纲",与仓库其他指南形成完整备战矩阵,建议按角色组合使用:

  • 通用 ML/算法岗:本文全部主题 + Blind-75.md 与 NeetCode-150.md(数据结构与算法轮)+ SYSTEM_DESIGN_INTERVIEW.md(系统设计轮)。
  • LLM/AI 研究岗:重点攻克本文 LLM、RAG/Agent、RL 后训练三章,并配合 LLM_PAPERS_CHEATSHEET.md 的 96 篇论文速查表(按 Essential → Interview Favorite 信号排序阅读);面试"从零实现注意力/分词/采样"类题目时,可在 PythonResources.md 中补充编程基础。
  • AI 实验室岗(OpenAI、Anthropic、DeepMind、Mistral、xAI):除本文六家公司流程外,重点研读 AI-Companies-Interview-Questions.md——据该文档记载,这些实验室的面试"看起来完全不像 FAANG":DeepMind 有 2 小时速问轮(CS + 数学 + 统计 + ML 四个子节)、xAI 有监考 CodeSignal 与并发规模扩展追问、Mistral 有 LLM 知识测验与从零 ML 编码、Amazon AGI 有 Transformer 调试轮。
  • 紧跟 2026 趋势:AI 辅助轮次的政策差异(Meta/Google/LinkedIn/DoorDash 允许、Amazon/DeepMind/ByteDance/Palantir 禁止)、推理实验室、独立 MLOps 模块等新形式,详见 FAANG-Recent-Questions.md 与 README.md 的 2026 变化章节。

最后提醒:本文所有题目与流程信息均源自仓库 ML_INTERVIEW_PREP.md(截至 2026 年 10 月版本)。面试政策变化极快——尤其是 AI 辅助轮次的允许范围与公司价值观定义——正式面试前务必与招聘官确认当前格式,并以仓库持续更新的 FAANG-Recent-Questions.md 与 AI-Companies-Interview-Questions.md 为最新依据。

登录后查看全文
FAANG-Coding-Interview-Questions