
人工智能这门课的期末考试有个很典型的特点它不难但你很难靠背拿高分。同一张卷子上前半部分可能是生物智能、人工智能、计算智能的层次关系这种纯概念判断中间突然来一道 A* 搜索的手算或者朴素贝叶斯求后验概率最后再来一段谈谈你对人工智能偏见的理解的论述题。三种题型对应三种完全不同的能力如果你只用一种方法去应付大概率会在某一块上丢掉一整片分数。我前后帮不少同学过过这门课的复习自己也整理过几轮题库最深的感受是人工智能期末刷题的关键不在于刷了多少道而在于有没有把题目按考什么能力重新分类。概念题靠记忆锚点计算题靠固定套路论述题靠答题骨架——把这三件事分开处理复习量能砍掉一半分数反而更稳。下面这份整理就是按这个思路来的里面有一部分题配了答案和解析也把每类题该怎么刷讲透不管你是平时跟着听课的还是考前三天才开始翻书的都能直接拿去用。1. 先搞清楚这张卷子到底在考什么很多人复习人工智能的第一反应是打开课件从第一页往下翻翻到第三章就放弃了。问题不在于懒而在于没有先看清整张卷子的结构。我见过的人工智能期末试卷基本都遵循一个很稳定的配方概念判断占三到四成计算推导占三到四成简答论述占两到三成。这三个板块的复习方法完全不通用必须先拆开。1.1 三块分数的分布规律拿一份典型的 100 分卷子举例大概是这个比例板块常见分值典型题型复习方式概念与选择30-40 分单选、多选、判断、填空记忆锚点 对比辨析计算与推导30-40 分搜索算法手算、概率计算、信息增益、前向传播固定套路 反复手写简答与论述20-30 分流程描述、方法对比、开放观点要点骨架 关键词覆盖这个表格最值得注意的一点是计算题的分值比重跟概念题几乎持平但它需要的复习时间其实更少。原因很直接——计算题的解法是有限的。搜索就那么几种、贝叶斯就一个公式、信息增益就是熵的减法、神经元前向传播就是加权求和加激活函数。你把五六种套路练熟这四十分基本就是白送的。反倒是概念题题库可以出几千道永远刷不完。所以合理的顺序是先把计算题的几套模板吃透锁定那三四十分再拿剩下的时间去做概念辨析。这个顺序跟大部分人的直觉是反的但对提分的效率差别非常大。1.2 大作业和考试的关系比你想的更紧还有一个经常被忽略的点这门课的大作业比如猫狗识别、垃圾邮件分类、手写数字识别这类和期末考试的重合度往往很高。老师在大作业里让你走过的流程——数据清洗、特征提取、模型选择、训练、评估——很容易原封不动地变成一道简答题题干就是请简述一个完整的机器学习项目流程。我建议在复习的时候把自己做大作业的整个过程用文字复述一遍每一步为什么这么做、遇到什么问题、怎么解决的全部写下来。这份东西在考场上几乎可以直接用而且比课本上的标准答案更有说服力。很多同学大作业是抄的或者跑通就丢等到考试写简答题的时候一句都憋不出来这是白扔分。1.3 认证类考试和校内期末的差别顺带说一句如果你同时还在准备人工智能训练师或者各类人工智能基础认证这两类考试的侧重点不一样。校内期末更偏原理喜欢考为什么和手算认证类考试更偏应用喜欢考什么场景用什么方法某个术语的定义。术语定义这一段是可以共用的但计算部分在认证考试里权重低得多。别拿一套材料硬套两场考试容易两边都不讨好。2. 概念题的记忆锚点ABC 理论和它的邻居们概念题是人工智能期末里最虚的一块也是最容易拉开差距的一块。它的难点不是记不住而是记住之后一组题目换个问法就认不出来了。解决办法是给每个概念找一个锚点——一个能让你在考场上立刻还原出完整定义的小线索。2.1 生物智能、人工智能、计算智能的层次关系这道题的出题率极高几乎每个版本的人工智能导论都会考。常见的考法是判断层次顺序或者让你解释三者关系。我用的锚点是原型—模仿—工具这三个词。生物智能是原型也就是人类和动物身上天然具备的智能它是最高层次的、最复杂的自然现象至今没有人能完全解释清楚它的运作机制。人工智能是模仿人类试图用机器去复现生物智能表现出来的那些能力比如推理、学习、感知。计算智能是工具它是人工智能里面偏软计算的那一支典型代表是模糊逻辑、神经网络、进化计算这几类方法特点是允许不确定性、不追求精确解、靠迭代逼近。需要特别提醒的是不同教材对这三者的表述不完全一致。有的教材把计算智能视为人工智能的一个分支有的教材把计算智能视为独立于传统人工智能的第三条路线符号主义、连接主义之外的第三条。答题时优先按你自己课上用的教材表述来写如果记不清就用计算智能是人工智能发展到一定阶段后形成的一个分支它的核心是模拟生物智能中的自适应和自组织机制这个相对安全的说法一般都能拿到基本分。2.2 符号主义、连接主义、行为主义这三条线这三个词也是高频考点而且特别容易混。我给的锚点是往一句话上靠符号主义靠规则连接主义靠数据行为主义靠互动。符号主义核心假设是智能可以用符号和规则来表示典型代表是专家系统、逻辑推理、知识图谱。优点是解释性强缺点是遇到需要感觉的任务就歇菜。连接主义核心假设是智能来自大量简单单元的连接典型代表就是神经网络和深度学习。优点是能处理图像语音这类难以用规则描述的问题缺点是黑箱、需要大量数据。行为主义核心假设是智能体现在与环境的交互中典型代表是强化学习和各类智能体。优点是能处理序贯决策问题缺点是在真实环境中训练成本高。考试里常见的问法是某技术属于哪条路线或者三条路线各自解决了什么问题。判断的时候看它的核心机制是什么用规则推的叫符号主义用网络算的叫连接主义用奖励反馈试错学出来的叫行为主义。2.3 本体论、知识表示这类词别硬背本体论这个词特别唬人很多人看到就慌。其实在人工智能语境里本体论就是一个形式化的概念体系说白了就是把某个领域里的概念、属性、以及概念之间的关系用机器能读的方式描述出来。你可以把它理解成给机器准备的一本带交叉索引的词典。考场上如果记不住学术定义就用这个通俗版本再补一句它是知识图谱和语义网的基础这两句话凑起来基本能覆盖大部分填空题。搭知识图谱的时候本体就是先设计的那一层 schema决定了你要抽哪些实体、哪些关系这一步做不好后面全是返工。2.4 几道可以自测的选择题下面几道是我从题库里挑出来的答案附在后面你可以先自己做一遍。下列哪一项不属于人工智能的典型应用领域 A. 机器翻译 B. 图像识别 C. 关系型数据库的增删改查 D. 语音合成在搜索算法中既能保证找到最优解、又比盲目搜索效率更高的是 A. 深度优先搜索 B. 宽度优先搜索 C. A* 搜索 D. 随机搜索关于监督学习和无监督学习下列说法正确的是 A. 两者的区别在于是否使用神经网络 B. 监督学习需要带标签的数据 C. 无监督学习的样本量一定更大 D. 聚类是监督学习的一种神经元模型中激活函数的作用是 A. 增加参数数量 B. 引入非线性 C. 提高运算速度 D. 归一化输入答案1-C数据库增删改查属于传统软件功能不是人工智能要解决的智能问题2-C3-B4-B。第 1 题和第 4 题是最容易失分的类型。第 1 题错的人往往是因为数据库也有智能优化想了太多但考的是应用领域划分不要过度推理。第 4 题如果只记住激活函数是 sigmoid没理解它的意义换成 ReLU 问就答不出来了核心永远是引入非线性——没有激活函数多层网络叠起来等价于一层线性变换。3. 计算题的几套固定套路练熟就是送分计算题是不能靠临场发挥的因为它有明确的步骤步骤错了答案就没分。好在这类题的数量非常有限我统计过常见的就五类搜索算法、贝叶斯、信息熵与信息增益、神经网络前向传播、KNN 或 K-means 的简单计算。每一类花半小时手写两三遍基本就固化了。3.1 A* 搜索f g h 的手算流程A* 是搜索题里出现频率最高的因为它是唯一一个既考了搜索过程、又考了启发函数的算法。手算的步骤是固定的建两个表OPEN 表待扩展和 CLOSED 表已扩展。把起点放进 OPEN算出 f g h 写进去。从 OPEN 里取出 f 最小的节点放进 CLOSED扩展它的所有邻居。每个邻居算出新的 g从起点的实际代价和 h到终点的估计代价如果这个 g 比它在 OPEN 里已有的 g 更小就更新它。重复第 3、4 步直到取出终点结束。举个具体的小例子。假设有四条边的图S→A 代价 2S→B 代价 3A→G 代价 4B→G 代价 1。启发函数给出 h(S)5h(A)3h(B)1h(G)0。第一轮S 进 OPENf(S)055。取出 S扩展得 Ag2f235和 Bg3f314。 第二轮OPEN 里有 A(f5) 和 B(f4)取 f 最小的 B。扩展 B 得 Gg314f404。G 进 OPEN。 第三轮OPEN 里有 A(f5) 和 G(f4)取 G它是终点算法结束最优路径 S→B→G总代价 4。这里有个特别值得注意的细节启发函数 h 必须满足不高估可采纳性A才能保证找到最优解*。上面这个例子里 h(B)1 就是到 G 的真实代价刚好不高估所以结果是对的。如果题目故意给了一个高估的 h你要能指出它不再保证最优——这种故意挖坑的题在期末里很常见专门用来区分是不是真懂了。3.2 朴素贝叶斯先写公式再代数字贝叶斯题的难度不在计算而在很多人考场上慌了忘了分母怎么求。固定套路是P(A|B) P(B|A) × P(A) / P(B)分母 P(B) 用全概率公式展开P(B) P(B|A)×P(A) P(B|¬A)×P(¬A)。典型例题某种疾病的患病率是 1%检测方法的灵敏度是 99%有病的人检出阳性的概率假阳性率是 5%没病的人被误判阳性的概率。某人检测结果为阳性他实际患病的概率是多少代入P(D)0.01P(¬D)0.99P(|D)0.99P(|¬D)0.05。 P() 0.99×0.01 0.05×0.99 0.0099 0.0495 0.0594。 P(D|) 0.0099 / 0.0594 ≈ 0.1667也就是约 16.7%。这个结果第一次看会觉得很反直觉——灵敏度 99% 的检测阳性了居然只有不到两成的概率真患病。原因在于基础患病率太低假阳性在绝对数量上压过了真阳性。考试里如果题目后面跟着一句请解释这个结果的现实意义你就写这句话分就稳了。计算的时候有个小技巧把百分比全部换成小数再算最后再换回百分比中间不要跳步。很多丢分是心算换算出错不是公式不会。3.3 信息熵与信息增益熵就是混乱程度的度量信息熵的公式是 H -Σ p·log₂p。手算的时候只需要记两个常用的值log₂0.5 -1log₂0.25 -2。比如一个数据集有 12 个正例、4 个负例共 16 个样本。正例比例 0.75负例比例 0.25。 H -(0.75×log₂0.75 0.25×log₂0.25) -(0.75×(-0.415) 0.25×(-2)) 0.311 0.5 0.811。如果正负各 8 个那就是 H -(0.5×(-1) 0.5×(-1)) 1正好 1 比特这也是最混乱的情况。信息增益 划分前的熵 − 划分后各子集熵的加权和。加权用的权重是子集样本数占总数的比例。手算题的步骤就是算根节点熵然后对每个候选特征分别算划分后的加权熵一减谁大选谁。这里有个容易被扣分的细节加权的时候权重是子集样本数 ÷ 总样本数不是简单平均。很多人图快直接除以特征取值个数结果整道题全错非常可惜。3.4 神经网络前向传播加权求和加激活这类题看着唬人实际就是算术。以一个两输入的神经元为例输入 x[1, 0]权重 w[0.5, -0.3]偏置 b0.2激活函数用 sigmoid。第一步算净输入z 0.5×1 (-0.3)×0 0.2 0.7。 第二步过激活函数sigmoid(0.7) 1 / (1 e^(-0.7)) ≈ 1 / (1 0.4966) ≈ 0.668。如果题目给的是多层就一层层往前推上一层的输出作为下一层的输入。sigmoid 在考场上不好精确计算一般题目会给出 e 的取值表或者允许近似遇到算不尽的情况就保留两位小数同时把公式写全过程分通常给得比较宽松。有个坑要提醒如果题目给的是 ReLU负的净输入直接输出 0这时候不要惯性套 sigmoid。我在群里见过不止一个人因为这个把整道题做废。4. 简答和论述题把课本话术拆成打分的要点简答题是人工智能期末里投入产出比最高的一块。因为它不要求你有原创观点只要求你覆盖到关键要点而要点是可以提前准备的。真正的难点在于很多人答题时写了一大段但要点只踩中一两个阅卷老师一句要点不全就扣掉一半分。4.1 机器学习流程题的标准骨架请简述一个完整的机器学习项目流程这类题几乎年年有。我的骨架是六步每一步配一句解释问题定义明确是分类、回归还是聚类输入输出是什么评价指标用什么。数据获取与清洗采集数据处理缺失值、异常值、重复值这一步通常最耗时间。特征工程提取、筛选、构造特征做归一化或标准化。模型选择与训练按问题类型选模型划分训练集验证集训练参数。评估与调优用准确率、精确率、召回率、F1 等指标评估针对过拟合欠拟合做调整。部署与迭代上线后持续监控用新数据重新训练。写的时候把六步的标题先列出来再各补一句话比写成一大段流水账更容易被找到得分点。另外评价指标那一步一定要提不能只看准确率特别是在类别不平衡的场景下要提到精确率、召回率和 F1这是拉开档次的细节。4.2 过拟合、欠拟合这类对比题怎么答这类题的标准答法是现象 原因 解决。以过拟合为例现象是模型在训练集上表现很好、在测试集上明显变差原因是模型过于复杂或者训练数据太少把噪声也学进去了解决办法是增加数据、正则化L1/L2、Dropout、早停、简化模型结构、交叉验证。欠拟合反过来两边表现都差原因是模型太简单或者特征不足解决办法是增加模型复杂度、增加特征、减小正则化强度、延长训练。答题技巧是成对写把过拟合和欠拟合摆在一起对照阅卷时一眼就能看到你两个都懂比单独写一个要占便宜。这种对比式作答在概念题里同样适用。4.3 论述题模型偏见这种开放题怎么拿分谈谈人工智能偏见这类论述题最忌讳写成价值观输出。它本质上是技术题得分点在于你能不能把偏见的来源讲清楚。我一般按三层来写。第一层是数据层训练数据的采样偏差、历史数据本身就带有的不平衡、标注环节的主观差异都会让模型学到不正确的关联。第二层是模型层模型会放大数据中的统计规律尤其当某些特征与标签在训练集中存在虚假相关时模型会把这种相关当作规律记住。第三层是应用层模型部署后被用在训练时没覆盖的人群或场景上误差被进一步扩大。然后给一句缓解思路数据层面做重采样和均衡、模型层面做公平性约束、评估层面针对不同子群分别看指标不能只看总体准确率。这三层加一句缓解是这类题的通用骨架换成算法歧视模型可解释性也基本能套。说到人工智能训练师这个职业画像如果考题出现答题思路类似核心工作不是写模型而是数据标注与质量管理、模型效果评测、场景落地支持。把它和算法工程师区分开是这类题的得分点——算法工程师负责设计模型训练师负责让模型在具体业务里跑得对、跑得稳。5. 不同剩余时间下的刷题节奏同样的题库剩七天和剩一天刷法完全不一样。我按自己的经验整理了三套方案你对号入座就行。5.1 还有七天分块推进七天时间比较充裕可以按计算题优先的原则来。前两天专攻计算题的五个类型每一类找三到五道题手写一遍写完立刻对答案把错的步骤圈出来。第三天到第四天做概念题的批量刷题重点是错题每道错题都要写一句我为什么错是概念记混了还是问法没读懂。第五天准备简答论述把常见题目的骨架默写一遍。第六天做一整套模拟严格计时。第七天只看错题本不碰新题。这里强调一点最后一天不要碰新题。新题只会制造焦虑而且临考记忆最容易被新信息干扰导致原本记住的东西也变模糊。看错题本是最稳的。5.2 还有三天掐掉概念题的题海三天时间不可能刷完概念题库所以策略要变。第一天把计算题的五套模板过一遍保证手不生。第二天主攻高频概念对比三条路线、三类学习方式、监督与无监督、过拟合与欠拟合准备简答骨架。第三天做一套完整真题找节奏然后看错题。三天方案的关键是接受一定范围的放弃。低频的细碎概念选择放弃把时间压在高频的、能形成肌肉记忆的内容上。听起来像赌博但比面面俱到然后什么都记不牢要划算。5.3 还有一天只做三件事一天时间只做三件事。第一把计算题的公式抄在一张纸上A* 的 fgh、贝叶斯、信息熵、sigmoid抄完默写两遍。第二把高频概念的锚点过一遍不求全只求每个词能说出一句准确定义。第三背熟简答题的三个通用骨架机器学习流程六步、过拟合欠拟合对比、偏见三层来源。这一天不要去啃新章节也不要做没答案的题。焦虑主要来自还有好多没看的感觉而正确的做法是用已经掌握的东西给自己吃定心丸。6. 带答案的题目怎么用才不浪费题库里有一部分题是带答案的有一部分没有。这两类题的处理方式完全不同用错方法的话带答案的题反而会拖后腿。6.1 有答案的题先做后对标记错因带答案的题最大的价值不是看答案而是验证思路。正确顺序是先自己完整做一遍哪怕是选择题也要写一句理由再对答案然后如果错了必须写一句错因比如把信息增益和基尼指数搞混了忘了分母要用全概率展开。我强烈建议不要一边看答案一边做。这个习惯带来的我很流畅的错觉非常致命考场上没有答案可看思路链条直接断掉。判断自己是不是真会了唯一的标准是遮住答案能不能从零写到结果。另外带答案的题要特别留意那些答案对但过程和你不一样的题。如果解析里的步骤更简洁就把它吸收进来如果解析的过程你看不懂不要硬背先回去翻讲义。背下来的解法在遇到变形题时一定会翻车。6.2 没答案的题自己造答案再交叉验证没有答案的题不是不能做而是要换个身份做。我的做法是自己写完答案后去课件或者教材里找对应的知识点核对看自己有没有漏掉关键要点。这个过程本身就是最有效的复习因为你在主动地把零散的知识点组织起来比被动看解析的记忆深度高得多。如果是计算题没答案可以用程序验证。比如 A* 的路径结果写十几行 Python 就能跑出来对一遍贝叶斯的后验概率用计算器验一下矩阵运算用 numpy 十几秒就能出结果。花在写验证脚本上的十分钟比对着不放心的答案纠结半小时划算得多。下面这段就是我当时用来验证 A* 结果的简化脚本思路很朴素但足够应付期末这种小规模图import heapq graph { S: [(A, 2), (B, 3)], A: [(G, 4)], B: [(G, 1)], G: [] } h {S: 5, A: 3, B: 1, G: 0} def astar(start, goal): open_list [(h[start], 0, start, [start])] seen {} while open_list: f, g, node, path heapq.heappop(open_list) if node goal: return path, g if node in seen and seen[node] g: continue seen[node] g for nxt, cost in graph[node]: heapq.heappush(open_list, (g cost h[nxt], g cost, nxt, path [nxt])) return None, None print(astar(S, G))跑出来是([S, B, G], 4)和手算一致。这种验证方式的另一个好处是如果题目里的启发函数是高估的脚本跑出来的结果可能和理论最优不一致这时候你就能直观地看到问题在哪里比死记可采纳性这个概念有用得多。6.3 错题本怎么记才有效错题本最容易变成抄题本抄完再也不看。我的做法是只记三样东西题干的一句话概括、我错在哪一步、正确思路的一个关键词。不抄完整题目也不抄完整解析逼自己在复习时靠这三个线索把整道题回忆出来。回忆得出来就是真会了回忆不出来说明线索给得不够再补一条。一本有效的错题本考前一天应该能在半小时内翻完。如果你翻了两小时还没翻完说明记得太啰嗦删掉一半也不影响效果。7. 考场上真正会丢分的地方复习做到位了最后还可能有意外失分。下面这几个是我观察到的、跟知识掌握程度无关的丢分点但每年都在发生。时间分配上我建议按分值走选择题和填空题控制在总时间的 25% 以内计算题给到 40%简答论述给到 30%剩下 5% 检查。计算题容易陷进去尤其是 A* 这种要画表的一画就是十几分钟很容易挤掉后面论述题的时间。如果一道计算题超过预定时间两倍还没算完先跳到下一题把能拿的分先拿稳回头再补。誊写答案的时候计算题一定要写清中间步骤。哪怕最后结果算错了只要 fgh 的展开、贝叶斯的代入过程写全了过程分通常不会全扣。反过来只写一个结果错了就是零分。这一点在贝叶斯和信息熵的题上尤其明显。还有一个特别隐蔽的坑题干里的简述和详述要看清楚。简述题写三四行关键词就够写一大段反而会掩盖要点详述题只写关键词会被判要点不全。这两种要求的作答方式完全不一样别用同一套。最后提一句关于复习资料的选择。网上流传的人工智能期末题库质量参差不齐尤其是带答案的那些有些答案本身就是错的。判断一份题库值不值得刷最简单的标准是看它的解析有没有说明为什么其他选项不对。只给答案不给理由的一律当作练习题用不要当作标准答案背。真正靠得住的还是自己课上的讲义和教材题库只是用来检验你掌握程度的工具顺序不能反。我自己带复习的时候有个习惯最后一晚不看书只在纸上默写那几套计算题的公式和三个简答骨架写完就睡。这个方法陪我从本科一路用到现在准备各类认证效果比熬夜翻书好得多——第二天的状态本身就是分数的一部分。