章节大纲
-
平时成绩:总成绩的30%,6 次平时测验(选择题为主,实验课最后半小时-一小时测验)
6 次测试内容
test1 含KD-tree之前 test2 朴素贝叶斯 SVM test3 决策树 集成学习 test4 DNN CNN test5 RNN test6 Transformer test123的难题(test总分的30%)出自:cs189 midterms exams: Without solutions: Spring 2013, Spring 2014, Spring 2015, Fall 2015, Spring 2016, Spring 2017, Spring 2019, Summer 2019, Spring 2020 Midterm A, Spring 2020 Midterm B, Spring 2021, Spring 2022, Spring 2023, Spring 2024. With solutions: Spring 2013, Spring 2014, Spring 2015, Fall 2015, Spring 2016, Spring 2017, Spring 2019, Summer 2019, Spring 2020 Midterm A, Spring 2020 Midterm B, Spring 2021, Spring 2022, Spring 2023, Spring 2024.
cs189 final exams. Without solutions: Spring 2013, Spring 2014, Spring 2015, Fall 2015, Spring 2016, Spring 2017, Spring 2019, Spring 2020, Spring 2021, Spring 2022, Spring 2023, Spring 2024. With solutions: Spring 2013, Spring 2014, Spring 2015, Fall 2015, Spring 2016, Spring 2017, Spring 2019, Spring 2020, Spring 2021, Spring 2022, Spring 2023, Spring 2024.
test其他可能的出处:每节课开始的复习(提示词)、2024年旧作业、教材习题例题
平时成绩加分:新出或测试上述题库质量的题目,每个题目平时成绩加1分;申请 mindspore 在线实习https://www.mindspore.cn/internship并完成任意积分任务平时成绩加到满分(平时成绩100分加满为止)。通过PR合并申请认证优秀开发者平时成绩加到满分,其他加5分https://www.mindspore.cn/developers/#applicationProcess。;翻转课堂或复习课加分待定

考勤主要由 test 是否参加体现。
期末考试:总成绩的70%,出处题库:同平时测验(大题为主);每节课开始的复习(提示词)、2024年旧作业旧试卷、教材习题例题
1.传统机器学习24分 模型评估(AB 卷均考);k近邻kd-tree、朴素贝叶斯、SVM、决策树、集成学习、无监督学习(AB 卷分别 6 考 2,其余4出客观填空题)
2.DNNCNN 22分 (传统机器学习的 梯度下降、逻辑回归、感知机通常合并在此考)
3.RNN 12分
4. Transformer 12分
1234分值为计算题(7道70分),另有10%客观题(10分5道填空)。
5. 实验程序填空题 20分 :必背mindspore/pytorch模板考 10 分代码填空 (AB 卷均考),另外10分AB卷考实验内容ex03 resnet make_layer函数相关 或 ex05 Seq2Seq attention类相关。
实验课:代码及报告84% 实验课答辩恢复代码16% 。本学期实验课答辩流程1.先看 report 2.再查代码 3.再查pr记录命名 4.再删代码 答辩 有一步没合格就重新排队 其他人开始新一轮答辩。老师或助教 删除 3-5 行(可以是模板行) :2 分钟内完全写不出、或思路错 85;思路对 2 分钟没有调出来估计还要很久的 90 ; 虽然2分钟没有调试出来但是是小错 估计很快就能完成的90 ;2分钟调试出来了 95 ;很快几乎不用调试 100)。deadline为一周后。每迟交 24 小时扣 4%,迟交超过6天 最高为 60%(84-4*6=60)。
实验成绩加分:可选任务加分移植ipynb到modelarts AI Gallery 5%(必须LLM或Transformer相关,内容质量必须高于已有AI Gallery,推荐结合 Deepseek API )。mindspore相关微认证 每个加2分。其他华为人工智能微认证每个加1分(实验加分最多 4 分)。https://edu.huaweicloud.com/certifications
作弊平时测验(现场打字屏幕显示你位置前后几排左数右数第几个作弊),本次计分-200分。相当于1次抄袭/作弊,基本等价3次平时测验0分(总共6次)。抄袭实验,双方本次计分-100分。相当于1次抄袭,基本等价2次实验没完成0分(总共6次)。发生抄袭,虽然没有直接不允许参加考试,但是此时总成绩通过则需要其他次作业实验和考试成绩均达到较高的分数。请所有人足够重视,我们会检索互联网,同学间互相比对等手段,请勿心存侥幸。可以讨论idea思路,请勿传递作业或复制粘贴,你无法控制别人怎么使用你的作业、实验内容。
【腾讯文档】2026春机器学习成绩登记
https://docs.qq.com/sheet/DZnVuQUJrcmhjTXFt?tab=BB08J2-
-
算法 模型假设 损失函数 优化方法 朴素贝叶斯 特征条件独立(给定类别下特征独立) 对数似然损失(最大似然估计) 极大似然估计(或EM算法处理缺失值) SVM 数据线性可分(或通过核函数映射到高维可分),最大化分类间隔 Hinge Loss + L2正则化项 拉格朗日对偶 + SMO(序列最小优化) 集成学习 - 随机森林:特征子集独立性
- GBDT:残差逐步拟合- 随机森林:基尼系数/信息增益
- GBDT:自定义损失(如平方损失、对数损失)- 随机森林:Bagging
- GBDT:梯度下降(加法模型)PCA 数据在低维线性子空间上方差最大 重构误差最小化(或协方差矩阵特征值最大化) 特征值分解(或SVD) K-Means 数据呈球形分布,簇内紧密 样本到簇心的平方距离和(SSE) EM算法(迭代更新簇心与样本分配) 逻辑回归 数据线性可分,通过sigmoid映射概率,二分类任务 交叉熵损失(对数损失) 梯度下降(或拟牛顿法) softmax回归 数据线性可分,通过softmax映射概率,多分类任务 交叉熵损失(对数损失) 梯度下降(或拟牛顿法) 线性回归 数据成线性分布,回归任务 平方误差 最小二乘/随机梯度下降 DNN 多层非线性变换可拟合复杂函数 任务相关(如交叉熵、均方误差) 反向传播 + 梯度下降变体(如Adam、SGD) CNN 局部相关性、平移不变性(通过卷积核和池化) 任务相关(如交叉熵) 反向传播 + 梯度下降变体(如Adam) RNN 序列数据的时间依赖性(通过循环结构传递状态) 交叉熵(序列预测任务) BPTT(随时间反向传播)+ 梯度截断/Adam Transformer 全局依赖关系通过自注意力机制捕获 交叉熵(带掩码的序列预测任务) Adam优化器 + 学习率预热(如Noam调度) - 机器学习6步骤3要素
- 以垃圾邮件分类为例,出一道查准率(precision).查全率(recall)的计算题。试述真正例率(TPR).假正例率(FPR)与查准率(precision).查全率(recall)之间的关系。出一道多项选择题。
- 写出绘制PR曲线的伪代码
-
在微分多元函数时经常使用以下规则:
- 对于所有A∈Rm×n,都有∇xAx=A⊤
- 对于所有A∈Rn×m,都有∇xx⊤A=A
- 对于所有A∈Rn×n,都有∇xx⊤Ax=(A+A⊤)x
- ∇x∥x∥2=∇xx⊤x=2x
同样,对于任何矩阵X,都有∇X∥X∥F2=2X。利用第一条和(导数加减乘除法则)推导其他。
- 尝试写出函数u=f(x,y,z),其中x=x(a,b),y=y(a,b),z=z(a,b)的链式法则。
-
推导出使用平方误差的线性回归优化问题的解析解。为了简化问题,可以忽略偏置(我们可以通过向添加所有值为1的一列来做到这一点)。
-
用矩阵和向量表示法写出优化问题(将所有数据视为单个矩阵,将所有目标值视为单个向量)。
-
计算损失对的梯度。
-
通过将梯度设为0、求解矩阵方程来找到解析解。
-
什么时候可能比使用随机梯度下降更好?这种方法何时会失效?
-
- 会求sigmoid和softmax梯度。并理解Sigmoid 导数只是 Softmax 导数在二维互斥空间下的一个特例。
- 给定一个分布P算此分布的熵
- 给定独一编码y和预测的概率分布y_hat, 计算交叉熵
- 求交叉熵损失的梯度
- 背 pytorch mindspore必背模板,能写或调库实现批量梯度下降
- 教材2算法3.2 3.3,例3.2 3.3给定坐标能建kd树,给定新坐标能写对kd树遍历顺序能知道何时遍历终止。
- 模仿教材2例题 4.1 更改值。出朴素贝叶斯分类器计算填空题。
- 模仿教材2 例题 5.2 更改数值后 出一道填空题 随机考一种属性划分 计算信息增益 ;不用让他们重复计算每一种划分。
- 教材2算法 5.2 出一道 排序题
- 教材2算法 5.3 出一道 排序题
- 模仿教材2 例题 5.4 更改数值后 出一道填空题 随机考一种属性划分 计算Gini;不用让他们重复计算每一种划分
- 出一道 6 个选项的单选题,给定一个比较明显的数据,让学生用 ID3 生成决策树,选择正确的树。主要考察学生对决策树算法的理解,即使不计算数值,也能估算最后的决策树。
- 模仿教材2例题 7.1 让学生利用几何方法直接求 svm最 ⼤ 间 隔 分 离 超 平面方程。多选题。
- 模仿教材2例题 7.2 更改点坐标 让学生 计算对偶问题展开化简过程。出填空题。
- svm 求解分哪几步(对偶问题求解步骤)。
- 出一道多项选择题,下面哪些问题是凸优化问题。
- 出一道多选题,svm 对偶问题的 KKT 条件,下面给出的哪些是正确的?给 10 个选项条件 诺干错 剩余对。
- 模仿教材2 例题 8.1 更改数值后 出一道提升方法填空题 挖多个空 考一次更新权重过程即可
- 出一道 计算 题 考d2l教材公式6.3.2
- 已知模型网络架构 求上述模型参数量

- RNN 会考2024试卷 同类型计算题
- 掌握编程搭建全连接网络、CNN、RNN、Transformer几种网络中,只有CNN需要计算(或特殊方法)每一层网络部件的输入输出大小的方法和原因。
-
网络类型 尺寸变化特点 是否需要计算中间层大小 为什么? CNN 非线性缩水 是 卷积、池化的步长和边缘填充导致空间尺寸复杂变化,且全连接层需要精确的展开一维尺寸。 MLP 自定义映射 否 尺寸完全由开发者主观定义(如 128 -> 64)。 RNN 时间轴复用 否 结构在时间步上共享,隐状态维度固定。 Transformer 形状保持 否 为了残差连接,每一层都强制保持 $d_{model}$ 维度一致。 
- word2vec工具包含跳元模型和连续词袋模型,出一道moodle匹配题,把多种不同性质、公式归属到跳元模型或连续词袋模型。
- 出一道moodle排序题(嵌入式完型题),考察近似计算中相关公式推导,排序块有些公式是错的,需要学生选择正确的公式,然后再按照推导过程排序。
-
NLP 预训练方法对比表
模型/方法 自监督任务 模型架构 损失函数 优点 缺点 Word2Vec
(Skip-gram)
局部上下文预测:利用中心词预测周围的上下文词。 浅层线性网络(无隐层激活),包含中心词和上下文两张嵌入矩阵。 原始:Softmax 交叉熵
实际:带负采样的二元交叉熵或层级 Softmax。
训练速度快;能有效捕捉词与词之间的语义相似度与类比关系;生僻词表现优于 CBOW。 静态词向量,无法解决一词多义(Polysemy)问题;无法处理未登录词(OOV)。 Word2Vec
(CBOW)
局部上下文预测:利用周围的上下文词预测中心词。 浅层线性网络,将上下文词向量求和或取平均作为输入去预测中心词。 与 Skip-gram 相同(通常用负采样进行二分类近似)。 训练速度比 Skip-gram 更快;对高频词的预测更为准确。 静态词向量,无法解决一词多义;因平滑了上下文,对低频词/生僻词效果较差。 GloVe 全局词共现矩阵分解:拟合全局语料库中“词-词共现矩阵”的概率比值。 基于全局统计的矩阵分解线性架构。 加权平方误差损失(带权重函数 $f(X_{ij})$ 防止高频词主导)。 结合了全局统计信息与局部窗口优势,在词向量相似度和类比任务上表现更鲁棒。 依然是静态词向量,无法根据上下文动态调整语义。 FastText 引入子词的局部预测:与 Skip-gram 类似,但将词拆分为多个字符级 $n$-gram。 基于 Skip-gram,词的最终向量由其所有 $n$-gram 子词向量叠加求和构成。 带负采样的二元交叉熵损失。 完美解决**未登录词(OOV)**问题;对形态学丰富的语言(如德语、芬兰语)和拼写错误泛化力强。 引入大量子词导致内存和显存开销极大;依然属于静态词向量。 BERT 1. 掩码语言模型 (MLM):双向完形填空。
2. 下一句预测 (NSP):句子对关系二分类。
多层双向 Transformer 编码器(Transformer Encoder)。 联合多任务损失:MLM(多分类交叉熵) + NSP(二分类交叉熵)。 生成动态上下文词表示,彻底解决一词多义;双向特征捕捉能力极强,微调下游任务效果惊艳。 算力消耗极其庞大;预训练引入的 [MASK]标记导致预训练与微调之间存在非对称性;不擅长文本生成。GPT-1 自回归语言模型(Causal LM):单向自左向右,根据上文预测下一个词。 多层单向 Transformer 解码器(Transformer Decoder,带掩码的自注意力)。 标准的自回归多分类交叉熵损失(通过上文预测当前词)。 完美契合文本生成任务;预训练与下游微调的输入形式一致,无非对称性(Mismatch);开创了生成式预训练(Generative Pre-training)范式。 单向架构,在提取特征时无法看到“右边”的上下文,对于阅读理解、序列标注等需要全局上下文的任务弱于 BERT。
-
-
