章节大纲
-
-
-
-
下载作业文件”ps4.pdf“,将答案按题号顺序 写在A4纸里,写上学号姓名。4月16号前,学委收集好交到工二413。
禁止抄袭,若发现将会严重影响课程成绩。
注意:卷积的计算公式中,padding是要乘2的,也就是在图像的左右上下加padding
-
抱歉各位同学,由于我的疏忽,第三次作业3,4两道题有些问题,现在将修改后的作业上传,同学们下载下来做就好
还是按顺序写在A4纸上,学委收好之后周五前交到工二413
禁止抄袭,否则取消成绩
-
-
补充评分说明:对于截图中字太小以至于用27寸大屏都要贴上去才能勉强看见的作业,都扣5分卷面分以告慰我发胀的眼睛和想yue的大脑。
下载作业文件后命名为“学号_姓名_ps1”,(建议用Jupyter Notebook)完成代码并运行。将代码及运行结果全部截图后按题号顺序放在一个word或pdf文档里提交,首张截图需包含带有学号姓名的文件名。禁止抄袭和直接复制粘贴。
-
-
老师助教在线时间:qq 群每周二下午14点到16点,其他回复时间随机。禁止直接问原题、禁止直接贴题目答案。允许对具体知识点提问和回答。
-
-
1.教材mindspore代码算力openi
您的好友正在邀请您加入OpenI启智AI协作平台,畅享充沛的普惠算力资源(GPU/NPU/GCU/GPGPU/DCU/MLU)。 注册地址:https://openi.pcl.ac.cn/user/sign_up?sharedUser=leedong111 推荐人:leedong111
注册该平台 可以 方便 运行教材 mindspore ipynb: https://openi.pcl.ac.cn/leedong111/gdut-d2l
绑定微信送 50 积分,cpu算力免费,gpu/npu 算力每小时2积分,其他获得积分方式见:https://openi.pcl.ac.cn/reward/point/rule
运行老师设置好的计算模板已经加入了课程ipynb, 链接如下:
https://openi.pcl.ac.cn/ai_task_tmpl/detail/f304143a-a1ec-4bbb-8b94-c585b19f0941
点 运行,等待计算资源准备好后 点调试,在jupyterlab左侧导航到具体文件夹内的ipynb文件阅读运行理解代码。
2.实验算力华为云
https://edu.hicomputing.huawei.com/teaching/voucher-details/invite/20241104C9BHqy4W 请大家注册华为云 实名 学生认证后 通过上述链接加入班级
然后更多设置见实验1 实验2
3. https://missing-semester-cn.github.io/
日程
- 1/13: 课程概览与 shell
- 1/14: Shell 工具和脚本
- 1/15: 编辑器 (Vim)
- 1/16: 数据整理
- 1/21: 命令行环境
- 1/22: 版本控制(Git)
- 1/23: 调试及性能分析
- 1/27: 元编程
- 1/28: 安全和密码学
- 1/29: 大杂烩
- 1/30: 提问&回答
讲座视频可以在 上找到。
b站2026版含vibe coding
- 1/13: 课程概览与 shell
-
平时成绩:总成绩的30%,6 次平时测验(选择题为主,实验课最后半小时-一小时测验)
6 次测试内容
test1 含KD-tree之前 test2 朴素贝叶斯 SVM test3 决策树 集成学习 test4 DNN CNN test5 RNN test6 Transformer test123的难题(test总分的30%)出自:cs189 midterms exams: Without solutions: Spring 2013, Spring 2014, Spring 2015, Fall 2015, Spring 2016, Spring 2017, Spring 2019, Summer 2019, Spring 2020 Midterm A, Spring 2020 Midterm B, Spring 2021, Spring 2022, Spring 2023, Spring 2024. With solutions: Spring 2013, Spring 2014, Spring 2015, Fall 2015, Spring 2016, Spring 2017, Spring 2019, Summer 2019, Spring 2020 Midterm A, Spring 2020 Midterm B, Spring 2021, Spring 2022, Spring 2023, Spring 2024.
cs189 final exams. Without solutions: Spring 2013, Spring 2014, Spring 2015, Fall 2015, Spring 2016, Spring 2017, Spring 2019, Spring 2020, Spring 2021, Spring 2022, Spring 2023, Spring 2024. With solutions: Spring 2013, Spring 2014, Spring 2015, Fall 2015, Spring 2016, Spring 2017, Spring 2019, Spring 2020, Spring 2021, Spring 2022, Spring 2023, Spring 2024.
test其他可能的出处:每节课开始的复习(提示词)、2024年旧作业、教材习题例题
平时成绩加分:新出或测试上述题库质量的题目,每个题目平时成绩加1分;申请 mindspore 在线实习https://www.mindspore.cn/internship并完成任意积分任务平时成绩加到满分(平时成绩100分加满为止)。通过PR合并申请认证优秀开发者平时成绩加到满分,其他加5分https://www.mindspore.cn/developers/#applicationProcess。;翻转课堂或复习课加分待定

考勤主要由 test 是否参加体现。
期末考试:总成绩的70%,出处题库:同平时测验(大题为主);每节课开始的复习(提示词)、2024年旧作业旧试卷、教材习题例题
1.传统机器学习24分 模型评估(AB 卷均考);k近邻kd-tree、朴素贝叶斯、SVM、决策树、集成学习、无监督学习(AB 卷分别 6 考 2,其余4出客观填空题)
2.DNNCNN 22分 (传统机器学习的 梯度下降、逻辑回归、感知机通常合并在此考)
3.RNN 12分
4. Transformer 12分
1234分值为计算题(7道70分),另有10%客观题(10分5道填空)。
5. 实验程序填空题 20分 :必背mindspore/pytorch模板考 10 分代码填空 (AB 卷均考),另外10分AB卷考实验内容ex03 resnet make_layer函数相关 或 ex05 Seq2Seq attention类相关。
实验课:代码及报告84% 实验课答辩恢复代码16% 。本学期实验课答辩流程1.先看 report 2.再查代码 3.再查pr记录命名 4.再删代码 答辩 有一步没合格就重新排队 其他人开始新一轮答辩。老师或助教 删除 3-5 行(可以是模板行) :2 分钟内完全写不出、或思路错 85;思路对 2 分钟没有调出来估计还要很久的 90 ; 虽然2分钟没有调试出来但是是小错 估计很快就能完成的90 ;2分钟调试出来了 95 ;很快几乎不用调试 100)。deadline为一周后。每迟交 24 小时扣 4%,迟交超过6天 最高为 60%(84-4*6=60)。
实验成绩加分:可选任务加分移植ipynb到modelarts AI Gallery 5%(必须LLM或Transformer相关,内容质量必须高于已有AI Gallery,推荐结合 Deepseek API )。mindspore相关微认证 每个加2分。其他华为人工智能微认证每个加1分(实验加分最多 4 分)。https://edu.huaweicloud.com/certifications
作弊平时测验(现场打字屏幕显示你位置前后几排左数右数第几个作弊),本次计分-200分。相当于1次抄袭/作弊,基本等价3次平时测验0分(总共6次)。抄袭实验,双方本次计分-100分。相当于1次抄袭,基本等价2次实验没完成0分(总共6次)。发生抄袭,虽然没有直接不允许参加考试,但是此时总成绩通过则需要其他次作业实验和考试成绩均达到较高的分数。请所有人足够重视,我们会检索互联网,同学间互相比对等手段,请勿心存侥幸。可以讨论idea思路,请勿传递作业或复制粘贴,你无法控制别人怎么使用你的作业、实验内容。
【腾讯文档】2026春机器学习成绩登记
https://docs.qq.com/sheet/DZnVuQUJrcmhjTXFt?tab=BB08J2-
-
算法 模型假设 损失函数 优化方法 朴素贝叶斯 特征条件独立(给定类别下特征独立) 对数似然损失(最大似然估计) 极大似然估计(或EM算法处理缺失值) SVM 数据线性可分(或通过核函数映射到高维可分),最大化分类间隔 Hinge Loss + L2正则化项 拉格朗日对偶 + SMO(序列最小优化) 集成学习 - 随机森林:特征子集独立性
- GBDT:残差逐步拟合- 随机森林:基尼系数/信息增益
- GBDT:自定义损失(如平方损失、对数损失)- 随机森林:Bagging
- GBDT:梯度下降(加法模型)PCA 数据在低维线性子空间上方差最大 重构误差最小化(或协方差矩阵特征值最大化) 特征值分解(或SVD) K-Means 数据呈球形分布,簇内紧密 样本到簇心的平方距离和(SSE) EM算法(迭代更新簇心与样本分配) 逻辑回归 数据线性可分,通过sigmoid映射概率,二分类任务 交叉熵损失(对数损失) 梯度下降(或拟牛顿法) softmax回归 数据线性可分,通过softmax映射概率,多分类任务 交叉熵损失(对数损失) 梯度下降(或拟牛顿法) 线性回归 数据成线性分布,回归任务 平方误差 最小二乘/随机梯度下降 DNN 多层非线性变换可拟合复杂函数 任务相关(如交叉熵、均方误差) 反向传播 + 梯度下降变体(如Adam、SGD) CNN 局部相关性、平移不变性(通过卷积核和池化) 任务相关(如交叉熵) 反向传播 + 梯度下降变体(如Adam) RNN 序列数据的时间依赖性(通过循环结构传递状态) 交叉熵(序列预测任务) BPTT(随时间反向传播)+ 梯度截断/Adam Transformer 全局依赖关系通过自注意力机制捕获 交叉熵(带掩码的序列预测任务) Adam优化器 + 学习率预热(如Noam调度) - 机器学习6步骤3要素
- 以垃圾邮件分类为例,出一道查准率(precision).查全率(recall)的计算题。试述真正例率(TPR).假正例率(FPR)与查准率(precision).查全率(recall)之间的关系。出一道多项选择题。
- 写出绘制PR曲线的伪代码
-
在微分多元函数时经常使用以下规则:
- 对于所有A∈Rm×n,都有∇xAx=A⊤
- 对于所有A∈Rn×m,都有∇xx⊤A=A
- 对于所有A∈Rn×n,都有∇xx⊤Ax=(A+A⊤)x
- ∇x∥x∥2=∇xx⊤x=2x
同样,对于任何矩阵X,都有∇X∥X∥F2=2X。利用第一条和(导数加减乘除法则)推导其他。
- 尝试写出函数u=f(x,y,z),其中x=x(a,b),y=y(a,b),z=z(a,b)的链式法则。
-
推导出使用平方误差的线性回归优化问题的解析解。为了简化问题,可以忽略偏置(我们可以通过向添加所有值为1的一列来做到这一点)。
-
用矩阵和向量表示法写出优化问题(将所有数据视为单个矩阵,将所有目标值视为单个向量)。
-
计算损失对的梯度。
-
通过将梯度设为0、求解矩阵方程来找到解析解。
-
什么时候可能比使用随机梯度下降更好?这种方法何时会失效?
-
- 会求sigmoid和softmax梯度。并理解Sigmoid 导数只是 Softmax 导数在二维互斥空间下的一个特例。
- 给定一个分布P算此分布的熵
- 给定独一编码y和预测的概率分布y_hat, 计算交叉熵
- 求交叉熵损失的梯度
- 背 pytorch mindspore必背模板,能写或调库实现批量梯度下降
- 教材2算法3.2 3.3,例3.2 3.3给定坐标能建kd树,给定新坐标能写对kd树遍历顺序能知道何时遍历终止。
- 模仿教材2例题 4.1 更改值。出朴素贝叶斯分类器计算填空题。
- 模仿教材2 例题 5.2 更改数值后 出一道填空题 随机考一种属性划分 计算信息增益 ;不用让他们重复计算每一种划分。
- 教材2算法 5.2 出一道 排序题
- 教材2算法 5.3 出一道 排序题
- 模仿教材2 例题 5.4 更改数值后 出一道填空题 随机考一种属性划分 计算Gini;不用让他们重复计算每一种划分
- 出一道 6 个选项的单选题,给定一个比较明显的数据,让学生用 ID3 生成决策树,选择正确的树。主要考察学生对决策树算法的理解,即使不计算数值,也能估算最后的决策树。
- 模仿教材2例题 7.1 让学生利用几何方法直接求 svm最 ⼤ 间 隔 分 离 超 平面方程。多选题。
- 模仿教材2例题 7.2 更改点坐标 让学生 计算对偶问题展开化简过程。出填空题。
- svm 求解分哪几步(对偶问题求解步骤)。
- 出一道多项选择题,下面哪些问题是凸优化问题。
- 出一道多选题,svm 对偶问题的 KKT 条件,下面给出的哪些是正确的?给 10 个选项条件 诺干错 剩余对。
- 模仿教材2 例题 8.1 更改数值后 出一道提升方法填空题 挖多个空 考一次更新权重过程即可
- 出一道 计算 题 考d2l教材公式6.3.2
- 已知模型网络架构 求上述模型参数量

- RNN 会考2024试卷 同类型计算题
- 掌握编程搭建全连接网络、CNN、RNN、Transformer几种网络中,只有CNN需要计算(或特殊方法)每一层网络部件的输入输出大小的方法和原因。
-
网络类型 尺寸变化特点 是否需要计算中间层大小 为什么? CNN 非线性缩水 是 卷积、池化的步长和边缘填充导致空间尺寸复杂变化,且全连接层需要精确的展开一维尺寸。 MLP 自定义映射 否 尺寸完全由开发者主观定义(如 128 -> 64)。 RNN 时间轴复用 否 结构在时间步上共享,隐状态维度固定。 Transformer 形状保持 否 为了残差连接,每一层都强制保持 $d_{model}$ 维度一致。 
- word2vec工具包含跳元模型和连续词袋模型,出一道moodle匹配题,把多种不同性质、公式归属到跳元模型或连续词袋模型。
- 出一道moodle排序题(嵌入式完型题),考察近似计算中相关公式推导,排序块有些公式是错的,需要学生选择正确的公式,然后再按照推导过程排序。
-
NLP 预训练方法对比表
模型/方法 自监督任务 模型架构 损失函数 优点 缺点 Word2Vec
(Skip-gram)
局部上下文预测:利用中心词预测周围的上下文词。 浅层线性网络(无隐层激活),包含中心词和上下文两张嵌入矩阵。 原始:Softmax 交叉熵
实际:带负采样的二元交叉熵或层级 Softmax。
训练速度快;能有效捕捉词与词之间的语义相似度与类比关系;生僻词表现优于 CBOW。 静态词向量,无法解决一词多义(Polysemy)问题;无法处理未登录词(OOV)。 Word2Vec
(CBOW)
局部上下文预测:利用周围的上下文词预测中心词。 浅层线性网络,将上下文词向量求和或取平均作为输入去预测中心词。 与 Skip-gram 相同(通常用负采样进行二分类近似)。 训练速度比 Skip-gram 更快;对高频词的预测更为准确。 静态词向量,无法解决一词多义;因平滑了上下文,对低频词/生僻词效果较差。 GloVe 全局词共现矩阵分解:拟合全局语料库中“词-词共现矩阵”的概率比值。 基于全局统计的矩阵分解线性架构。 加权平方误差损失(带权重函数 $f(X_{ij})$ 防止高频词主导)。 结合了全局统计信息与局部窗口优势,在词向量相似度和类比任务上表现更鲁棒。 依然是静态词向量,无法根据上下文动态调整语义。 FastText 引入子词的局部预测:与 Skip-gram 类似,但将词拆分为多个字符级 $n$-gram。 基于 Skip-gram,词的最终向量由其所有 $n$-gram 子词向量叠加求和构成。 带负采样的二元交叉熵损失。 完美解决**未登录词(OOV)**问题;对形态学丰富的语言(如德语、芬兰语)和拼写错误泛化力强。 引入大量子词导致内存和显存开销极大;依然属于静态词向量。 BERT 1. 掩码语言模型 (MLM):双向完形填空。
2. 下一句预测 (NSP):句子对关系二分类。
多层双向 Transformer 编码器(Transformer Encoder)。 联合多任务损失:MLM(多分类交叉熵) + NSP(二分类交叉熵)。 生成动态上下文词表示,彻底解决一词多义;双向特征捕捉能力极强,微调下游任务效果惊艳。 算力消耗极其庞大;预训练引入的 [MASK]标记导致预训练与微调之间存在非对称性;不擅长文本生成。GPT-1 自回归语言模型(Causal LM):单向自左向右,根据上文预测下一个词。 多层单向 Transformer 解码器(Transformer Decoder,带掩码的自注意力)。 标准的自回归多分类交叉熵损失(通过上文预测当前词)。 完美契合文本生成任务;预训练与下游微调的输入形式一致,无非对称性(Mismatch);开创了生成式预训练(Generative Pre-training)范式。 单向架构,在提取特征时无法看到“右边”的上下文,对于阅读理解、序列标注等需要全局上下文的任务弱于 BERT。
-
-
-
https://space.bilibili.com/1567748478/lists/358497?type=series
- 1.1 机器学习概念的引出
- 1.2 机器学习的发展历史
- 1.3 机器学习与人工智能
- 1.4 为什么要深度学习?
-
该视频主要讲述了机器学习的定义和基本流程,以及如何从简单的线性分类器演变为深度学习的分类器。视频还介绍了深度学习的定义、特点、来历、应用领域和模型框架。深度学习是机器学习的分支,是实现机器学习的一种重要技术手段,其模型结构一般是含有多个隐藏层的多层神经网络。视频强调了深度学习的基础知识的重要性,包括数据集的拆分、模型的性能评价等内容。
-
https://github.com/rougier/numpy-100/blob/master/100_Numpy_exercises_with_hints_with_solutions.md
This is a collection of numpy exercises from numpy mailing list, stack overflow, and numpy documentation. I've also created some problems myself to reach the 100 limit. The goal of this collection is to offer a quick reference for both old and new users but also to provide a set of exercises for those who teach. For extended exercises, make sure to read From Python to NumPy.
12 星(没有提示)考填空(去年都是从头写降低了难度),63 题中抽 40 题,每题 2分;三星题 34 题(没有提示)中抽 5 题考填空,每题 4分。三星题 34 题(没有提示)中抽 1 题考从头写的编程 10 分。总分 110 分,超过 100 分的按 100 分计。考试时间 80 分钟。
-
-
阅读教材2
- 1.1 机器学习
- 1.2 机器学习的分类
- 1.3 机器学习方法三要素
- 1.4 模型评估与模型选择
- 1.5 正则化与交叉验证
- 1.6 泛化能力
- 1.7 生成模型与判别模型
- 1.8 监督学习应用
-
本视频主要讲述了数据集及其拆分、有监督学习、验证集、机器学习算法和特征提取、模型评估等模块的相关内容。此外,还介绍了埃德康是一个开源的p发行版本,包含了多个科学包及其依赖项,以及最简单的训练集和测试集的拆分方法及流除法的不足之处,k折交叉验证相对于流出法的优势,超参数的概念,以及如何通过网格搜索和k折交叉验证来调整超参数,以优化模型性能。
-
-
阅读教材1
阅读教材2
6.1 逻辑斯谛回归模型 1026.2 最大熵模型 1076.3 模型学习的最优化算法 112# 等价关系 **二分类场景下,Softmax 退化为 Sigmoid,二者数学等价** ## 推导 设二分类,输出 \(z_1,z_2\) \( a_1=\frac{e^{z_1}}{e^{z_1}+e^{z_2}},\quad a_2=\frac{e^{z_2}}{e^{z_1}+e^{z_2}} \) 令 \(z=z_1-z_2\) \( a_1=\frac{e^{z}}{1+e^{z}}=\sigma(z) \) \(\sigma(z)\) 就是**Sigmoid函数** ## 关键原因 1. Softmax 输出**概率和为1**,二分类天然互斥 2. 两类别做差值运算,公式直接化简成Sigmoid 3. 损失角度: - 二分类交叉熵 = Sigmoid+对数损失 - 二分类Softmax交叉熵 二者**损失结果完全一致** ## 考点速记 - 类别数=2:**Softmax ≡ Sigmoid** - 类别数≥3:只能用Softmax,无法等价Sigmoid - 逻辑回归就是**二分类Softmax** -
-
-
阅读教材3
5.1 决策树模型与学习 815.2 特征选择 865.3 决策树的生成 905.4 决策树的剪枝 935.5 CART算法 94补充
bagging&随机森林
-
阅读教材2
7.1 线性可分支持向量机与硬间隔最大化 1207.2 线性支持向量机与软间隔最大化 1257.3 非线性支持向量机与核函数 1307.4 序列最小最优化算法 135 -
阅读教材2
8.1 提升方法AdaBoost算法 1448.2 AdaBoost算法的训练误差分析 1488.3 AdaBoost算法的解释 1498.4 提升树 152 -
-
-
https://developer.huaweicloud.com/space/devportal/notebook-tool

4.“当前使用免费实例规格用于体验,72小时内没有使用,会释放资源,请注意文件备份。”
5. 通过点击剩余时间更新,可以在快要断开时将时间延长到 1 小时,因此这种免费模式,适合使用者一直在电脑前的简单任务。
6. 通过点击切换规格可以使用免费的 CPU 或 GPU 实例。

===================================================
7. 更新 python 3.9 和 mindspore 2.2.14 kernel(可选 如果是比较新的 代码运行需要这部)
在 ipynb 添加如下代码块
%%capture captured_output
!/home/ma-user/anaconda3/bin/conda create -n python-3.9.0 python=3.9.0 -y --override-channels --channel https://mirrors.tuna.tsinghua.edu.cn/anaconda/pkgs/main
!/home/ma-user/anaconda3/envs/python-3.9.0/bin/pip install ipykernelimport json
import osdata = {
"display_name": "python-3.9.0",
"env": {
"PATH": "/home/ma-user/anaconda3/envs/python-3.9.0/bin:/home/ma-user/anaconda3/envs/python-3.7.10/bin:/modelarts/authoring/notebook-conda/bin:/opt/conda/bin:/usr/local/nvidia/bin:/usr/local/cuda/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin:/home/ma-user/modelarts/ma-cli/bin:/home/ma-user/modelarts/ma-cli/bin"
},
"language": "python",
"argv": [
"/home/ma-user/anaconda3/envs/python-3.9.0/bin/python",
"-m",
"ipykernel",
"-f",
"{connection_file}"
]
}if not os.path.exists("/home/ma-user/anaconda3/share/jupyter/kernels/python-3.9.0/"):
os.mkdir("/home/ma-user/anaconda3/share/jupyter/kernels/python-3.9.0/")with open('/home/ma-user/anaconda3/share/jupyter/kernels/python-3.9.0/kernel.json', 'w') as f:
json.dump(data, f, indent=4)注:以上代码运行完成后,需要重新设置kernel为python-3.9.0
8.安装MindSpore框架2.2.14
%%capture captured_output
!pip install https://ms-release.obs.cn-north-4.myhuaweicloud.com/2.2.14/MindSpore/unified/x86_64/mindspore-2.2.14-cp39-cp39-linux_x86_64.whl --trusted-host ms-release.obs.cn-north-4.myhuaweicloud.com -i https://pypi.tuna.tsinghua.edu.cn/simple
-
-

- 确保有权限:向老师确认自己已被添加到私有库的成员列表中,拥有访问权限。加入列表网址:见 qq 群 4 月 6 日 17 点55群消息
- 在老师给的该次实验网址点击 fork

3. 然后在自己 fork 后仓库获取 clone git 地址 并新建 312200xxxx 分支 (学号)
后续继续在 modelarts codelab 操作
- 点击 codelab 页面左侧Clone

2. 将该次实验室 git 网址录入对话框 并勾选下载仓库

3. 输入用户名(注册用的电话号码)密码

4. 按要求补全 ipynb 文件、撰写实验报告,过程可能持续数小时,期间记得每小时更新 codelab 剩余时间和
commit 主要工作并将更改 push 到你 fork 的远程仓库(记得选对学号分支)。下图 1track 所有更改 图 2commit 所有更改 图 3push 所有更改



5.
提交 Pull Request
下图红色箭头处写清楚 学号姓名
-
-
https://gitee.com/gdutcv/mlex03
实验课内完成 所有且通过老师/助教审查问答(每人一次代码重写机会,审查问答改进代码和报告任意次),删除任意 5 行左右代码,60 秒内可以重写,满分 100 分。120 秒内重写,95 分。超过 120 秒,按未能重写计算,88 分。课后 完成所有 85 分。未完成所有项目按比例扣分。
-
- 点击https://www.huaweicloud.com/product/modelarts.html 并登录
- 登录后,在页面中央大字 AI开发平台ModelArts,点击 控制台。
- 检查 费用-》代金券点去使用,查询余额,确保够做完实验,不要产生欠费!!!!!!!!!!!




- 余额无问题后开始创建 付费计算资源notebook


- 创建 付费notebook 详细说明及其他高级功能见官方手册https://support.huaweicloud.com/usermanual-standard-modelarts/devtool-modelarts_0004.html
- 推荐自动停止设为 3-8小时,实例选择7 元/每小时(不要选贵的钱不够!)的。



注意!!!!除了计算资源,云硬盘 EVS 也是收费的,做完实验所有数据上传 gitee 或本地硬盘后记得删除避免扣费! -
from download import download
url = "https://mindspore-website.obs.cn-north-4.myhuaweicloud.com/notebook/datasets/cifar-10-binary.tar.gz"
download(url, "./datasets-cifar10-bin", kind="tar.gz", replace=True)
-
- 检查费用-》代金券余额,确保够做完实验,不要产生欠费,每次开始实验前要根据金额估算最迟停机时间!!!!!!!!!!!!!!!!!!



- 余额无问题后开始创建 付费计算资源notebook
1.notebook 创建时镜像选和实验 3 一样 7.6 每小时的
2. 建议你理解题目要求 编写的差不多后 再开实例。周四实验课充 70 元。周六早上充 60元。相当于各 8小时,总计 16 小时。请节约合理安排时间。
3. 先运行 installms221.ipynb然后切换 kernel 再开始实验 模板要求 mindspore2.2.1
-
https://gitee.com/gdutcv/mlex05
- 检查费用-》代金券余额,确保够做完实验,不要产生欠费,每次开始实验前要根据金额估算最迟停机时间!!!!!!!!!!!!!!!!!!



- 余额无问题后开始创建 付费计算资源notebook
1.notebook 创建时镜像选和实验 3 一样 7.6 每小时的
2. 建议你理解题目要求 编写的差不多后 再开实例。周四实验课充 70 元。周六早上充 60元。相当于各 8小时,总计 16 小时。请节约合理安排时间。
3. 先运行 installms211py3911.ipynb然后切换 kernel 再开始实验 模板要求 mindspore2.1.1

-
根据《动手学深度学习》第 15 章(自然语言处理:预训练)的完整二级目录结构,我为你将全章涉及的核心技术、模型和方法进行了系统化梳理。
下表总结了哪些内容在 2017 年 Transformer 时代(及现代大模型中)继续沿用/继承思想,哪些已经不再使用/被彻底取代,并阐述了核心原因。
第 15 章 预训练技术演变全景表(按二级目录)
二级目录章节 2017 Transformer 时代继续沿用/继承的部分及原因 2017 Transformer 时代不再使用/被取代的部分及原因 15.1. Word Embedding (word2vec) 1. 词嵌入与 Softmax 映射:底层的向量查表(Embedding Layer)和顶部的全连接 Softmax 词表预测被完整保留。
2. 自监督(Self-Supervised)理念:利用文本自身无标签训练的思想是现代大模型的绝对基石。
1. 静态词向量(Static Embeddings):Word2Vec 为每个词分配固定向量,无法解决一词多义(被自注意力机制的动态上下文向量取代)。
2. 局部上下文窗口(Local Window):划窗限制了长距离依赖(被 Transformer 的 $O(1)$ 全局自注意力取代)。
3. CBOW 向量简单平均:抹杀了词序和权重差异(被位置编码和注意力权重取代)。
15.2. Approximate Training 1. 负采样(Negative Sampling)思想:将多分类简化为二分类的对比学习(Contrastive Learning)思想,在很多大模型的多模态预训练(如 CLIP)中依然在使用。 1. 层次 Softmax(Hierarchical Softmax):霍夫曼树的复杂树状结构非常不利于现代 GPU 的并行矩阵化计算,已彻底退出历史舞台。
2. 传统的负采样:在 Transformer 语言模型中,由于算力和子词技术的提升,通常直接硬算 Full Softmax 或使用掩码交叉熵。
15.3. The Dataset for Pretraining Word Embeddings 1. 数据流水线与高频词降采样(Subsampling):类似对 "the", "a" 等高频无意义词进行惩罚或子抽样的思想,在今天大模型清洗数据(Data Cleaning)时依然在用。 1. 基于“中心词-上下文词”对的数据构造:这种滑窗拼接数据对(Minibatches)的方式太低效。Transformer 时代直接喂入整段连续的 Token 序列(如 2K 或 4K 窗口)。 15.4. Pretraining word2vec 1. 预训练-微调(Pretrain-Fine-tune)范式:先在无监督大语料上预训练,再把向量拿去下游任务使用的基本流程被完全继承。 1. 浅层网络的训练:Word2Vec 这种只含一个非线性隐层的极浅网络(Shallow Network)不再用于特征提取,全面被多层深度 Transformer 结构取代。 15.5. Word Embedding with Global Vectors (GloVe) 1. 全局统计信息的重视:GloVe 强调利用全局共现矩阵的矩阵分解思想。在现代大模型的 Tokenizer(分词器)训练中,依然会统计全局词频和共现。 1. 显式构建全局共现矩阵:当语料库达到几千亿/万亿 Token 时,显式存储和分解几百万 $\times$ 几百万的共现矩阵(Co-occurrence Matrix)在内存和计算上完全不可行。 15.6. Subword Embedding 1. 子词分词技术(BPE / WordPiece):完全沿用且发扬光大。Transformer(包括后来的 GPT、LLaMA、BERT)彻底抛弃了纯单词词表,100% 采用子词嵌入,这是解决未登录词(OOV)的终极方案。 1. 传统的 fastText 字符级 n-gram:fastText 将单词拆解为字符级的 $n$-gram(如将 "where" 拆为 "wh", "he", "er")。这种硬编码的滑动拆解在处理大词表时效率较低,目前基本被更灵活的 BPE 词表取代。 15.7. Word Similarity and Analogy 1. 余弦相似度(Cosine Similarity):评估两个向量在特征空间中接近程度的数学方法(余弦相似度)依然在向量数据库、检索增强生成(RAG)中广泛使用。 1. 静态词义类比(Analogy)评估:如 “king - man + woman = queen” 的静态向量加减法不再作为评估模型语言能力的核心指标。现代模型直接通过大模型基准测试(如 MMLU、GSM8K)来评估。 15.8. Bidirectional Encoder Representations from Transformers (BERT) 1. Transformer 架构与上下文感知(Context-Sensitive):BERT 引入的 Transformer 块(自注意力+前馈网络)至今仍是所有大模型的核心。
2. 掩码语言模型(MLM):BERT 的完形填空任务(Masked LM)依然是现代双向编码器(如各类 Embedding 模型)的核心训练方法。
1. 下一句预测任务(NSP, Next Sentence Prediction):BERT 训练时让模型预测 B 句是否是 A 句的下一句。后来的研究(如 RoBERTa)证实 NSP 任务效果不佳且拖累性能,在后来的 Transformer 预训练中被废弃。 15.9. The Dataset for Pretraining BERT 1. 动态掩码与特殊标记(Special Tokens):输入序列中加入 [CLK](或<s>),[SEP],以及随机 15% 掩码的 Token 替换策略,在现代双向表征模型中依然在用。1. 短序列拼接与硬性段编码(Segment Embeddings):早期 BERT 受限算力常使用 128 或 512 的短序列,并用 $A/B$ 段编码。现在的模型更倾向于长文本单序列输入,段编码逐渐被更先进的位置编码(如 RoPE)淡化。 15.10. Pretraining BERT 1. 提取层激活作为下游特征:将预训练好的 Transformer 层输出提取出来作为文本的稠密表征向量,这一做法至今仍是**向量嵌入模型(Embedding Models)**的通用标准。 1. 双向掩码微调范式在生成任务中的限制:BERT 这种双向自编码网络(Autoencoder)在纯文本生成(如 ChatGPT 这种自回归聊天)上不适用,现代生成式大模型全面转向了单向的 Decoder-only 架构。
💡 总结复习要点
看这一章的目录,你可以清晰地发现 NLP 预训练的发展脉络:
-
15.1 - 15.5(早期探索):我们在尝试用浅层网络、局部窗口去死记硬背单词的含义(留下了“自监督”和“向量化”的传世资产,淘汰了“静态”和“局部”)。
-
15.6(关键突破):引入了子词(Subword),彻底解决了词表爆炸和未知词(OOV)问题,至今仍被 Transformer 奉为座上宾。
-
15.8 - 15.10(新时代开启):Transformer 闪亮登场(以 BERT 为代表),用自注意力彻底革了前面几节课的命,实现了真正的全局、动态上下文理解。
-
-
继续 mlex05
-
- 教材2 14.3 K-means
- 教材2 15章 SVD
- 教材2 16章 PCA

-
考试时间 预计6月3日
考试时长 1小时30分钟
大致分值分布:
见前面成绩组成









