《人 工 智 能 通 识》教 研 组 本 章 目 录 3 . 1机 器 学 习 概 述 3 . 2经 典 算 法 3 . 3模 型 评 估 与 选 择 3 . 4当 代 机 器 学 习 简 介 本 章 目 录 3 . 1机 器 学 习 概 述 3 . 2经 典 算 法 3 . 3模 型 评 估 与 选 择 3 . 4当 代 机 器 学 习 简 介 ◼机器学习(Machine Learning,ML)是一门专注于利用经验,通过计算技术来模拟和实现人类学习过程的学科。 3 . 1机 器 学 习 概 述 ◼数据是不可或缺的基石 3 . 1机 器 学 习 概 述 3 . 1机 器 学 习 概 述 ◼监督学习:利用一组已知输入和对应标签的数据集来训练模型,使模型能够学习到一个从输入到输出的映射关系 ◼无监督学习:直接对这些未标注数据进行建模分析,以实现相应的学习任务 ◼训练集的样本用来训练模型◼测试集用来检验模型的性能,即利用学习得到的模型参数对测试样本进行预测,并通过评价指标评测预测结果与标签的接近程度 3 . 1机 器 学 习 概 述 ◼实际上,分类模型与回归模型在底层逻辑上存在共通之处,通过适当调整,某些经典算法如逻辑回归和决策树能够灵活应用于两类任务之中。 3 . 1机 器 学 习 概 述 ◼目标:选择泛化能力强的模型 不仅能在训练数据集上展现优异表现,更需在未知新样本上也表现出色 当代机器学习简介(3.4) ◼深度学习:作为引领人工智能浪潮的核心驱动力,它以其强大的特征表征能力,在众多领域取得了突破性进展 ◼强化学习:模拟了生物体在环境中通过试错学习最优行为的过程,为智能体自主决策与适应复杂环境提供了可能 ◼图学习:专注于处理图结构数据,解锁了社交网络、生物信息学等领域中的隐藏价值 ◼联邦学习:作为隐私保护的利器,实现了数据在不离开本地的前提下进行联合建模与学习 ◼迁移学习:利用源域知识辅助目标域任务,极大地降低了新任务的学习成本 本 章 目 录 3 . 1机 器 学 习 概 述 3 . 2经 典 算 法 3 . 3模 型 评 估 与 选 择 3 . 4当 代 机 器 学 习 简 介 ◼监 督 学 习 ◼特征:𝒙=[𝑥1,𝑥2]𝑇 ො𝑦=𝑮(𝒙)线性回归 ◼监 督 学 习 ➢线性回归的基本思想是通过找到最佳拟合直线来模拟因变量和自变量之间的关系。 ◼特征:𝒙=[𝑥1,𝑥2]𝑇 ◼标签:𝑦 ො𝑦=𝑮(𝒙)ො𝑦=𝑤1⋅𝑥1+𝑤2⋅𝑥2+𝑏 ◼权重:𝒘=[𝑤1,𝑤2]𝑇 3 . 2经 典 算 法◼监 督 学 习 ො𝑦=𝑤1⋅𝑥1+𝑤2⋅𝑥2+𝑏 ◼权重:𝒘=[𝑤1,𝑤2]𝑇 ◼偏置:𝑏 这里,我们将其推广至更一般的情况。假设每个样本有d个属性描述,可以将其向量化表示为,那么房价预测值可以表示为:𝒙=[𝑥1,𝑥2,…,𝑥𝑑]𝑇 假设数据集由n个样本构成,样本可以用一个二维矩阵来表示:𝑿∈ℝ𝑛×𝑑ෝ𝒚=𝑿𝒘+𝒃,ෝ𝒚∈ℝ𝑛,𝒃∈ℝ𝑛 ◼监 督 学 习 ൟሼ𝒘∗,𝒃∗=𝑎𝑟𝑔𝑚𝑖𝑛𝒘,𝒃𝐿𝒘𝒃=𝑎𝑟𝑔𝑚𝑖𝑛𝒘,𝒃1𝑛𝑖=1𝑛12(ො𝑦𝑖−𝑦𝑖)2=𝑎𝑟𝑔𝑚𝑖𝑛𝒘,𝒃12𝑛||𝒚−𝑿𝒘−𝒃||2 ①生成增广权重向量ෝ𝒚=𝑿,𝟏𝒘,𝒃𝑻=𝑿ෝ𝒘 采用简化的表示方法,直接用w和X来表示增广权重向量和增广特征矩阵: ②损失函数表示 ③求解解析解 ◼监 督 学 习 ➢线性回归的优势 模型简洁,易于理解与实施计算效率高,特别适用于处理大规模数据集强大的可解释性赋予模型参数明确的统计含义,能够直观揭示特征对目标变量的影响机制 ➢线性回归的局限 模型简洁,易于理解与实施计算效率高,特别适用于处理大规模数据集强大的可解释性赋予模型参数明确的统计含义,能够直观揭示特征对目标变量的影响机制 3 . 2经 典 算 法 ◼监 督 学 习 ◼监 督 学 习 以邮件类型识别为例 假设给定邮件训练集为𝐷=ሼ(𝒙1,𝑦1),(𝒙2,𝑦2),...,(𝒙𝑚,𝑦𝑚)},𝑦𝑖∈ሼ−1,+1}其中标签𝑦𝑖取-1或1分别代表正常邮件或垃圾邮件 划分超平面 若能用一个超平面将D中两类不同数据完全隔开,则称样本数据集D为线性可分,该平面称为划分超平面 ◼监 督 学 习 ◼SVM的核心是构建一个能够最大化两类样本间隔的超平面 3 . 2经 典 算 法 ◼监 督 学 习 我们使用如下线性方程来描述划分超平面:𝒘𝑇𝒙+𝑏=0 样本空间中任意点𝑥𝑖到超平面的距离公式𝑑𝑖𝑠:𝑑𝑖𝑠=𝒘𝑇𝒙𝑖+𝑏|𝒘| 我们的训练目标: ◼𝑦𝑖=+1时,即邮件是垃圾邮件时,则𝒘𝑇𝒙𝑖+𝑏>0◼𝑦𝑖=−1时,即邮件是正常邮件时,则𝒘𝑇𝒙𝑖+𝑏>0 这里,我们可以更严格一些: ◼监 督 学 习 找到一些距离超平面最近的几个训练样本点,将其称为“支持向量”(Support Vector)将两个不同类支持向量到超平面的距离之和定义为间隔(Margin) ◼SVM的优化目标是找到拥有最大的间隔r的划分超平面 拉格朗日乘子法 ◼监 督 学 习 顺序最小优化(Sequential MinimalOptimization,SMO) ①构建拉格朗日函数 ③将w代回原式,得到对偶问题 ②分别对自变量求偏导,并令其为零 ④求解α,进而求解 3 . 2经 典 算 法 ◼监 督 学 习 若能用一个超平面将D中两类不同数据完全隔开,则称样本数据集D为线性可分,该平面称为划分超平面 ➢面向软间隔的SVM:允许少量训练样本被错分,而非要求所有训练样本都能被正确分类 优势:很高效的解决了存在少量噪声但总体上可用划分超平面区分开的一类任务。局限:仍然对线性不可分数据集不能奏效。 ➢基于核函数的方法:通过将样本数据映射到高维空间,使得数据在高维空间中变得线性可分 ◼无 监 督 学 习 K均值聚类算法(K-means Clustering) 学习过程是否提供标签 ➢通过深入剖析数据内部规律,能够自主地将未知类别的样本分组为若干聚类,展现出强大的数据处理能力 ◼无 监 督 学 习 “物以类聚,人以群分” ➢聚类技术,它依据样本数据间的相似性,将数据集划分为若干独立的子集,即“簇”,使得同一簇内的样本高度相似,而不同簇间则差异显著。 ◼无 监 督 学 习 K-means算法的执行过程 ①初始化质心:随机选择K个样本数据点作为初始的簇质心 ②分配簇:计算每个样本数据点与各个簇质心的距离,将其分配给最近的簇 ◼C1组:P1◼C2组:P2、P3、P4、P5、P6 ④迭代:重复上述分配和更新步骤,直到满足某种终止条件(如簇质心不再发生显著变化或达到预设的迭代次数) ③更新质心:重新计算每个簇的质心,即取簇内所有样本数据点的平均值作为新的质心 ➢C1: (0, 0)➢C2: (6.2, 5.6) ◼无 监 督 学 习 具体地,给定样本集𝐷=ሼ𝒙1,𝒙2,…,𝒙𝑚},初始簇随机划分为𝐾个类,即𝑪=ሼ𝐶1,𝐶2,…,𝐶𝐾},K均值算法尝试最小化平方误差,即: ➢E刻画了簇内样本和簇内均值向量之间的紧密程度:E值越小,则簇内样本相似度越高 ➢NP难问题:是计算机科学中的一类复杂问题,它们的共同特点是: 目前没有快速算法可以在多项式时间内解决这些问题;随着问题规模的增大,求解时间可能会急剧增长;通常采用近似算法来寻找可行解。 ➢贪心策略:在解决问题时每一步都选择当前看起来最优或最有利的选项,而不考虑后续可能的影响或整体最优解。虽然贪心策略简单且通常能快速得到一个可行解,但它不一定总能找到问题的最优解,尤其在复杂问题中,局部最优不一定等于全局最优。 3 . 2经 典 算 法 ◼无 监 督 学 习 ➢K-means算法的优势:直观性强;计算高效;实现简便 ➢K-means算法的局限 对初始聚类中心的依赖性:K-means算法的性能高度依赖于初始聚类中心的选择。不恰当的初始中心可能导致聚类结果偏离最优路径,甚至产生不稳定现象。为解决这一问题,可采用K-means++等启发式策略来优化初始中心的选取,从而提高算法的稳健性和准确性。 容易陷入局部最优解:K-means算法在迭代过程中倾向于采用贪心策略,这虽能加速收敛,但也容易使算法陷入局部最优解而无法达到全局最优。为克服这一局限,建议采取多次重启算法的策略,每次使用不同的初始中心,或结合全局优化技术,以增强算法的搜索能力和解的质量。聚类数K的预设问题:在应用K-means算法前,必须预先设定聚类数K,这一参数的确定往往依赖于问题的复杂性和数据的具体特征。不恰当的K值可能导致聚类结果无法真实反映数据的内在结构或实际需求。在实践中,应借助轮廓系数等评估指标来辅助选择合适的K值,以确保聚类结果的合理性和有效性。 本 章 目 录 3 . 1机 器 学 习 概 述 3 . 2经 典 算 法 3 . 3模 型 评 估 与 选 择 3 . 4当 代 机 器 学 习 简 介 3 . 3模 型 评 估 与 选 择 ◼经 验 误 差 与 过 拟 合 ➢针对已训练完成的模型实施科学严谨的性能评估,不仅是机器学习流程中的一项基本任务,更是确保模型质量、指导后续优化方向的关键所在,是机器学习领域必须正视并妥善解决的核心问题之一。 ➢误差泛指模型预测输出与真实标签之间的偏差 训练目标:让误差尽可能地小 经验误差(训练误差):模型在训练集上的误差 泛化误差(测试误差):模型在新样本即测试集上的误差 3 . 3模 型 评 估 与 选 择 ◼经 验 误 差 与 过 拟 合 ➢欠拟合通常发生在模型复杂度不足时,此时模型无法捕捉到数据中的基本模式,导致在训练集和测试集上的表现均不佳 ➢过拟合是模型复杂度过高带来的副作用,模型虽然能完美拟合训练数据,却也因此学习了过多的噪声和细节,使得在测试集上的泛化能力大打折扣 ◼经 验 误 差 与 过 拟 合 欠拟合与过拟合的解决方法 ➢欠拟合 统计学习理论指出,若训练集与测试集的抽样完全随机无偏,直接提升模型泛化能力的手段有限;但若两者收集过程遵循一定假设或规律,则可据此设计更为有效的算法策略,从而增强模型的泛化能力。 在决策树模型中加深树的深度在神经网络训练中增加迭代轮次 ➢过拟合 正则化 过拟合无法从根本上消除,只能通过各种手段减轻其影响或降低其风险 3 . 3模 型 评 估 与 选 择 ◼评 估 方 法 ◼留出法通过随机分割数据集为两部分,简单直接地实现了训练集与测试集的分离 ◼交叉验证法通过多次划分数据集并迭代训练测试过程,提供了更为稳健的评估结果,适用于对模型性能要求较高的场景 3 . 3模 型 评 估 与 选 择 ◼评 估 方 法 ➢留出法(Hold-out Method)是一种直接且基础的数据集划分策略,它将原始数据集D明确划分为两个互不重叠的集合:训练集S与测试集T。在S上进行模型的训练过程,随后在T上评估其测试误差,以此作为对模型泛化能力的一种近似估计。 需要考虑的因素: ①样本类别分布上应保持一致性,以避免因分布偏差导致的误差估计失真。 ②合适的划分比例。 ➢若训练集S占比过高,虽能更全面地反映整体数据集D的特征,但可能导致测试集T规模过小,进而使得评估结果易受随机波动影响,缺乏稳定性➢反之,若测试集T占比过大,虽能提供更丰富的测试样本,但训练集S的代表性将减弱,可能无法充分训练模型,影响评估结果的保真度。 ③随机性因素影响。采用多次随机划分与