您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [人工智能通识教研组]:人工智能通识:第六章 智能之眼——视觉感知 - 发现报告

人工智能通识:第六章 智能之眼——视觉感知

2026-06-29 人工智能通识教研组 文梦维
报告封面

《人 工 智 能 通 识》教 研 组 本 章 目 录 本 章 目 录 6 . 1计 算 机 视 觉 简 介 及 发 展 历 史 6 . 1计 算 机 视 觉 简 介 及 发 展 历 史 ◼计算机视觉简介 ➢定义 计算机视觉是人工智能的一个重要分支,旨在让机器“看”并理解世界。核心任务是从图像和视频数据中提取有意义的信息,用于图像识别、分析、解释和交互。 ➢重要性 人类获取的信息大部分是通过视觉系统获得的,这让视觉感知成为了AI领域的一个关键研究方向。计算机视觉在人工智能领域中具有重要地位,是实现人机交互、智能制造、自动驾驶等关键技术的基础。 6 . 1计 算 机 视 觉 简 介 及 发 展 历 史 ◼计算机视觉发展历史 20世纪50年代——二维图像的分析与识别 1959年,大卫·休伯尔和托斯登·威塞尔通过猫的视觉实验,揭示了大脑皮层细胞对不同视觉特征的感知机制,奠定了生物视觉和计算机视觉的基础。1959年,拉塞尔·基尔希等人发明了首台数字图像扫描仪,推动了数字图像处理技术的发展。 20世纪60年代——聚焦三维视觉理解 1965年,拉里·罗伯茨在《三维固体的机器感知》中提出了从二维图像提取三维信息的方法,开启了计算机视觉研究的新纪元。 1966年,西蒙·派珀特领导的“夏季视觉项目”推动了计算机视觉作为独立科学领域的发展。1969年,威拉德·博伊尔和乔治·史密斯研发了电荷耦合器件(CCD),极大提高了数字图像采集的效率。 6 . 1计 算 机 视 觉 简 介 及 发 展 历 史 ◼计算机视觉发展历史 20世纪70年代——理论体系的系统化构建时期 1977年,大卫·马尔提出“计算视觉”理论,创新性地描述了视觉信息处理的阶段性模型,为后续研究提供了理论框架。 20世纪80年代——独立学科的确立与理论向应用的飞跃 1982年,大卫·马尔的《Vision》一书推动了计算机视觉理论的成熟,标志着该领域成为独立学科。1982年,日本COGEX公司推出了首套工业光学字符识别系统,标志着计算机视觉开始进入工业应用。80年代末,杨立昆改进了卷积神经网络,提出了LeNet-5模型,奠定了现代卷积神经网络的基础。 6 . 1计 算 机 视 觉 简 介 及 发 展 历 史 ◼计算机视觉发展历史 20世纪90年代——特征对象识别开始成为研究重点 1997年,吉滕德拉·马利克团队运用图论算法进行图像自动分割,为图像理解打下基础。1999年,大卫·罗伊提出了尺度不变特征变换(SIFT),极大提高了物体识别的准确性和鲁棒性。1999年,NVIDIA推出GPU,开启了并行计算和图像处理的新纪元。 21世纪初,聚焦图像特征工程、构建拥有标注的高质量数据集 2001年,保罗·比奥拉和迈克尔·琼斯提出了第一个实时人脸检测框架,推动了人脸识别的发展。2005年,纳维特·达拉尔和比尔·特里格斯提出了基于方向梯度直方图(HOG)的行人检测方法,成为重要的视觉工具。2006年,斯维特拉娜·拉泽比尼克提出空间金字塔匹配(SPM)方法,提升了图像识别性能。2006年,Pascal VOC数据集推出,极大推动了对象分类技术的发展。2006年,辛顿等人引入了“深度学习”概念,推动了深度学习技术的兴起和广泛应用。 6 . 1计 算 机 视 觉 简 介 及 发 展 历 史 ◼计算机视觉发展历史 2010年至今——进入深度学习时代 2010-2017年,ImageNet数据集与挑战赛的推动:2009年,李飞飞教授及其团队发布ImageNet数据集,极大丰富了计算机视觉领域的研究数据资源。从2010年到2017年,ImageNet挑战赛(ILSVRC)成为推动深度学习技术快速发展的重要平台,极大提升了目标检测等视觉任务的性能。 2012年,AlexNet的突破:2012年,亚历克斯·克里切夫斯基、伊尔亚·苏茨克维和杰弗里·辛顿提出的AlexNet深度卷积神经网络赢得ImageNet竞赛,标志着深度学习正式成为计算机视觉的核心技术,推动了卷积神经网络(CNN)的广泛应用。 6 . 1计 算 机 视 觉 简 介 及 发 展 历 史 ◼计算机视觉发展历史 2014年,生成对抗网络(GAN)提出:伊恩·古德费洛提出GAN,通过生成器与判别器竞争优化,革新了图像生成技术,成为计算机视觉领域的重大突破之一。 2017年,PyTorch和TensorFlow的普及:PyTorch和TensorFlow两个深度学习框架的崛起,迅速成为研究人员的主流工具,为包括图像分类在内的多项任务提供了强大的支持。 2017年,Mask R-CNN和特征金字塔网络(FPN):林宗毅等人提出特征金字塔网络,实现多尺度特征融合。何恺明等人提出的Mask R-CNN在实例分割任务上取得重大进展,广泛应用于自动驾驶和医疗图像等领域。 2020年,Transformer模型进军计算机视觉:Vision Transformer(ViT)的提出标志着Transformer模型正式应用于视觉任务,并迅速成为目标检测、语义分割和图像分类等任务的基础架构。 2020年,扩散模型的引入:扩散模型作为生成模型的新范式,在图像生成与编辑中表现优异,丰富了计算机视觉领域的研究工具。 2023年,Segment Anything Model(SAM):SAM模型凭借其零样本学习能力,在视觉分割领域取得突破,为下游应用提供了广泛的可能性,预示着计算机视觉向智能化和自动化迈进。 本 章 目 录 6 . 1计 算 机 视 觉 简 介 及 发 展 历 史 ◼图像获取时面临的质量问题 光照不足 01 在光照不足的情况下,图像往往会出现暗区、阴影和噪声,影响图像质量。 摄像设备限制 02 摄像设备的性能限制,如分辨率、动态范围等,会导致图像细节丢失、色彩失真等问题。 传输干扰 03 图像在传输过程中可能会受到各种干扰,如电磁干扰、信号衰减等,导致图像质量下降。 ◼图像增强目的 提高图像的清晰度,或是突出图像中的某些有用信息,同时压缩或去除其他无用的信息,从而使图像更加符合人眼视觉习惯或便于机器解析。 ◼广泛的应用场景 图像增强在多个领域中展现出重要价值,如医疗图像的增强、监控系统的图像处理、遥感图像的分析等,并作为目标识别、跟踪、特征匹配、图像融合等高级图像处理算法的预处理步骤,发挥着至关重要的作用。 6 . 2图 像 增 强 ◼早期阶段的信号处理技术 ➢时域处理方法 滤波技术、非凸低秩优化策略、直方图均衡化、灰度变换、锐化滤波等,直接对图像像素进行操作,改善图像对比度与亮度。 ➢频域处理方法 傅里叶变换、小波变换、离散余弦变换等,将图像转换至频率域进行处理,实现图像去噪、边缘增强等效果。 6 . 2图 像 增 强 ◼深度学习的引入 ➢单域网络架构原理 单域网络架构主要针对单个图像域进行训练,如空域或频域,通过卷积神经网络(CNN)等模型,提取图像特征并重建高质量图像。 ➢单域网络架构局限性 单域网络架构在处理具有多种复杂降质因素的图像时,难以同时恢复图像的细节和纹理信息,导致图像质量不尽如人意。 ➢时域与频域结合方法。 综合运用时域与频域处理技术,探究多域协同和多尺度融合技术提高图像增强效果,满足复杂场景需求。 ◼图像领域关键任务 6 . 2图 像 增 强│图 像 超 分 辨 率 ◼图像超分辨率 难点分析 任务描述 旨在从低分辨率图像中重建出高分辨率图像,同时尽可能地保留和恢复原始图像中的细节和纹理信息。 图像细节丢失、图像噪声、算法复杂度高。 ◼经典方法——SRCNN(Super-Resolution Convolutional Neural Network) ◼SRCNN是2014年提出的首个成功用于图像超分辨率的深度学习模型。它通过卷积网络从低分辨率图像中提取细节并生成高分辨率图像。流程包括:上采样、特征提取和重建高分辨率图像。SRCNN以其简洁高效的设计为图像超分辨率研究奠定了基础,但存在网络深度不足、训练慢以及仅适用单一尺度的局限。 ◼经典方法——VDSR(Very Deep Super-Resolution) ◼金日元等人在2016年提出了VDSR模型,该模型通过深度卷积神经网络学习图像的残差信息,并结合插值放大的图像来恢复细节和提高分辨率。VDSR由20层卷积层组成,使用3×3卷积核来提取多级别特征,最后生成并加回残差图像,得到高分辨率图像。该模型通过残差学习加速训练,缓解梯度消失问题,且能处理多种缩放因子。VDSR显著提升了图像细节恢复能力和训练效率。 6 . 2图 像 增 强│图 像 超 分 辨 率 ◼张宇伦等人提出了残差密集网络(RDN),旨在解决现有超分辨率方法对中间层特征利用不足的问题。RDN通过残差密集块(RDBs)实现每层特征的充分利用,并采用局部残差学习和密集连接增强网络的训练稳定性和特征表达能力。RDN结构包括浅层特征提取、残差密集块、全局特征融合和上采样网络。它通过整合局部和全局特征提升超分辨率性能,具有较强的鲁棒性,能够处理多种退化模型,实现高质量图像重建。 6 . 2图 像 增 强│图 像 超 分 辨 率 ◼图像超分辨率的应用 实现了从低分辨率输入到接近原生高分辨率输出的高效转换,从而在降低显卡负担的同时,保证了游戏画面的流畅性和视觉质量 修复老照片、扩大图片尺寸及智能修复图像破损 6 . 2图 像 增 强│图 像 超 分 辨 率 ◼未来超分辨率重建技术的发展趋势 更大超分辨率倍数的探索 探索并实现更大倍数的图像超分辨率技术,不仅能够使远距离捕获的图像细节更加丰富,还能有效降低数据传输成本,提升整体效率。 实时超分辨率重建 未来超分辨率重建技术将更加注重实时性,能够在短时间内完成大量图像的超分辨率重建。 模型的可解释性 通过优化算法设计,使模型决策过程更加透明,便于医疗专家验证与信任。 6 . 2图 像 增 强│低 光 图 像 增 强 ◼低光图像增强 任务描述 技术应用 在低光环境下,图像通常模糊且噪声多,这会影响后续处理和分析。低光照图像增强技术通过改善亮度和对比度,使图像更加清晰。 低光照图像增强技术在夜间摄影、安全监控、自动驾驶等领域得到了广泛的应用,拓宽了图像技术的应用范围,增强了信息的可用性和准确性。 6 . 2图 像 增 强│低 光 图 像 增 强 ◼经典方法——RetinexNet ◼Retinex理论是一种用于低光照图像增强的经典方法,由埃德温·赫伯特·兰德提出。它通过分离图像的反射率和 光 照 分 量 来 调 整 光 照,保 持 物 体 颜 色 稳 定 性,广 泛 应 用 于 图 像 增 强、非 均 匀 光 照 校 正 等 领 域。RetinexNet是基于Retinex理论的深度学习改进版,通过两个子网络分别处理反射率和光照分量,增强低光照图像。RetinexNet利用卷积神经网络进行分解、降噪和光照调整,并通过跳跃连接确保图像处理的效果。 6 . 2图 像 增 强│低 光 图 像 增 强 ◼经典方法——Zero-DCE ◼Zero-DCE是一种无需参考图像的低光图像增强方法。该方法通过像素级曲线估计调整图像亮度和对比度,不依赖成对数据,适用于复杂光照条件。Zero-DCE使用轻量级网络结构和非参考损失函数,模型通过7层卷积层和跳跃连接保留图像细节。其核心是通过多次迭代的曲线估计来精确调节亮度,避免过度增强。为了实现无参考训练,设计了空间一致性、曝光控制、颜色恒常性和光照平滑等损失函数,确保增强后的图像自然、清晰。 6 . 2图 像 增 强│低 光 图 像 增 强 ◼低光图像增强的应用 阿里达摩院研发的车载摄像头ISP处理器(AliISP),通过3D降噪和图像增强算法,提升了夜间车载摄像头的图像识别能力,应用于自动驾驶