序言 人工智能正推动人类社会的又一次生产力变革。正如蒸汽机开启机械化时代,电力催生电气化时代,计算机与互联网引领信息化时代,人工智能正以前所未有的速度与深度重新定义人们生产、生活的方方面面。 当前,人工智能的一大核心命题是赋能物理世界。尽管大模型在自然语言处理和计算机视觉等任务上已取得显著进展,但单一、有限的模态,无法完整描述一个真实的物理世界。就像人类通过“视听嗅味触”等五感与物理世界交互,进而实现对世界的感知和认知,大模型同样需要处理更全面、更实时、更精准的信息,才能更好地映射、理解物理世界,洞察深层规律,为人类创造更多福祉。 正是基于这一认知,海康威视打造了“多、快、准、省”的观澜大模型技术体系,期望通过强大的物联感知和认知能力,洞察万物的状态和规律,帮助物理世界和数字世界实现更好地联接,推动社会、产业和生活的智能化发展。 在模型能力方面,我们聚焦发力物联感知大模型、多模态大模型,这是物理世界数字化的基石,也是海康威视积累深厚的优势所在。我们打造了视觉大模型、音频大模型、光纤大模型、X光大模型、毫米波大模型等多种模态的物联感知大模型,并取得很好的落地成效,比如毫米波大模型助力海康睿影成为业内首家通过中国民航A3等级认证的设备厂商。多模态大模型层面,我们依托图文多模态大模型,实现亿级视频数据的自然语言秒级检索,推动摄像机从单一视觉感知向深度智能理解的跨越。同时,面向特定的细分场景,推出安全生产、工业制造等系列垂类大模型,满足不同行业用户差异化的智能需求。在产品化方面,我们全面拥抱AI大模型,发布了上千款大模型软硬件产品,形成规模化应用,让大模型从技术走向场景有了实质的支撑。在落地中,我们灵活支持云边端协同、大小模型协同、不同模态的模型协同,为用户提供适配的部署方案。 应用场景是大模型的“磨刀石”。中国拥有超大规模市场、全球最丰富的应用场景,这为AI大模型从“可用”走向“好用”“规模化应用”,提供了得天独厚的土壤。过去几年,我们不仅将大模型技术应用到千行百业的用户现场,助力提质、降本、增效、安全,也应用于自身研发、制造、营销和服务等环节,有效提升了公司的运营效率和能力。2025年,海康威视凭借“数智质量”质量管理模式荣获第五届中国质量奖,打造的“物联感知产品大规模个性化定制智能工厂”入选全国首批“领航级智能工厂”培育名单。 在智能化的时代大潮中,海康威视期待携手更多合作伙伴,将大模型技术深度应用到各行各业的场景中去,为用户解决痛点问题,创造切实价值,共创智能化新未来。 海康威视高级副总裁浦世亮 目录 第一章大模型引领人工智能发展..........................................1 1.1大模型技术的跨越式发展.............................................11.2大模型落地的价值与挑战.............................................21.3海康观澜大模型技术体系.............................................3 第二章基础大模型.....................................................6 2.1物联感知大模型.....................................................62.2多模态大模型......................................................172.3语言大模型........................................................18 第三章垂类大模型....................................................19 3.1安全生产大模型....................................................193.2工业大模型........................................................253.3连锁巡检大模型....................................................313.4园区大模型........................................................323.5公共安全大模型....................................................343.6城市治理大模型....................................................353.7交通管理大模型....................................................363.8自然灾害监测大模型................................................373.9基础设施巡检大模型................................................38 第四章大模型产品....................................................40 4.1大模型硬件产品....................................................404.2大模型软件产品....................................................77 第五章行业实践与案例.................................................93 5.1行业实践..........................................................935.2实践案例.........................................................143 第六章大模型合规与安全治理..........................................168 6.1大模型合规治理目标与实践.........................................1686.2大模型全生命周期安全治理目标及体系建设...........................1706.3大模型全生命周期安全治理实践.....................................171 第七章总结与展望...................................................174 第一章大模型引领人工智能发展 1.1大模型技术的跨越式发展 2022年11月,ChatGPT的发布标志着大模型正式进入公众视野,其用户数量在短短两个月内突破一亿,展现出自然语言交互的巨大潜力,让业界意识到大规模预训练模型能够涌现出远超预期的能力。 2023年3月,GPT-4在语言理解与生成能力上实现重大突破,随后GPT-4V实现了视觉与文本的统一理解,大模型从单模态向多模态迈出关键一步。同年,Meta发布LLaMA系列并逐步开源,推动了开源大模型生态的快速成长,Mistral、Qwen、GLM等大模型相继涌现,大模型技术进入百花齐放的快速发展期。 2024年,大模型的规模法则(Scaling Law)不断扩展,模型能力持续跃升。OpenAI先后推出GPT-4o和o1推理模型,在数学、代码等复杂推理任务上展现“慢思考”能力,通过更长的内部推演获得更高质量的输出,被视为继GPT-3.5到GPT-4之后又一次范式突破。Anthropic的Claude 3系列凭借长上下文窗口与安全对齐表现占据重要位置,GoogleGemini持续迭代并在多模态理解上发力。国产模型方面,DeepSeek系列模型以开源路线引发全球关注,其高效的模型架构设计和训练策略创新引起业界广泛讨论;阿里巴巴Qwen系列模型、智谱GLM、月之暗面Kimi等大模型在不同场景中各具优势。 2025年以来,AI Agent开始从概念走向实际应用,大模型从“对话式AI”向“执行式AI”演进。Agent以大模型为基础,具备规划、记忆和工具调用能力,能够自主完成多步骤复杂任务。OpenClaw作为代表性Agent开源框架创下全球开源项目增速纪录,推动自动化工作流成为现实。与此同时,具身智能成为最受关注的前沿方向之一。大模型为机器人注入语义理解与任务规划能力,使其能够响应自然语言指令并拆解为可执行的动作序列,在运动控制、灵巧操作等维度持续迭代,业界普遍认为其将在数年内进入规模化应用阶段。 此外,模型规模持续增大带来的推理成本与能耗问题日益突出,效率优化成为行业共识。模型量化压缩、知识蒸馏、稀疏注意力、混合专家(MoE)架构等技术逐步成熟并进入实际部署。算力竞争正从规模堆叠转向智能密度竞争,万亿参数模型与高效推理的平衡成为技术演进的新热点。 1.2大模型落地的价值与挑战 除了技术能力的跃升,在行业落地方面,大模型也已从概念验证进入规模化应用阶段,驱动行业应用的范式从“小模型开发定制”向“大模型通用底座+垂类适配”转变。 在感知层面,大模型通过海量预训练获得强大的特征表征能力,显著提升了跨场景泛化能力和性能上限。传统深度学习模型往往需要针对每个场景单独采集数据、训练模型,实施成本高且泛化能力有限;大模型则通过预训练蕴含了丰富的视觉、音频、语言等知识,使下游任务能够在少量标注数据下快速适配。在智能感知领域,这一能力直接转化为复杂环境下目标检出率的提升和误报率的下降,细粒度分析的能力也显著提升。 在认知层面,大模型依托海量知识内化与思维链机制,突破了传统系统依赖人工规则与硬编码逻辑的局限,实现了对复杂语义的深度解析与综合决策。如在智能客服场景,大模型能够精准解析用户模糊多样的口语化诉求,通过多步逻辑推理厘清业务症结,为后续处置提供准确的判断依据;在营销推荐场景,大模型可深度理解用户的个性化需求描述,通过推理用户偏好与产品间的隐性关联,输出精准的推荐策略。大模型正推动行业AI从“辅助识别工具”升级为具备深度理解与决策能力的“智能大脑”。 在执行层面,大模型作为Agent技术的大脑,通过自主规划、工具调用、长期记忆等能力,把用户意图快速转化为可执行指令,完成复杂规划任务。如在安全生产、交通管控等领域,通过智能体实现告警事件的自动化分析处置,推动行业解决方案从传统的事后取证向事中实时调度、事前主动预警转型,未来与具身智能的结合,还将实现从信息空间到物理世界的直接行动。 尽管大模型行业价值清晰,但落地进入深水区后,几个核心挑战仍然突出。一是行业需求碎片化,不同场景的任务要求、目标类型差异显著,高质量的行业标注数据获取难度大,通用大模型难以直接满足每个细分场景的精度要求。二是推理成本与部署条件的刚性约束,端侧、边缘侧设备的算力、内存空间有限,成本敏感或实时性要求高的场景难以承受大参数量模型的推理开销。三是从技术验证到业务闭环的最后一公里,大模型需要与传感器、平台软件、管理流程形成端到端的前后协同、软硬协同,这不仅是模型能力问题,更是工程化与系统化问题。 1.3海康观澜大模型技术体系 人工智能技术一直是海康威视的核心技术之一,二十余年来,海康威视深度参与并推动智能物联行业的智能化升级进程,持续迭代产品的智能化能力,探索适配客户需求的技术落地路径,全程见证并引领了智能分析与人工智能算法在行业内的发展。海康威视早在2006年就组建了智能算法团队,2018年发布AI开放平台,并获批“视频感知”国家新一代人工智能开放创新平台;2023年发布“海康观澜大模型”