00:00:01 大家好,欢迎参加国泰海通计算机专家谈模型与软件的关系,AI应用进展如何。目前所有参会者均处于静音状态,下面开始播报。 00:00:13 声明,本次电话会议仅服务于国泰海通证券正式签约客户,会议音频及文字记录的内容仅供国泰海通证券客户内部学习使用,不得外发,并且必须经国泰海通证券研究所审核后方可留存。国泰海通证券未授权任何媒体转发此次电话会议相关内容。未经允许和授权转载转发均属侵权,国泰海通证券将保留追究其法律责任的权利。国泰海通证券不承担因转载转发引起的任何损失及责任。市场有风险,投资需谨慎。提醒广大投资者谨慎做出投资决策。 00:00:52 好的,呃,线上的各位领导啊,下午好啊,我是国泰海通计算机分析师朱瑶啊,非常啊,感谢大家参加我们今天的专家会啊。我们今天呃也很荣幸邀请到这个行业里面比较资深的专家啊。专家呢,他在这个。大模型算法软件行业呢也有接近10年的一个工作经验啊,也是在这个大厂里面担任技术负责人的这样的一个职位,所以说对整个这个啊模型跟应用啊也是有呃比较深的这个理解。所以啊我们今天也邀请这个专家来给我们做一下分享。 00:01:24 那么呃我也话不多说啊,把时间交给专家啊,首先呃请专家为我们整体去讲一下,现在这个大模型跟啊应用软件的整整个行业的这样的一个啊发展啊。然后后续的话等专家分享完,大家如果有什么问题啊,我们也呃这个可以随时啊向专家请教好吧。接下来有请专家,谢谢。 00:01:48 哦,好的。嗯,我觉得这个事情其实它的时间顺序还是很重要的。嗯,所以而且呢,到底模型在不同阶段它能解决什么样的问题,然后在它当它某一个阶段内对软件行业的产生的 影响,所以我觉得这是至少是一个两维的事情吧。嗯,那所以我觉得只能分几个部分来介绍。 00:02:10 我觉得第一个部分的话呢,还是先从模型这个方面入手吧, 00:02:14 我觉得模型这个方面的话呢,重点其实是介绍3个角度,就是第一个角度的话呢是输入理解型的模型。那这个地方其实容易被大家忽视,就是因为这种模型的话,呃,它其实是比文生文的模型的可用性要好的。因为我们大多数的场景不是用文字在跟模型交互嘛,对吧,这个太太麻烦了,而且太单一那个繁琐了,所以实际上如果我们能够用这种图片图像,然后或者语音的方式能够跟模型交互的话,它的可。用性才能提升,然后才会推进到这个软件层面。那所以这个第一个点就是输入型的模型与软件的关系其实反而更强啊,不是联关联更紧密。 00:02:59 那在这个角度上呢,那我其实要就是分别简单描述一下吧,就是有两个值得我们关注的模型。然后第一个其实是这个字节的2025年的年中间,就五六月份发的视觉理解型的模型,然后它大概有三个场景,就第一个场景是呃比如用于工业摄像头或者直播间的音视频理解,它是有这样的一个功能的, 00:03:24 然后第二部分的话呢其实。是一个离线的分析,就是我们给他一段视频,然后他可以解读每一秒演了什么,或者我们让他挑出一个啊,就是什么一个人或者一个字幕在哪一秒出现的,这也是可以的。然后还有一种情况,其实是多图片的综合理解。啊,就是多张图片,我们可以问他这个图片表述了一个什么样的故事,那这个也是可以的。 00:03:47 那第二个节点的话,其实是二五年的Gemini3,那就是Gemini3,它就变成了一个原生多模态端到端综合理解的模型。啊,反正我个人曾经试过一个很夸张的例子,就是用一张手写的这个菜单,然后把它还附带一个有其他文字的这个图像上吧,在那个其他文字比如附到书里,然后同时让模型自己去理解,然后再再让它给我生成页面菜单页面,这都是可以的。 00:04:15 甚至有人用Gemini3去直接做直播,就是只比真正式比赛延迟一两分钟,然后就可以让Gemini3自己生成字幕,然后再转语音,一个AI直播员都有了,那所以其实这个我们听起来,它对软件和这个整个行业的发展其实影响应该是最大的。 00:04:36 那么这个地方的问题其实就是为什么这两个模型到当前,然后我们没有看到它对软件行业产生影响,然后或者说是挣很多钱吧,务实一点,所以其实他们是各自遇到了问题。 00:04:48 呃,比如以Genet3为例,它是推理的消耗实在是太大了,然后所以Google一直试图找到一个折中的版本,就是让模型变笨一点,就做一些量化,然后能节约一些推理算力,然后让他手里的算力能够支撑起这个市场。但是一直没有成功。所以我们看到的事情就是Gemini3后面的版本没有一个成功的,总就已经看不懂他在做什么了。其实是他在做一种实验,但是一直都不成功。 00:05:14 然后字节的那个视觉系列的模型,是被合并到了自己的这个豆包基础大模型里面啊,然后被很多用户给忽视了。所以这个东西其实就是变成了可我们暂且可以认为它是这个酒一般,但是巷子太深了,然后那个再加上价格问题啊,其实没有得到广泛的应用,那这个是其实是一个角。 00:05:36 角度然后另外还有两个角度的话呢,其实先说简单的就是文生视频啊,可能我们看到今年文生视频是很挣钱的,尤其是在国内像CD2.0这样的模型。但其实还有一个问题就是它主要生成的视频都是24帧的,但是24帧这个内容它其实是不上不下的。就是不上的原因是,比如好莱坞对吧,或者一些专业的影视集团,它需要一个模型来做这个降本,然后来做拍摄, 00:06:04 其实是很难的。虽然电影也是24帧,但是他要的是真人的逼真度啊。那哪个电影靠的不是明星呢?或者是这个很就是那种很过瘾的动作打斗呢?但问题就是24帧的当前这个模 型它只匹匹配了一半儿,另外一半的真人感它是解决不了的,就是锐化感太严重了。所以其实它在电影里反而只能做一些边角场景。 00:06:29 但是反过来让他做短视频又出个新问题,就是我们生活中手机录下来的视频其实是每秒30帧以上的,所以就我们会发现我们手机拍的视频比AI生成的视频节奏要快特别多,那其实是这样的。那所以就是文生视频那个,本来它应该在很大的一个软件领域内发挥价值,但是当前还没有,那是因为它这个需要一段时间的迭代。 00:06:55 大概是这样的,然后中间其实是这个大语言模型,呃,就是大语言模型。我我知道咱们肯定很多人就是会用中美模型去之间去对比啊,尤其是我觉得比如说美国御三家的模型,然后每一次每就是应该是他们的最新版本啊,就成了我们国内模型的一个标杆了对吧。就是每一次我们国内任何一家公司把任何一个新模型,一定要跟御三家的最新版去做一个对比, 00:07:21 所以比如最近我们听到最多就是这个fiber5,简直它就是一个这个参照物了。所以在这里面其实解释一下,就是呃大语言模型已经从一个维度扩展成了两个的维度,那这第二个维度主要其实是美国公司进展是比较好的, 00:07:40 比如我们刚才提到的Gemini,它是一个原生多模态端到端。那这里面有一个最重要的变化就是它的原生多模态的综合理解能力,那这其实是一种可用性的变化,而不是我们问他这个我去洗车要不要。要开车不是问这样一个问题,他能不能答对那所以其实这个是一个功能可用性的问题,然后甚至包含OpenAI也一样, 00:08:02 它其实在就5.4的时候就推出了模型及Agent,就是我们跟模型说你是Agent,它现在就变成Agent了,我们是不需要任何软件的。呃,包括它现在进步到5.6之后,给用户的建议就是可以不再用codex了,就是他自己主动地这个把模型和codex集成到一起了,那其实这也是一种功能性的进步。 00:08:24 然后第三类其实就是我们都知道的Anthropic,不论是cowork,然后它的skill MCP以及它的这个模型的综合解决问题的能力,这其实也是一种可用性的质的突破。那大概是这样的一个情况,那么所以在这个维度上,呃和原本的文本模式就不行不一样了。我们原本其实只是觉得模型有超强的思考力和检索力嘛,对吧,那现在这种情况就是它的可用性也明显变强了,那当然是这样,而且在这里呢可以添加一句啊。 00:08:55 再加一句就是。跟我们最近的一些模型进展有关, 00:08:59 比如说昨天发了这个Kimi的K3,那K3其实是最接近这个Anthropic的思路的,就是Anthropic做模型的思路啊,就不不针对Fi豹5啊,那个也可能是opus系列的,那这大概是这样一个点。那虽然包括我个人, 00:09:16 就我个人,我在这个生活中,平时也工作中也会听到大家总是用质谱去这个对标Anthropic的模型。其实这里面我觉得那个有一个误解,这个或者说有一个偏差,那这个偏差就是说,呃质朴是他的模型在编程领域表达这个表现得非常优秀吧,这个是没有问题的。 00:09:38 但是这里我们其实要注意,它其实是圈定在编程领域的这个范围内,那么我们把它具象化一点是怎么样呢?具象化一点就是我们给他一个需求,那这个需求一般就是这个很明确的,比如说让编程竞赛题或者让他给一个改一个bug啊,或者我们给他一个很详细的这个设。你文档让他来帮我写一个软件,那这件事情是以叫叫做与编程直接相关。我觉得质谱的表现确实不错,尤其是到5.2之后。 00:10:05 但另外一个问题是啊,招它其实的提供的价值是反过来的是反过来的,反过来就是说我们看到它的收入很高,呃,其实人家是概括性的,说是to b的收入,或者叫与编程相关的tob的收入, 00:10:22 那这个事情该怎么理解呢?这个事情其实就是说, 00:10:25 比如说企业他可能会跟你模型提供方说,我有自己的流程,我有自己的模式,甚至我有内部的数据和一些专业术语,那这些东西你模型肯定不知道。那那这个时候我采购你的模型来给我的员工提效也好,或者完成我的一些工作也好,中间有一个断档,就是我内部的专业知识你模型都不知道。而且不仅仅是建一个这个rag型的检索数据库这么简单,他可能思维模式都跟不上我们员工的工作模式。那这个时候怎么解决? 00:10:53 这个时候其实呃,招聘组给他的企业给他的企业客户的方案就是如我coworker加我自己的模型,而我的模型非常聪明,你可以让我的模型生成,你可以给他一些完善的提示词,他就可以给你生成匹配你企业内流程的Agent。那其实是这样的,然然后在这种模式的工作过程中,然后我们可能会遇到一些问题,对吧,就模型要去办事了。那这个时候他遇到的事情可能是开网页查邮箱对吧,然后以及这个一些这个调用其他的软件,那一般我们知道的成成熟的商业软件都有API,那所以模型在解决这些问题的时候,那么它其实是可以主动以写代码的形式把这活给做好。 00:11:34 那所以这里面有个关键。点就是遇到一个综合性的问题或者一个白领的办公问题,模型会自主决定去写代码,然后写代码写的是又快又好。那这个是一个思路,那是一种方式,而不是说一定是我们用户告诉他我就要写一个项目了,写改一个bug了。所以这种模式下其实是Kimi一致追求的事情啊,当然是这样,那所以就是在实际上模型的思维和工作方式上,呃Kimi是更接近Anthropic这种模式的, 00:12:03 那这个其实是一个基本情况,那就是为什么要介绍一下这个三大类模型的基本情况呢?那我们第二个点其实。要看的就是这个呃,就是大模型发展这两三年以来对吧,然后对软件行业的一个影响。那我觉得这个里面其实就是可以按照时间轨迹去说,呃,我觉得第一个点其实是第一个点,应该其实是这个就刚才我提到的是大语言模型,然后写代码解决问题的能力变强了。那这个其实是第一个节点,那就是对软件产生真正的冲击,我觉得这个节点的话应该是在去年的下半年,呃,大概是这样,那所以这件事情的话呢就是。 00:12:44 呃,比如像那个美国那些saaras公司吧,包括甚至包含snowflake data breaks,然后以及一些其他的SaaS型的服务公司,比如Salesforce对吧,这个其实他们有一个共性啊,就比如Salesforce我们可以定性为它是一个高级的CRM。 00:13:00 但是像snowflake或者Databr