芯片出口许可高端算力大模型进展模型团队工程师分享训练芯片出口许可芯片出口许可高端算力大模型进展模型团队工程师分享训练芯片出口许可板块的大幅反弹以及国内芯片的出口许可,以及高端算力和模型训练和应用的未来方向。模型,特别因拥有大量优质训练资源,在视频理解与生成方模型方面的动态,包括领域的具体项目、模型发布计划以及 在此次投资人会议上,讨论主要集中在GLK新模型及其在强化学习中的应用。新模型在强化学习环节引入了ov ggt以辅助推理,预期其他模型厂商会跟进,但跟进的门槛和难度主要体现在数据质量、算力约束以及工程积累等方面。会议中还提到,联网搜索功能的加入使得数据质量差异缩小,而算力成为厂商之间主要区别之一。此外,强化学习的调教也需一定工程积累。会议最后提到了线上参会者的提问环节。30:07算力需求增长与训练优化的探讨对话主要围绕算力需求的增长和训练优化的问题展开。讨论指出,今年算力需求的增长主要来自于推理阶段,而非训练阶段。尽管训练阶段的算力消耗包括模型尺寸大小、训练数据大小以及总算力消耗等因素,但模型尺寸已经基本固定,高质量语料数据也已基本被挖掘,训练数据的翻倍增长已难以实现。因此,重点转向了强化学习,特别是在使用A模式后,可以无限增加高质量的强学习数据。此外,提到了OpenAI通过使用MOE等方法进行了优化,导致其算力成本下降,使得算力需求增长中的性价比降低。最后,强调了推理阶段的算力需求增长仍然可观,尤其是在传统行业开始转向智能化的背景下。35:13大模型价格调整与行业竞争策略讨论集中在AI模型,特别是GMI和G4等模型的市场竞争力、价格策略及其在行业中的地位变化。随着技术的普及,原先在非推E和CE模型中处于领先地位的模型,如4O和O3,不再独一无二,其领先优势被削弱。GMI在使用体验和性能上与之相当,且对普通用户免费,这使得市场竞争更加激烈。此外,G4模型的API价格比竞争对手高出一倍,反映出企业在定价策略上的考量,包括对自身模型的信心和对市场定位的理解。模型价格的下调被视为行业内的常规商业规律,随着模型寿命进入后期,研发成本摊销完毕,成本主要由GPU和电力构成,这可能促使价格下调以保持竞争力。37:23 AI模型研发竞争与挑战探讨对话讨论了AI模型研发中的竞争态势,特别是关于参数量稳定在一万多亿的情况下,国内厂商在未来两三年内是否可能超越北美厂商。提到了一个案例,即某公司在正确的时间点和研发路线推出具有竞争力的产品,直接冲到行业前三,与当时的顶尖模型水平相当。此外,对话还分析了某公司在模型研发上可能遇到的技术和企业文化问题,以及新团队引入后可能带来的改变,强调了管理模式和开发模式的重要性。46:32 AI Agent在国内外的研发进展与应用差异对话主要围绕AI Agent在国内外的研发进展及应用差异展开。讨论指出,从海外的A检测原理和进展来看,AI Agent在年化收入和估值上增长迅速,而国内原生AI Agent的增长情况则相对较为缓慢。分析认为,这主要归因于国内外互联网生态的不同,特别是APP化与网页化操作的差异。国外大量操作和搜索可在网页端完成,而国内则多依赖APP和小程序,这限制了AI Agent在国内的应用场景和效果。此外,提到了大模型研发、AI编程能力的重要性以及其在自动化任务中的潜力。尽管研发模式上国内外差异不大,但应用落地的场景和最终效果受到互联网生态的显著影响。52:32 AI技术在国内外的应用与发展前景对话讨论了AI技术在国内外的应用和经济影响,特别是在北美和中国的人工智能发展情况。提到了北美地区由于人工成本较高,AI技术在取代人工、提升效率方面发展迅速,而中国则因为人工成本相对较低,AI技术的推动动力较小。此外,还讨论了AI技术在大厂中的应用,如自动化任务、提升工作效率,以及AI在招聘和人力资源管理中的影响。最后,对国内AI模型的发展表达了信心,预测下半年将有突破,并提出了关注投资机会的建议。发言总结发言人2他对人工智能领域,尤其是大模型技术的现状与挑战进行了深入探讨。首先,他指出当前大模型技术还未展现出显著的板块性进展,特别强调了在工具调用、互联网搜索方面的局限性,以及安全性和隐私问题的不足关注。他强调了高算力对于提升模型性能的关键作用,并提到了多GPU并行处理在加速模型训练中的应用,同时讨论了模型推理效率与回答有效性之间的关系,以及利用最新网络资源在训练中的重要性。他还提到了一些公司在特定领域开发的垂直领域模型,并分析了行业趋势,包括模型成本的预期下降以及随着国内算力增加,模型水平可能趋同的情况。此外,他对比了国内外互联网在APP化、私有化方面的不同研发模式。尽管未出现标志性模型,他仍然对参与者表示感谢,总结了当前大模型技术的发展状况与面临的挑战,以及未来可能的发展方向和趋势。发言人1首先主持并介绍了本次电话会议,明确指出会议仅面向机构投资者或受邀客户,并强调发言内容仅代表个人观 点,不构成具体投资建议。此外,提醒听众未经合法授权严禁录音转发,违反者将承担法律责任。他指出,尽管A股和港股的AI板块近期表现平淡,但美国批准H20芯片出口许可的消息预示着未来国内AI板块可能受到正面影响。随后,他深入分析了大模型的进展及国内AI板块的未来趋势,分享了对AI应用和投资机会的看法,并回答了听众的提问。最后,他感谢大家的参与,并祝愿大家愉快。问答回顾未知发言人问:在AI板块方面,近期有哪些边际变化引起了市场的关注?发言人1答:近期A股和港股的AI板块出现大幅反弹,国内市场对AI板块的关注度显著恢复。这主要是由于美国批准了H20芯片的出口许可,使得国内厂商能够陆续获得前期订购的一些HR明芯片。此外,海外科技大厂的模型团队有资深工程师分享了海外大模型的进展,市场因此对整个AI板块的情绪和关注度有所提升。未知发言人问:前期国内AI板块表现平淡的主要原因是什么?发言人1答:前期国内AI板块表现平淡的主要原因是国内模型进展相对一般,特别是在二季度,市场普遍认为其受限于高端算力的影响。同时,A中心在大模型方面的进展也不显著,缺乏板块性的重大突破。未知发言人问:高克四模型及其他大厂近期有何重要动向?发言人1答:高克四模型以及其他大厂最近发布了新的研究成果,训练方式上开启了一种新的方法,该方法之前难以在国内复刻。好消息是H20显卡可能在国内投入使用后,国内AI厂商也能采用类似光四的训练方法。发布会上,该模型在多个评测任务上取得了优异成绩,如通过调用工具达到了接近50分的成绩,并在图形识别、数学编程等高难度测试中超越了GPT-3的水平。同时,该模型从训练阶段就加入了原生AI能力,并在后训练强化学习阶段强化了RL能力,整体上展现了强大的推理能力和在特定任务上的优秀表现。发言人1问:在AI模型训练中,为什么堆叠长度达到一定程度后会遇到瓶颈?发言人1答:当AI模型在控制一定长度的基础上进行堆叠,例如从4000堆到8000时,推理时间可能会增长一倍,但回答的有效性并未同步增长,甚至可能已经到达饱和阶段。发言人1问:高斯在强化学习方面采取了何种创新策略?发言人1答:高斯通过在新的维度上堆砌强化学习算力,具体表现为将多个推理模型以agent和工具教育的方式并行调用,以提高处理复杂任务的能力。例如,在构建电商网站时,可以同时调用多个推理模型共同思考,并结合联网搜索功能获取最新信息以满足客户需求。发言人1问:高斯如何利用并行计算和联网搜索优化模型训练过程?发言人1答:在训练过程中,高斯利用并行执行八个推理模型,将它们的结果进行对比校验,选取其中表现最好的模型作为最终输出。同时,在训练阶段,还能联网搜索最新的算法框架,确保模型能够使用最优的方法来解决问题,从而在保持同等效果的同时,显著提升了训练效率。未知发言人问:这种并行计算和联网搜索的方法是否解决了传统离线训练的局限性?发言人1答:是的,这种方法有效避免了传统离线训练对算力消耗大的局限性,尽管单个模型可能需要花费更多的时间和资源(比如比GPT-3模型多出十倍的算力),但通过并行计算和实时搜索网络资源,成功弥补了训练数据的独特性和短板问题。发言人1问:高斯的最新进展及其对未来AI行业的影响是什么?发言人1答:高斯最新的模型版本预计将在夏天发布,虽然当前性能可能未达到预期,但其训练方法和对原生多模态输入的支持对整个行业具有重大意义。此外,该公司拥有的强大训练资源使其在视频生成领域具备显著优势,而下一代模型MI3虽预计接近年底才推出,但有望带来更为突破性的进展。未知发言人问:模型厂商是否会在类似glk新模型的强化学习环节中加入ov ggt进行推理,以及跟进的门槛和难度体现在哪些方面?未知发言人答:大部分厂商可能会跟进类似glk新模型的强化学习环节,加入ov ggt以提升模型的推进能力。虽然每家厂商可能会有一些不同的尝试,但核心都是将思维链的数据加入到强化学习中。因此,对于各家模型厂商来说,跟进这个方式的门槛和难度并不高,关键在于如何有效利用合成数据来增强模型性能。发言人1问:在AI技术的发展中,推理模型训练时增加原生IT工具和联网搜索的功能对计算难度的影响如何?发言人1答:当推理模型训练过程中加入原生的IT工具调研和联网搜索功能时,虽然在计算难度上并没有太大挑战 性,但这一做法有助于提升数据质量。早期投入强航学习的海外厂商如openAI在国内的TT等在退运模型上具有优势,但在联网搜索功能的应用上,由于大家都在同一个互联网环境中,数据质量优势会减小,此时各家厂商研发的差别主要体现在算力上的约束和限制。发言人1问:目前各家在算力方面的差异体现在哪些方面?发言人1答:各家算力上的主要区别在于硬件资源的拥有量和使用效率。例如,某厂商(boss)凭借其老板的强大影响力,在半年内购买了大量H100和B100混合卡构建了大规模训练集群,并实现了在北美地区单级群中较为罕见的集群规模。而其他国内厂商并非都能做到如此大规模的咨询。未知发言人问:强化实施调教在AI技术中的地位及各家的发展情况如何?未知发言人答:强化实施调教是一种重要且各家都在探索的技术,目前在工程积累上已有一定进展,大约快一年的时间,其在loss控制等方面已经取得成熟进展,预计将成为各家都会跟进的重要方向。未知发言人问:今年算力需求增长的具体情况是怎样的?有多少需求来自自身发展?未知发言人答:算力需求增长可分情况讨论,每家厂商投入方式不同,但总体上推动生成的增长幅度略大于训练需求增长。训练需求增长的主要因素包括模型尺寸大小、训练数据量以及总训练算力消耗。目前,大部分厂商采用ME架构,模型尺寸趋于稳定,且国内外厂商在训练阶段的算力消耗已不会明显增长。然而,在强化学习领域,尤其是通过快速迭代和强化学习的增强,训练阶段的算力需求仍可能有所上升,但增加的幅度有限。此外,推理阶段的需求随着AI技术在各行业广泛应用而迅速增长,预计一年内可能翻4至2倍。发言人1问:OpenAI的talking价格下降的原因是什么?是否与Moe和其他优化方法有关?发言人1答:OpenAI taling价格下降有多方面原因,包括其领先性优势不再独一无二。之前无论是GPT-4还是GPT-3,在非推E和CE模型中,OpenAI的模型性能最强。而现在,随着GPT-3模型性能提升,与其他模型差距缩小,加上之前对普通用户的免费使用政策,导致OpenAI对API定价策略进行调整,新的定价策略可能更注重市场策略和模型信心,而非单纯降低推理成本。发言人1、发言人2问:在模型寿命进入后下半程时,价格是否会下降?发言人1、发言人2答:是的,当模型进入寿命的后下半程时,由于前期的研发成本已摊销,剩余成本主要是GPU和电力消耗,因此我们可以预期模型的价格会下降,这将成为一个常规的商业行业规律。未知发言人问:如果训练方法和参数保持稳定,未来国内有足够的计算卡资源,各大模型水平相近,是否会爆发类似LLM的黑马事件?发言人1答:我们会认为这种情况是有可能发生的。在行业发展到白热化竞争阶段时,如果有公司能在产品研发节奏、调教优化或数据处理等方面取得突破,就有可能在国内厂商中超越北美,甚至达到行业