2026/08/0414:31 要点 1.公司大模型战略从追赶LLM榜单转向“中上等智能+成本断层优势”,核心考核指标由技术排名转为“任务成功率”,重点投入视频多模态与Agent/Coding领域。 2.豆包模型架构优化及未来自研seedChip芯片优化,实现输入6元/输出30元每百万token的极低定价,成本约为常规模型的1/7。 3.未来6-12个月策略重心为赋能B端,通过豆包企业版深度整合飞书知识库,并拓展智能座舱、AI眼镜等硬件集成场景。 以下为专家观点 Q&A 请介绍一下当前豆包大模型的整体情况及其发展策略? 豆包背后的大语言模型,包括seed2.1、2.0及更早的1.6版本,在客观性能上,尤其与KIMI的K3等模型相比,并不具备强大的市场竞争力,在长文本和代码能力方面存在明显短板。 其优势主要体现在两个方面:首先是价格便宜,输入定价为6元/百万token,输出为30元/百万token。其次,真正的核心优势在于其多模态模型,即C-down和C-rim模型。这些模型在TTS(文本转语音)、原生动画、口型情绪同步等方面的能力处于全球领先水平,甚至在某些方面优于Sora背后的模型。 基于此,公司采取了“错位竞争”的战略。具体而言,公司放弃了在LLM领域追赶榜单的策略,转而聚焦于“中上等智能+成本断层优势”,并致力于在Agent与Coding的交付能力以及视频与多模态领域实现反超。对于基础大模型,定位是确保其能够稳定运行并被企业客户嵌入到现有工作流中,核心目标是保障Trae、巨量引擎、TikTok智能客服等内部业务的正常使用和数据闭环,维持业务工具流的连续性。公司将节省下来的资源和资金重点投向视频和多模-态模型,因为这不仅是公司的业务根基,也能够通过内部生态(如巨量引擎、TikTok电商)形成商业化闭环,为客户创造价值。 在放弃追赶LLM榜单的策略下,公司如何评估自身LLM的价值?其核心考核指标是什么? 公司评估LLM价值的核心在于“任务成功率”,即以每百万token合计36元(输入6元+输出30元)的成本,能为客户创造多少实际价值。这一定位与KIMI等致力于对标GPT-5.6或ClaudeOpus5的顶尖实验室模式不同,公司没有对标顶尖模型的压力,而是专注于让token的价值最大化。 具体的考核指标与应用场景紧密结合,而非单纯的技术榜单排名。例如,在Trae这款产品中,会关注用户消耗C2.1模型的token量、用户粘性、生成的代码库规模、后台日志中的失败重试率、Agent调用工具的成功率,以及在接入电商工作流后相关的投诉工单数量。这些指标直接反映了模型在实际业务中的效能和价值,而上下文长度、代码生成能力等通用指标则不是当前阶段的考核重点。 在与应用场景捆绑的考核体系下,豆包模型相较于竞品在用户粘性和Agent成功率等指标上表现如何? 在应用层面,像Trae这样的产品通常会接入多种模型,包括开源和闭源模型,因此豆包模型的用户粘性会被其他模型分流。然而,豆包App是一个特例,其背后仅使用自家的C系列模型,因此是体现模型粘性的最主要阵地。 从用户使用习惯来看,市场呈现出差异化:豆包App对应的是高频、碎片化的使用习惯;DeepSeek则更适用于低频、深度思考和编程等专业场景;千问模型则相对中规中矩,特色不明显。在Agent和Coding这类对模型能力要求较高的场景中,用户更倾向于选择KIMI(K3、K2.6)或千问。特别是在专业的编程领域,C系列模型并不占优势,专业程序员较少选择其作为编程辅助工具。 既然Agent和Coding能力是公司的战略方向之一,但当前模型在这些方面似乎并未超越竞品,这是否存在矛盾? 尽管在通用能力上,豆包的Agent和Coding能力与竞品相比没有显著优势,但这并不意味着公司放弃了这些领域。公司的策略是聚焦于特定场景的交付能力,而非追求通用能力的全面领先。例如,在Trae这款产品中,虽然用户可以调用其他更强的模型,但公司关注的是自身模型在特定工作流中的嵌入和优化。 公司的核心目标是确保模型能够满足内部业务(如巨量引擎、TikTok电商)的需求,并能顺利交付给企业客户,嵌入其工作流程。这意味着公司更看重模型在特定垂域数据和业务逻辑下的表现,以及与内部工具链的协同效应。虽然在公开的编程或Agent能力评测上不占优,但在公司自身的生态系统内,通过与业务场景的深度结合,模型依然能够发挥其价值。 在当前的技术竞争格局下,如何判断需要补足哪些能力,以及后续是否有能力追赶行业领先者? 并非在所有方面都落后,实际上在特定领域具备优势。例如,豆包的“操控你的电脑”功能用户体验流畅,在该榜单评分很高。其次,在专业软件的工具流与工作流嵌入方面,同样表现优异。根据内部团队发布的评测结果,在工作流榜单上的表现能够优于其他。此外,在一些 公开的工具调用榜单上,能够与GPT-5.5进行对标。因此,的核心优势在于工具调用、工作流嵌入以及整体成本控制。 未来的发展方向和补足短板的战略重点非常明确,将集中资源,而不是分散投入。核心发力点在于Agent和Coding领域,目标是实现生产级够用的“长程Agent”能力。这意味着Agent在与用户的连续对话中不会遗忘记忆,能够准确调用所需工具,并拥有足够长的上下文窗口。这才是真正的战略重点和需要补强的短板。只要将Agent能力打磨好,就能显著提升用户体验,因为用户最终关心的是任务能否完成,即进入“work状态”(此前称为solo状态),而非底层单一能力的强弱。强大的Agent能力如同“一白遮百丑”,能够弥补其他方面的不足,最终决定任务的成功率,这也是衡量工作的决定性指标。 当前的任务成功率具体表现如何? 任务成功率因评测基准而异。以长程Agent(long-contextagent)为例,seed模型能够连续进行9轮迭代,不间断运行18小时来完成一个任务。在此类任务中,的成功率约为78%。作为对比,OpenAI的GPT-4.7模型成功率是82%,比其低大约5个百分点。 在追赶并构建长城Agent能力和工具调用方面,公司具备哪些核心要素或竞争优势? 在追赶并构建长城Agent能力方面主要具备四点核心优势: 第一,拥有独特的生态和数据优势。能够利用巨量引擎、TikTok、抖音等平台开放的接口,实时获取全球最新的事件、信息和社媒动态。这些数据可以被直接导入向量数据库,供大模型进行检索和召回。例如,当需要查询当天发生的重大事件时,模型可以通过内部专设的推送接口直接获取信息,而其他模型如千问可能仍需通过爬取网页的方式进行搜索,因此在信息的及时性、准确性和来源广度上具备显著优势。 第二,领先的工程能力和真实业务场景。拥有强大的产品矩阵作为支撑,例如飞书、剪映、电商后台等,这些产品为模型提供了真实的业务场景和知识向量库。特别是在Traework模式(前身为solo模式)下,沉淀了大量工程师在需求拆解、规划、编码、测试、部署等环节的经验和思考,并将其转化为可供Agent调用的Skill库,为Agent的工作提供了坚实的工程基础。 第三,强大的算力与云环境支撑。拥有自研的云环境和充足的算力资源,这为模型的长期、持续迭代提供了保障。相比之下,一些厂商如智谱、Kimi等缺乏自有云环境,长期来看,其算力资源可能会成为发展的瓶颈,在后续的竞争中逐渐枯竭。 过去公司在工程能力、组织能力、内部生态、算力及成本结构方面具备优势,但其Agent 能力似乎表现不佳,具体原因是什么? 此前Agent能力表现不佳,主要原因在于组织架构和产品生态的协同问题。在组织层面,过去采用“赛马”机制,众多小组为争抢计算等资源而产生内部消耗,研发步调不一,导致研发速度缓慢,模型能力建设呈现碎片化。尽管拥有强大的生态、算力和工程化能力,但由于各个团队未能形成合力,导致最终成果不理想。自2025年1月吴永辉进行组织架构调整后,情况发生了改变。原有的小组被横向整合为三个以项目制运作的虚拟团队:Base团队负责模型基础设施(如KKVCache、PD分离)及芯片适配;Focus团队专注于长文本Agent能力与工具调用;Edge团队则探索下一代前沿模型,如文本、视频及3D模型(此为专家观点,笔者自行确定了下是Base负责工程、数据、测评及当前一代基础模型的稳定研发与交付;Focus集中攻克下一代基础模型的关键能力;Edge则面向更长周期、具有较高不确定性的AGI前沿课题。与此同时,Infra、视觉及多模态世界模型等方向仍保留相对独立的专业团队)。这种新的协作模式取代了内部竞争,使团队能围绕共同的KPI和成果进行高效协作,避免了无效竞争。在产品生态层面,关键的协同工具和接口是近半年才陆续推出的。例如,飞书CLI、TikTok的MCP以及能与飞书文档联通的豆包企业版,都是在2026年三四月份之后才上线的。这些工具的完善,才真正将已有的生态优势转化为了Agent产品的实际能力。因此,核心原因在于组织协同的优化和产品生态接口的打通,这并非单纯的技术问题,而是一个产品与组织逻辑的转变。 豆包模型在成本控制方面具备显著优势,其Token价格较低的具体原因是什么? 豆包模型之所以能实现较低的Token价格,主要得益于四个层面的优化。第一,在模型架构上,采用了稀疏混合专家模型(SparseMOE),其稀疏程度更高,据估算,其成本约为其他常规模型的七分之一。第二,在推理系统工程上进行了深度优化,包括对Prefill和Decode阶段的处理、PD分离技术、KVCache复用、动态批处理以及推理加速框架的应用。第三,在缓存技术方面,通过优化长上下文缓存和提高缓存命中率来降低计算开销。第四,在产品策略上,提供了灵活的档位选择,用户可以根据自身需求调整推理速度和推理强度,从而主动控制成本。这四点共同构成了其低成本的核心原因。 公司在模型架构、推理系统、缓存技术和产品策略上进行的成本优化,其他竞争对手是否也能实现? 理论上,这些优化措施其他公司也可以实施。 为什么公司的大模型产品定价相对便宜?这一定价策略是基于技术优化、市场定位,还是其他厂商尚未关注此领域所致? 公司大模型产品的低价策略并非因为其他厂商没有意识到或关注,而是源于不同的市场定位 和多方面的综合优势。例如,Kimi拥有2.8万亿的参数量,其核心定位是高定价、高价值的产品,而非平民化产品。相比之下,公司与千问、混元模型、DeepSeek等均选择了低价平民路线。 公司之所以能实现更低的定价,主要得益于以下几个方面的“锁”定优势: 第一,技术层面,通过大量RLHF(人类偏好强化学习)训练,模型输出的语言更像人类,从源头上裁剪了冗余输出。模型输出的长度非常精准,减少了许多无意义的“废话”以及内部使用的分词符、分隔符,从而降低了token消耗。 第二,场景与数据层面,缓存复用机制中的私有数据质量很高。虽然混元和千问也有缓存机制,但其数据分别更多地来源于腾讯的游戏、社交媒体数据和阿里云的云厂商数据。公司的缓存数据则主要来自TikTok、今日头条等平台的热门内容、流量趋势和用户热议的语料。这种数据特性使得公司模型的缓存命中率更高,因为其语料库更均衡、更全面,更能贴近普通用户的查询习惯,从而有效降低了token成本。 第三,组织架构与迭代层面,公司拥有高效的组织架构,例如通过双周会、单周会等机制确保了严格的管理和快速的迭代速度。相比之下,阿里巴巴之前的模型研发由达摩院负责,其组织架构调整影响了迭代效率。 第四,硬件层面,自研的推理芯片seedChip这款专为推理设计的处理器将进一步优化成本结构。 请详细解释一下KVCache机制,以及公司如何利用其生态数据优势来提高缓存命中率,从而降低模型推理成本? KVCache是模型推理过程中的一个关键缓存机制,存储在GPU的HBM芯片中,其占用的存储空间与模型权重几乎是1:1的比例。模型在生成回复时,并非每次都从零开始进行完整的推理计算。它会首先在KVCache中查找与输入请求相似的向量。如