Hy4 Preview模型于上周五(28日)发布,略早于花旗原先预期的9月。其总参数量为7,700亿,激活参数量为490亿,虽然看似小于部分同业模型,但较Hy3模型分别增加了近一倍。在编程及智能基准测试中,Hy4Preview表现显著提升,基准排名已可媲美甚至超越同业,尤其在Toolathlon-Verified、PostTrainBench、BioMysteryBench及HorizonMath等测试中表现突出。
花旗认为,尽管模型参数规模是衡量AI能力的重要指标,但腾讯Hy4Preview在参数量相对较小的情况下仍展现出优异性能,表明AI发展路径呈现多元化趋势。未来AI模型将更注重实用性、效率与特定场景的适配性,而非单纯追求参数规模。Hy4Preview在真实工作场景中的任务完成能力提升,反映了行业向生产力工具方向发展的趋势。
该研报重点分析了腾讯Hy4Preview模型的性能表现、技术特点及其在生产力场景中的应用潜力。报告指出,Hy4Preview与CodeBuddy及WorkBuddy的深度整合,使其在编程及工作流自动化任务中表现突出,尤其是在Toolathlon-Verified等基准测试中超越多款同业产品。同时,花旗也对比了Hy4Preview与Hy3的参数规模及性能提升幅度,评估了其技术迭代速度。
当前AI市场呈现技术快速迭代、应用场景不断拓展的特点。大型语言模型虽以参数规模为竞争焦点,但细分领域专用模型正逐渐崛起。腾讯Hy4Preview的发布,体现了企业在AI生产力工具领域的布局加速。花旗观察到,AI模型正从实验室走向企业实际工作流,对特定任务的优化能力成为关键竞争力。Toolathlon-Verified等基准测试的广泛应用,也反映了市场对模型实用性的重视。
花旗在研报中提示,Hy4Preview的参数规模相对较小可能限制其在某些复杂任务上的表现上限。此外,AI模型的持续迭代需要大量算力与数据支持,技术更新速度可能带来投资风险。同时,AI应用落地仍面临企业数字化程度不一、用户接受度差异等挑战。花旗建议投资者关注模型后续迭代进展及商业化落地效果。