AI重点要闻
OpenAI发布GPT-4.1,显著提升代码能力
- GPT-4.1在编程、指令遵循和长文本理解方面有显著提升,上下文窗口最高支持100万tokens。
- GPT-4.1在SWE-benchVerified测试中得分为54.6%,比GPT-4o提升了21.4%,比GPT-4.5提升了26.6%。
- GPT-4.1在Scale’sMultiChallenge基准测试中得分为38.3%,比GPT-4o提升了10.5%。
- GPT-4.1在多模态长上下文理解基准Video-MME中,得分为72.0%,比GPT-4o提升了6.7%。
- GPT-4.1模型系列以更低的成本提供了卓越的性能。
智谱发布GLM-4-32B-0414系列,效果比肩高参数模型
- GLM-4-32B-0414系列模型参数量为320亿,效果比肩OpenAI的GPT系列和DeepSeek的V3/R1系列。
- GLM-4-32B-Base-0414采用15T高质量数据,包含大量推理类的合成数据。
- GLM-Z1-32B-0414通过冷启动和扩展强化学习,显著提升了数理能力和解决复杂任务的能力。
- GLM-Z1-Rumination-32B-0414模型具有沉思能力,通过更长时间的深度思考来解决更开放和复杂的问题。
- GLM-Z1-9B-0414模型在数学推理和通用任务中展现出极为优秀的能力。
豆包发布思考模型Seed-Thinking-v1.5
- Seed-Thinking-v1.5采用MoE架构,总参数量200B,激活参数20B。
- Seed-Thinking-v1.5在AIME2024上取得了86.7分,在Codeforces上取得了55.0分,在GPQA上取得了77.3分。
- Seed-Thinking-v1.5在STEM和编程领域展现出卓越的推理能力,并在非推理任务上展现出显著的泛化能力。
GPT-o3/o4-mini发布,视觉推理能力大幅提升
- o3以十倍o1算力刷新编程、数学、视觉推理SOTA,在多个基准测试中得分均超2700分。
- o4-mini以小巧高效、高性价比的特点脱颖而出,在AIME2025测试中取得了99.5%高分。
- o3和o4-mini在视觉推理上全面超越前代,通过在思维链中用图像进行推理,实现了视觉感知的重大突破。
企业动态
微软发布BitNetb1.582B4T
- BitNetb1.582B4T拥有20亿参数,以1.58位低精度架构原生训练而成,性能直追同规模全精度模型。
- BitNet的非嵌入内存占用仅0.4GB,远低于竞品Gemma-31B的1.4GB和MiniCPM2B的4.8GB。
- BitNet采用定制BitLinear层和W1.58A8配置,避免了传统后训练量化带来的性能损失。
中文最大MCP社区上线
- MCP广场上线近1500多款热门MCP,覆盖搜索、地图、支付、开发者工具等前沿领域。
- MCP实现了与供应商解耦的开发,开发者可以无缝调用任何MCP服务器。
- MCP让工具天生具备AI驱动的能力,简化开发者的集成工作。
OpenAI发布CodexCLI工具
- CodexCLI是一款轻量级终端运行编码智能体,可以直接在用户的计算机上工作。
- CodexCLI旨在最大化o3和o4-mini等模型的推理能力,并即将支持GPT-4.1等额外的API模型。
- CodexCLI是一种理解并执行仓库的聊天驱动开发工具。
AI行业洞察
智谱启动IPO程序
- 智谱在北京证监局办理辅导备案,计划于2025年10月完成辅导计划,进行考核评估,做好首次公开发行股票并上市申请文件的准备工作。
OpenAI收购Context.ai团队,发力AI评估赛道
- OpenAI收购Context.ai团队,后者是一家以评估和分析AI模型见长的初创公司。
- Context.ai的联合创始人将加入OpenAI,专注于研发模型评估工具。
- 此次收购正值AI行业竞争加剧之际,OpenAI希望通过引入专业评估人才,与Anthropic和谷歌等对手拉开差距。
技术前沿
Video-R1:7B参数模型视频推理能力超GPT-4o
- Video-R1模型将强化学习的R1范式应用在视频推理领域,在VSI-Bench基准中超越了GPT-4o。
- Video-R1模型采用Qwen2.5-VL-7B作为基础模型,分两个阶段进行训练:SFT冷启动和RL训练。
- Video-R1在多个视频推理测试基准上表现出色,尤其在VSI-Bench这一权威评测中,它拿下了35.8%的准确率。
华为发布密集模型盘古-Ultra
- 盘古Ultra模型参数量只有135B,且整个训练过程零英伟达含量,最终模型在数学竞赛、编程等推理任务当中,和R1水平相当。
- 盘古Ultra在预训练阶段模型的评测中,在绝大部分英文基准任务和全部中文任务上取得了最佳性能,优于Llama405B、DeepSeek-V3等baseline模型。
- 盘古Ultra在模型架构上做出了两个关键改进:深度缩放的Sandwich-Norm层归一化和TinyInit参数初始化策略,有效稳定了训练过程。