AI重点要闻
深扒DeepSeek-R1思维链,带动思维链学
- 魁北克人工智能实验室等机构深度剖析DeepSeek-R1大模型的思维链,发现其存在“推理甜点区”,过多推理反而损害性能。
- 模型倾向于反复沉溺在已探索的方案中,阻碍进一步探索。
- 相比不具备推理能力的版本,DeepSeek-R1展现出更高的安全风险。
- DeepSeek-R1的训练基于DeepSeek-V3,训练过程包括强化学习、SFT(监督微调)和GRPO(基于人类反馈的强化学习)等步骤。
- DeepSeek-R1的思考过程包含四个步骤:问题定义、绽放周期、重构周期和最终决策,体现了“反刍式思考”。
DeepMind推出QuestBench基准
- DeepMind推出QuestBench新基准,通过约束满足问题(CSPs)框架评估模型在推理任务中识别和获取缺失信息的能力。
- QuestBench覆盖逻辑推理(Logic-Q)、规划(Planning-Q)和小学数学(GSM-Q/GSME-Q)三个领域,按变量数量、约束数量、搜索深度和暴力搜索所需猜测次数四个难度轴分类。
- QuestBench测试了包括GPT-4o、Claude3.5Sonnet、Gemini2.0FlashThinkingExperimental等领先模型,测试于2024年6月至2025年3月间进行。
英伟达推出Eagle-2.5、DAM-3B模型
- 英伟达推出专注于长上下文多模态学习的视觉-语言模型(VLM)Eagle-2.5,以及为应对图像和视频中特定区域的详细描述难题而开发的模型DAM-3B。
- Eagle-2.5在Video-MME基准测试(512帧输入)中得分高达72.4%,媲美更大规模模型。
- Eagle-2.5的成功得益于信息优先采样和渐进式后训练等关键训练策略,以及SigLIP视觉编码和MLP投影层。
- DAM-3B支持用户通过点、边界框、涂鸦或掩码指定目标区域,生成精准且贴合上下文的描述文本。
国产大模型ViduQ1登顶视频生成榜
- 生数科技旗下的国产视频大模型ViduQ1在VBench-1.0和VBench-2.0中超越Sora、Runway等顶尖模型,勇夺文生视频赛道双榜第一。
- ViduQ1在视频生成逼真度、对象/场景生成、视频语义一致性等方面表现突出,且内容真实性高,费用低廉。
企业动态
OpenAI推出轻量化深度研究工具
- OpenAI为ChatGPTPlus、Team和Pro用户推出轻量级深度研究工具,面向ChatGPT免费用户也推出该功能。
- 轻量级深度研究工具基于o4-mini模型开发,功能略逊于完整版本,但成本更低,帮助OpenAI提升用户使用限额。
讯飞星火X1升级,对标DeepSeek-R1
- 科大讯飞星火X1全新升级,定位为“当前业界唯一的基于全国产算力训练的深度推理大模型”。
- 升级后在多个任务上效果显著提升,整体效果对标OpenAIo1和DeepSeekR1。
- 星火X1融入更多场景复杂类型数据,泛化性取得进步,在多个行业任务上展现领先能力。
- 星火X1首发快思考、慢思考统一模型,由一个模型同时支持两种思考模式,私有化部署简便。
昆仑万维开源SkyReels-V2模型
- 昆仑万维发布并开源SkyReels-V2,全球首个使用扩散强迫(Diffusion-forcing)框架的无限时长电影生成模型。
- SkyReels-V2结合多模态大语言模型(MLLM)、多阶段预训练(Multi-stagePretraining)、强化学习(ReinforcementLearning)和扩散强迫框架实现协同优化。
- SkyReels-V2使用了综合视频描述设计,多阶段预训练,后期训练优化技术,以及扩散强迫框架。
AI行业洞察
全球首个行动浏览器Fellou发布
- Fellou开创了第四种浏览器:AgenticBrowser行动型浏览器,集成了具备思考和行动能力的智能代理。
- Fellou主要由四大核心能力组成:深度行动、主动智能、混合影子空间和智能体网络(AgentStore)。
Meta发布Token-Shuffle,突破自回归瓶颈
- MetaAI推出Token-Shuffle方法,解决自回归模型在生成高分辨率图像方面的扩展难题。
- Token-Shuffle通过识别多模态大语言模型(MLLMs)中视觉词汇的维度冗余,提出了一种创新策略:在Transformer处理前,将空间上相邻的视觉token沿通道维度合并,推理后再恢复原始空间结构。
- Token-Shuffle大幅降低了计算成本,在保持视觉质量的同时,让自回归模型能够高效处理最高2048×2048分辨率的图像。
技术前沿
Valuesinthewild:Claude价值观研究
- Anthropic创始团队研究Claude与人类交互过程中用的哪种价值观,发现Claude中包含的价值观超过3000种。
- 研究提出了一种自下而上、隐私保护的方法来提取和分析Claude3和3.5模型在实际交互中表现出的价值观。
- 研究发现AI价值观主要分为实用、认知、社会、保护和个性化五个类别,且在不同任务中表现出显著的任务依赖性。
模型能力提升:采样越多模型越强
- 来自谷歌和伯克利的华人研究员发现,随着采样数量和验证强度的增加,模型的推理性能有显著的提升。
- 研究人员提出了一种基于采样的搜索策略,通过候选生成、自我验证和隐式扩展机制实现高效推理。
- 研究发现验证能力是搜索策略的核心瓶颈,通过隐式扩展和结构化改写可显著提升性能。